遇见数据集

electricsheepasia/asia-ilo-ear-ehra-sex-edu-nb-average-hourly-earnings-of-employees-by-sex-and-ed

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为“按性别和教育程度划分的员工平均小时收入(本地货币)| 亚洲(ILOSTAT)”,包含8,088个观测值,覆盖25个亚洲国家,时间跨度为1996年至2025年。核心指标为“EAR_EHRA_SEX_EDU_NB”,即按性别和教育程度划分的员工平均小时收入(以本地货币计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API直接提取并过滤至亚洲国家。数据集包括多个字段,如国家代码、国家名称、数据来源、指标代码、性别分类、教育分类、观测年份、观测值、观测状态和相关注释。数据以年度频率发布,经过ILO的标准化处理,确保数据质量。该数据集适用于表格分类、回归和时间序列预测等任务,可用于分析亚洲地区劳动力市场的收入差异和趋势。数据集以CC-BY-4.0许可证发布,由Electric Sheep Asia重新打包,便于机器学习应用。

This dataset, titled Average hourly earnings of employees by sex and education (local currency) | Asia (ILOSTAT), contains 8,088 observations across 25 Asian countries, spanning from 1996 to 2025. The core indicator is EAR_EHRA_SEX_EDU_NB, which represents the average hourly earnings of employees disaggregated by sex and education, measured in local currency. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, extracted directly via API and filtered to Asian ISO3 country codes. The dataset includes fields such as country code, country name, data source, indicator code, sex disaggregation, education classification, observation year, observed value, observation status, and related notes. Data is published at annual frequency and harmonized by ILO using ICLS definitions for quality assurance. It is suitable for tasks like tabular classification, regression, and time-series forecasting, enabling analysis of income disparities and trends in the Asian labor market. The dataset is released under the CC-BY-4.0 license and repackaged by Electric Sheep Asia for machine learning readiness.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehra-sex-edu-nb-average-hourly-earnings-of-employees-by-sex-and-ed 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)的ILOSTAT核心统计数据库,旨在提供亚洲地区劳动力市场的重要薪酬指标。构建过程通过调用ILOSTAT提供的REST API接口,直接获取指标代码为EAR_EHRA_SEX_EDU_NB的原始数据,并依据亚洲ISO3国家代码进行严格筛选与过滤。ILO专家对各国调查微观数据进行了统一协调,采用国际劳工统计学家会议的标准化定义,确保跨国可比性。数据集中每一观测值的来源均在source.label字段中清晰标注,以供溯源验证。最终,由Electric Sheep Asia团队将清洗后的数据重塑为便于机器学习应用的格式,并封装为HuggingFace数据集。
特点
该数据集汇聚了1996年至2025年间来自25个亚洲国家的8088条观测记录,是研究亚洲劳动力市场薪酬结构的重要资料。核心特色在于其精细的分层维度:数据按性别(男、女、总计)和受教育程度进行细致划分,揭示了不同人群之间的收入差异。此外,数据结构完整,包含观测值状态标签(如数据中断、临时性等)和详尽的注释信息(如货币单位、教育水平定义),为用户理解数据质量与背景提供了充分支撑。其时间跨度长达近三十年,为纵向比较与趋势分析奠定了坚实基础。
使用方法
借助HuggingFace的datasets库,用户可以极简代码加载该数据集,并便捷地转换为Pandas DataFrame展开分析。推荐按国家代码(ref_area)过滤数据,聚焦于特定国家的微观层面,如印度尼西亚或柬埔寨的薪酬演变。对于时间序列分析,可依据观测年份(time)排序后绘制指标(obs_value)变化曲线,直观呈现长期趋势。用户还可利用数据透视表功能,以时间为行、国家为列构建矩阵,快速展开跨国的横向比较。该数据集亦适用于表格型分类、回归及时间序列预测等多种机器学习任务,契合实证经济学与劳动经济学的研究需求。
背景与挑战
背景概述
在劳动经济学与发展研究领域,薪资水平的性别与教育差异是衡量劳动力市场公平性与人力资本回报的核心指标。国际劳工组织(ILO)下属的ILOSTAT数据库作为全球劳动统计的权威来源,系统整合了各国劳动力调查数据,为跨国比较提供了坚实基础。该数据集由Electric Sheep Asia于2025年重新打包发布,聚焦亚洲地区,涵盖1996年至2025年间25个国家的约8,088条观测记录,核心指标为按性别和教育程度划分的雇员平均小时薪资(以当地货币计)。这一数据集弥补了亚洲地区精细化薪资数据可获取性不足的缺口,为探究经济增长中人力资本溢价、性别工资差距演变以及区域劳动政策有效性提供了关键支撑,对发展经济学、性别研究和公共政策分析具有重要价值。
当前挑战
该数据集所解决的领域问题核心在于,亚洲各国劳动力市场中薪资数据的标准化与跨国可比性极为薄弱,传统统计因调查工具、教育分类体系和货币单位各异而难以整合。数据集构建过程中面临多重挑战:首先,ILOSTAT原始数据来源多样,涉及劳动力调查、家庭收入调查及行政记录,需统一按ICLS定义进行协调与质量控制;其次,25个亚洲国家的数据采集频率、历史覆盖时长与指标细化程度差异显著,例如印度尼西亚贡献1,068条记录而孟加拉国仅250条,需处理不平衡导致的统计偏差;此外,数据中标注了“序列断裂”等观察状态标识,提示因调查方法更迭或教育分类标准变迁带来的时序一致性问题,这对时间序列分析与模型训练构成潜在干扰。
常用场景
经典使用场景
在劳动经济学与教育经济学的前沿研究中,该数据集堪称跨国性别工资差异与教育回报率分析的基石。研究者可借助其时间序列结构,系统性地追踪1996至2025年间亚洲25个国家中按性别与教育水平划分的时薪演变轨迹。典型应用包括运用面板回归模型评估女性受教育程度对收入增长的边际贡献,或通过差分法测度性别工资鸿沟在不同教育层级间的收敛或扩张趋势。数据按ISO国家代码与观测状态标识进行标注,使得缺失值与断点问题得以清晰辨识,为构建稳健的计量模型提供了翔实且可复现的实证基础。
实际应用
在政策制定与企业实践中,该数据集承载着切实的赋能价值。国际组织如国际劳工组织可据此绘制亚洲地区薪资分布的动态热力图,识别出性别薪酬平等进展迟缓的重点国家与教育阶段,进而为技术援助与政策干预指明靶向。各国劳动统计部门能够利用此数据校准本国的最低工资标准与职业培训补贴方案,确保教育投资与市场回报之间的良性循环。对于跨国人力资源机构而言,该数据集则化作市场薪酬对标的高阶工具,辅助企业制定兼顾公平与竞争力的多元化薪酬架构,推动体面劳动原则在亚洲供应链中的实质性落地。
衍生相关工作
围绕这一核心数据资产,学术界已孕育出多项里程碑式的衍生工作。基于其时间序列与多维分类结构,研究者构建了融合性别与教育层级交互效应的多层级增长模型,揭示了亚洲各国工资收敛俱乐部的存在性与决定因素。更为前沿的工作则利用该数据集训练了面向稀缺劳动力统计场景的时序预测模型,借助Prophet与LSTM等方法对缺失年份的时薪数据进行合理估算。国际比较项目中,该指标与教育支出数据、女性劳动参与率面板对接后,催生了针对亚洲经济发展阶段与人力资本形成之间非线性关联的系统性文献综述,显著深化了对新兴经济体劳动力市场转型规律的理论认识。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务