遇见数据集

electricsheepasia/asia-ilo-ear-emtm-sex-edu-cur-nb-median-monthly-earnings-of-employees-by-sex-educat

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为Median monthly earnings of employees by sex, education and currency | Asia (ILOSTAT),是一个表格数据集,专注于亚洲地区员工的月收入中位数分析。数据集包含28,053个观察值,覆盖27个亚洲国家,时间跨度为1996年至2025年,涉及1个核心指标:EAR_EMTM_SEX_EDU_CUR_NB,即按性别、教育和货币分类的员工月收入中位数。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,该数据库是全球劳工统计的主要来源,通过国家劳动力调查、家庭收入调查、机构调查和行政记录等渠道收集数据。数据集的结构包括多列,如国家代码(ref_area)、来源信息(source)、指标代码(indicator)、性别分类(sex)、教育分类(classif1)、货币分类(classif2)、观察年份(time)、观察值(obs_value)等,并提供了数据质量说明,例如数据为年度频率,并使用ILO选定的最佳来源。数据集旨在支持表格分类、回归和时间序列预测等任务,适用于研究和机器学习应用。数据集由Electric Sheep Asia重新打包,以标准化模式发布,便于使用Hugging Face的load_dataset()函数加载。

The dataset named Median monthly earnings of employees by sex, education and currency | Asia (ILOSTAT) is a tabular dataset focused on the analysis of median monthly earnings of employees in Asia. It contains 28,053 observations covering 27 Asian countries from 1996 to 2025, with one core indicator: EAR_EMTM_SEX_EDU_CUR_NB, which represents median monthly earnings of employees disaggregated by sex, education, and currency. The data is sourced from the International Labour Organizations (ILO) ILOSTAT database, a leading global source for labour statistics that compiles data from national labour force surveys, household income surveys, establishment surveys, and administrative records. The dataset schema includes columns such as country code (ref_area), source information (source), indicator code (indicator), sex classification (sex), education classification (classif1), currency classification (classif2), observation year (time), observed value (obs_value), among others, and provides data quality caveats, such as annual frequency and the use of ILO-selected best source. It is designed for tasks like tabular classification, regression, and time-series forecasting, suitable for research and machine learning applications. The dataset is repackaged by Electric Sheep Asia with normalized schemas for easy loading via Hugging Faces load_dataset() function.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emtm-sex-edu-cur-nb-median-monthly-earnings-of-employees-by-sex-educat 数据集图片
构建方式
该数据集由国际劳工组织(ILO)的ILOSTAT数据库提供,收录了亚洲27个国家在1996年至2025年间的员工月收入中位数数据,共计28,053条观测值。数据通过ILOSTAT的REST API直接拉取,并筛选出亚洲ISO3国家代码对应的记录。ILOSTAT采用国际劳工统计学家会议(ICLS)定义的标准对原始调查微观数据进行统一处理,数据来源在 `source.label` 列中予以标注,确保可追溯性。Electric Sheep Asia团队对该数据进行了重新封装,使其可直接通过HuggingFace的 `load_dataset()` 函数加载使用。
使用方法
用户可通过Python的 `datasets` 库轻松加载该数据集,调用 `load_dataset()` 方法即可将其转换为Pandas DataFrame格式,方便进行后续的数据探索和处理。针对特定国家的分析,可通过 `ref_area` 列进行筛选,例如筛选印度尼西亚(IDN)的数据。对于时间序列建模,用户可对 `time` 列进行排序,并选取特定的 `indicator` 值进行可视化或预测。此外,可利用 `pivot_table` 方法将数据重塑为国家×年份的矩阵形式,以进行跨区域的面板数据分析。数据集兼容表格分类、回归和时间序列预测等多种机器学习任务。
背景与挑战
背景概述
在劳动经济学与可持续发展目标(SDGs)的研究中,薪酬数据的性别与教育维度差异是衡量劳动力市场公平性的核心指标。国际劳工组织(ILO)通过其ILOSTAT数据库系统构建了全球劳动统计体系,而Electric Sheep Asia于2025年将该数据集的亚洲子集进行了重新整理与标准化发布。该数据集以27个亚洲国家为地理范围,覆盖1996年至2025年的年度观测值,聚焦于按性别与教育水平分类的员工月收入中位数,为跨国家时间序列分析与面板数据建模提供了关键资源。作为连接微观调查与宏观比较的桥梁,该数据集推动了亚洲劳动力市场中性别薪酬差距与教育回报率的量化研究,对政策评估与国际比较具有重要学术价值。
当前挑战
该数据集旨在解决亚洲劳动力市场中薪酬数据的碎片化与不可比问题,具体包括:统一不同国家的调查方法(如劳动力调查、企业调查)与ILO定义的协调,处理多来源数据中因统计口径变化导致的序列断裂标记,以及应对大量缺失值对时间序列完整性的影响。在构建过程中,数据集面临原始ILOSTAT API响应中分类维度的非一致性问题,例如性别(SEX_T/SEX_M/SEX_F)与教育分类(EDU_AGGREGATE_TOTAL)的层级编码需要标准化映射。此外,部分国家长期数据条目稀疏,如年份跨度短、来源注释复杂(如货币单位转换与教育水平非标准定义),增加了多国可比性与模型输入预处理的难度。
常用场景
经典使用场景
该数据集收录了1996年至2025年间亚洲27个国家的雇员月收入中位数数据,按性别、教育程度和货币类型进行了细致划分,共计28,053条观测记录。在劳动经济学与人力资本研究中,研究者常利用这一数据构建面板回归模型,探究教育回报率的国别差异、性别收入差距的长期演变趋势,以及宏观经济政策对工资水平的异质性影响。通过将obs_value字段与ref_area、time等维度结合,可以开展跨国比较的时间序列分析,进而识别亚洲区域内劳动市场的结构性特征与周期性波动。
解决学术问题
数据集的核心价值在于为劳动经济学中一系列经典学术难题提供了实证基础。它有效支撑了教育溢价(education premium)的测算,使研究者能够剥离性别与货币因素,精确评估不同学历层级对薪资水平的边际贡献。同时,凭借跨年度的性别分层数据,该数据集大幅降低了测算性别工资差距时的遗漏变量偏误,为探究'玻璃天花板'效应、女性劳动参与率与薪酬公平性提供了可靠证据。此外,通过纳入多种货币单位,数据集还推动了购买力平价调整方法论的创新,深化了对亚洲发展中国家劳动力市场非正规就业与收入分配不均等问题的理解。
实际应用
在实际应用层面,该数据集为国际组织与政策制定者提供了诊断劳动市场健康状况的量化工具。政府和劳工部门可借助其中断点标记(obs_status字段)与来源注释信息,动态监测最低工资调整政策的实际效果,评估教育投资在缩小收入差距中的边际效用。跨国公司的人力资源部门亦可利用该数据集进行薪酬基准分析,依据不同国家、性别和学历层次的收入分布,制定兼具竞争力与公平性的全球薪酬策略。非营利机构更可基于这些数据,针对亚洲女性的职业发展瓶颈开展靶向干预项目策划。
数据集最近研究
最新研究方向
在亚洲劳动力市场研究中,该数据集为解析性别、教育程度与货币因素对收入影响的复杂交互提供了关键支撑。研究者正借助其丰富的时空维度,聚焦于探讨后疫情时代亚洲各国收入不平等加剧的内在机理,尤其关注女性劳动者与低教育群体在结构性转型中的脆弱性。国际劳工组织(ILO)持续推动的体面劳动议程,使得基于此数据集的跨国比较分析成为评估亚洲区域人力资源政策成效的重要工具,其长期序列数据亦为机器学习模型在预测区域收入动态与设计精准干预措施方面奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务