遇见数据集

electricsheepasia/asia-ilo-ear-emta-sex-edu-cur-nb-average-monthly-earnings-of-employees-by-sex-educa

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含28,053个观测值,涵盖27个亚洲国家从1996年至2025年的员工月平均收入数据,按性别、教育和货币单位细分。核心指标为EAR_EMTA_SEX_EDU_CUR_NB,表示按性别、教育和货币分类的员工月平均收入。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过标准化处理,并通过Electric Sheep Asia重新打包为机器学习就绪格式。数据集适用于表格分类、回归和时间序列预测等任务,支持多维度分析,如国家、年份、性别和教育水平。

This dataset contains 28,053 observations of average monthly earnings data for employees across 27 Asian countries, spanning from 1996 to 2025, disaggregated by sex, education, and currency. The core indicator is EAR_EMTA_SEX_EDU_CUR_NB, which represents average monthly earnings of employees by sex, education, and currency. Sourced from the International Labour Organization (ILO) ILOSTAT database, the data is harmonized and repackaged by Electric Sheep Asia into a machine-learning-ready format. It is suitable for tabular classification, regression, and time-series forecasting tasks, supporting multidimensional analysis such as by country, year, sex, and education level.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emta-sex-edu-cur-nb-average-monthly-earnings-of-employees-by-sex-educa 数据集图片
构建方式
本研究数据集源自国际劳工组织(ILO)的ILOSTAT权威统计数据库,经由Electric Sheep Asia团队通过REST API接口直接从数据源获取。原始数据基于国际劳工统计学家会议(ICLS)定义的标准,对各国劳动力调查、家庭收入调查、企业调查及行政记录等微观数据进行严格的协调与统一处理。随后,数据被限定至27个亚洲国家的ISO3代码范围,最终形成了包含28,053条观测记录的标准化表格数据集。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数一键加载该数据集,并将其转换为Pandas DataFrame进行后续操作。通过筛选ref_area字段可定位特定国家的子集;利用indicator字段配合sort_values方法可提取单个指标的时间序列数据,便于可视化分析;借助pivot_table函数能够构建以年份为行、国家为列的矩阵结构,从而支持跨国横向比较与面板数据分析。所有操作均无需手动下载文件,极大简化了数据探索流程。
背景与挑战
背景概述
该数据集源于国际劳工组织(ILO)的ILOSTAT数据库,由Electric Sheep Asia于2025年重新整理并发布于HuggingFace平台,聚焦亚洲27个国家1996至2025年间按性别、教育水平及货币分类的员工平均月收入。作为全球劳动统计的权威来源,ILOSTAT通过整合劳动力调查、家庭收入调查及行政记录数据,为研究亚洲劳动力市场中的收入不平等、教育回报率及性别薪酬差距提供了精细化的跨国面板数据。该数据集共包含28,053条观测,覆盖1996-2025年的时间跨度,填补了亚洲区域收入数据在性别与教育维度上长期缺乏标准化、可机读资源的空白,推动了劳动经济学与区域发展研究的实证分析效率。
当前挑战
该数据集面临的挑战首先体现在领域问题的复杂性:亚洲各国经济发展阶段、劳动市场制度及货币体系差异显著,导致收入数据的跨国可比性不足,尤其需处理通货膨胀调整、购买力平价转换及教育分类标准不一致等内生性难题。在构建过程中,ILOSTAT需面对多源数据融合的困境,例如各国劳动力调查的定义、抽样方法及统计口径不一,需通过国际劳工统计师会议(ICLS)标准进行调和,但部分国家的数据仍存在序列中断、观测状态标记为“暂定”或“不可靠”的质量问题。此外,数据的时间频次仅为年度,缺失月度或季度波动信息,限制了短周期经济冲击对收入影响的动态分析能力。
常用场景
经典使用场景
在劳动力经济学与公共政策研究领域,该数据集的核心应用场景在于揭示亚洲地区不同性别与受教育程度劳动者的收入分布格局。通过覆盖27个国家近三十年的月度平均薪酬观测值,研究者能够借助时间序列分析与面板数据回归,细致刻画性别工资差距的演变轨迹,并评估教育回报率的跨国异质性。数据集提供的性别与教育水平分层维度的离散化特征,使得构建多因素交互效应模型成为可能,从而为理解劳动力市场中结构性不平等现象提供坚实的数据基础。
解决学术问题
该数据集有效回应了发展经济学与劳动经济学中若干悬而未决的学术命题。它使得学者能够系统性地检验人力资本理论在亚洲语境下的适用性,即教育投资是否显著提升个体薪酬水平,以及这种效应是否因性别而存在显著差异。同时,通过追踪1996年至2025年的长时序数据,研究人员可以量化经济转型、全球化冲击以及政策干预(如最低工资制度)对劳动者收入的影响,进而为验证库兹涅茨曲线假说或结构性失业理论在亚洲地区的表现形态提供实证支持。
实际应用
实际应用层面,该数据集为国际组织、政府机构及非营利部门制定精准化劳动政策提供了数据驱动的决策工具。例如,国际劳工组织可利用其监测可持续发展目标中关于体面工作和经济增长的进展,特别是指标8.5(实现充分和生产性就业,确保同工同酬)的达成情况。国家层面的劳动部门可借助这些数据识别薪酬歧视高发行业,设计针对性职业培训项目或调整教育投入方向。此外,跨国企业将其纳入人力资源分析中,有助于优化区域薪酬基准,促进劳动力市场的包容性发展。
数据集最近研究
最新研究方向
在当前全球劳动力市场重构与性别平等议程深化的背景下,该数据集为亚洲地区基于性别与教育维度的收入差异研究提供了关键的纵向证据。前沿研究方向聚焦于解析教育回报率的性别异质性及其时间演化轨迹,结合ILOSTAT跨30年、覆盖27国的面板数据,研究者可量化教育扩张对缩小性别工资差距的边际效应,并识别不同经济周期中劳动力市场制度的调节作用。该数据集与ILO倡导的体面劳动目标及联合国SDG 8(体面工作与经济增长)紧密联动,其分货币与教育分类的精细化架构为评估亚洲各国人力资本投资的社会回报率、揭示隐性劳动歧视现象以及构建跨国比较的工资决定模型提供了方法论基础,对于推动发展中国家基于证据的就业政策制定具有显著学术与实践价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务