遇见数据集

electricsheepasia/asia-ilo-ear-emta-sex-age-nb-average-monthly-earnings-of-employees-by-sex-and-a

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了亚洲30个国家从1996年到2025年的员工月平均收入数据,按性别和年龄细分,以当地货币为单位。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲国家,包含12,422个观测值和1个核心指标(EAR_EMTA_SEX_AGE_NB)。数据集以表格形式组织,涵盖国家代码、国家名称、数据来源、指标代码、性别分类、年龄分类、观测年份、观测值、数据状态标志和注释等列。数据经过ILO基于国际劳工统计学家会议(ICLS)定义的统一处理,适用于机器学习任务,如表格分类、回归和时间序列预测。数据集由Electric Sheep Asia重新打包,以Parquet格式发布,便于使用HuggingFace的`load_dataset()`函数加载和分析。

This dataset contains average monthly earnings of employees by sex and age in local currency for 30 Asia countries from 1996 to 2025. Sourced from the International Labour Organization (ILO) ILOSTAT database via API and filtered to Asia countries, it includes 12,422 observations and 1 core indicator (EAR_EMTA_SEX_AGE_NB). The data is organized in tabular format with columns such as country code, country name, data source, indicator code, sex classification, age classification, observation year, observed value, data status flags, and notes. It is harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions and is suitable for machine learning tasks like tabular classification, regression, and time-series forecasting. The dataset is repackaged by Electric Sheep Asia in Parquet format for easy loading and analysis via HuggingFaces `load_dataset()` function.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emta-sex-age-nb-average-monthly-earnings-of-employees-by-sex-and-a 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过其REST API直接提取指标代码为EAR_EMTA_SEX_AGE_NB的观测数据,并依据亚洲ISO3国家代码进行地理过滤。ILOSTAT采用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,数据来源涵盖劳动力调查、家庭收入调查及行政记录,并在source.label列中标注来源以增强可追溯性。最终由Electric Sheep Asia重新封装为12,422条观测记录,覆盖30个亚洲国家,时间跨度为1996年至2025年。
特点
该数据集的核心特点在于其精细的维度拆解能力,提供性别(SEX_T、SEX_M、SEX_F、SEX_O)和年龄组别等多个分类变量,允许用户针对特定细分群体进行分析。数据包含详细的注释字段,如观测状态标识(obs_status)、分类说明(note_classif)及来源注释(note_source),有助于评估数据质量与连续性。此外,数据集采用年度频率,并优先使用ILO选定的最佳来源,确保在数据多元来源情境下的一致性和可靠性。
使用方法
用户可通过HuggingFace Datasets库便捷加载数据,使用load_dataset函数获取训练集并转为pandas DataFrame,便于快速探索。针对单一国家分析,可按ref_area字段过滤;如需时间序列分析,可排序time字段后绘制obs_value变化趋势。对于跨国家比较,推荐利用pivot_table将数据重塑为国家×年份矩阵。此外,数据集支持表格分类、回归及时间序列预测等多种任务,适合劳动经济学研究与政策分析场景。
背景与挑战
背景概述
在劳动经济学与可持续发展目标(SDGs)的研究版图中,薪酬数据的跨国可比性与时序完整性是剖析劳动力市场性别鸿沟、区域发展不均等核心议题的基石。由国际劳工组织(ILO)统计部门创建并维护的ILOSTAT数据库,被誉为全球劳动统计的权威标尺,而亚洲地区薪资数据的碎片化与口径差异长期困扰着研究者。为此,Electric Sheep Asia于2025年对ILOSTAT中EAR_EMTA_SEX_AGE_NB指标进行系统性重包装,构建了涵盖30个亚洲经济体、跨越1996年至2025年的雇员平均月薪数据集。该数据集将12,422条按性别与年龄分层的观测值整合为机器学习的标准化格式,旨在解决亚洲劳动市场中薪酬动态的可访问性与分析门槛问题。凭借其严格遵循ICLS定义的数据对齐流程、对原始调查微数据的溯源标注,该数据集一经发布便成为区域劳动经济学与时间序列预测研究的宝贵资源,有力推动了跨国家庭收入差异、性别工资不平等及劳动力市场结构变迁的量化探索。
当前挑战
该数据集所应对的领域挑战首先体现在亚洲地区薪酬统计数据的异构性上:30个国家的收入信息来源各异,涵盖劳动力调查、家庭收入普查与行政记录,且各国货币单位不一、数据采集周期与分类标准参差,导致跨区域比较时面临单位转换与定义对齐的双重困境。此外,时间序列分析中因调查方法改进或样本更替引发的序列中断(如obs_status字段标记的“Break in series”)以及非标准年龄分组(如note_classif.label所示排除15岁个体的特殊划分),增加了时序建模的不确定性与修正难度。在构建层面,数据集面临的关键挑战包括从ILOSTAT REST API中精准过滤亚洲ISO3国家代码时需规避行政边界变更与历史领土争议,以及处理同一国家-年份存在多个来源时ILO“最佳来源”选择逻辑的透明性维护。这些复杂度通过schema中丰富的note字段保留溯源线索,以支持下游研究者进行鲁棒性评估。
常用场景
经典使用场景
在劳动经济学与发展经济学领域,该数据集最为经典的使用方式是开展跨国跨时期的工资水平动态比较研究。研究人员能够基于ILOSTAT标准化定义下的月均收入变量,构建覆盖30个亚洲国家、时间跨度长达三十年(1996—2025年)的面板数据,系统剖析亚洲劳动市场中的收入演变规律。通过按性别与年龄维度进行数据拆解,学者得以深入探究不同人口亚组在收入增长轨迹上呈现的异质性特征。该数据集为那些致力于理解亚洲地区经济增长与劳动者福利改善关联机制的实证研究,提供了可靠且具备国际可比性的基础数据支撑。
衍生相关工作
围绕该数据集,学术界与实务界已衍生出一系列具有影响力的经典工作。基于类似ILOSTAT数据源的研究系统评估了亚洲经济体在全球价值链嵌入过程中,劳动者的收入所得是否实现了与生产率提升相匹配的增长。部分学者利用该数据构建了贝叶斯层次模型,用以推演缺乏连续调研数据的国家所面临的劳动收入演变路径。另有研究将本数据集与家庭消费调查及跨国企业薪酬数据相联结,发展了劳动市场制度质量指数。在方法论贡献方面,研究人员还开发了针对时序断点与源数据更替情况下的标准化插值技术,极大提升了跨国面板数据分析的稳健性与可复制性。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区雇员平均月薪的性别与年龄分层统计,为劳动经济学中的薪酬差距、代际收入流动及性别平等议题提供了关键量化素材。当前前沿研究方向包括:利用时间序列模型(如Prophet或Transformer架构)预测不同年龄段的薪资演变趋势,并对比性别间的收入分化模式;结合国家发展指标(如GDP、教育投入)构建多因素回归框架,解析亚洲各国薪资差异的结构性成因;在人工智能伦理与公平性研究中,该数据可作为评估算法是否存在年龄或性别偏见的基准测试集。此外,该数据集与ILO倡导的体面劳动目标密切关联,为追踪亚洲区域实现可持续发展目标8(促进包容性经济增长)的进展提供了可重复验证的实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务