遇见数据集

electricsheepasia/asia-ilo-ear-emtm-sex-eco-nb-median-monthly-earnings-of-employees-by-sex-and-ec

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的按性别和经济活动划分的员工月收入中位数(本地货币)数据,专门针对亚洲地区。数据集涵盖27个亚洲国家,时间跨度为1996年至2025年,包含22,723个观测值,聚焦于一个核心指标:员工月收入中位数(按性别和经济活动细分)。数据以表格形式呈现,包括国家代码、年份、性别分类(总计、男性、女性)、经济活动分类、观测值及其状态等信息。数据集适用于表格分类、回归和时间序列预测等机器学习任务,旨在为研究人员和开发者提供标准化、机器学习友好的亚洲劳动力市场收入数据。

This dataset contains Median monthly earnings of employees by sex and economic activity (local currency) data from the International Labour Organization (ILO) ILOSTAT database, specifically focused on Asia. It covers 27 Asian countries from 1996 to 2025, with 22,723 observations, centered on one core indicator: median monthly earnings of employees disaggregated by sex and economic activity. The data is presented in tabular format, including country codes, years, sex classifications (total, male, female), economic activity classifications, observed values, and status flags. It is suitable for machine learning tasks such as tabular classification, regression, and time-series forecasting, providing standardized, ML-ready labor market earnings data for Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emtm-sex-eco-nb-median-monthly-earnings-of-employees-by-sex-and-ec 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT数据库,聚焦于亚洲地区性别与经济活动维度下雇员月收入中位数的统计。构建过程通过ILOSTAT REST API直接调用指标代码为EAR_EMTM_SEX_ECO_NB的原始数据,并依据ISO 3166-1 alpha-3标准筛选出27个亚洲国家的观测记录。ILOSTAT利用国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查及行政记录等微观数据进行规范化处理,数据来源在source.label列中予以标注,确保了跨国的可比性与可追溯性。最终数据集包含22,723条观测,时间跨度覆盖1996年至2025年。
特点
该数据集的核心特点在于其精细的维度拆分与丰富的元数据注释。除了提供国家(ref_area)、时间(time)和观测值(obs_value)等基础字段外,还包含了性别(sex)和经济活动分类(classif1)两个关键拆解维度,性别字段涵盖总、男、女及其他四个类别,便于进行性别工资差距分析。此外,数据集保留了ILOSTAT的质量标识(obs_status)、分类注释(note_classif)、指标注释(note_indicator)及来源注释(note_source)等多个元数据列,详细记录了数据在货币单位、序列连续性及来源库方面的潜在变化与说明,为研究者在使用时进行数据质量评估提供了透明依据。
使用方法
数据集已封装为HuggingFace Datasets格式,用户可通过load_dataset函数直接加载,并便捷地转换为Pandas DataFrame进行后续操作。典型使用场景包括:按国家筛选以分析特定地区的时序趋势,按指标过滤后进行时间序列的可视化分析,以及利用pivot_table方法构建以时间为行、国家为列的观测值矩阵,便于进行跨国的横向比较与面板数据建模。该数据集适用于分类、回归及时间序列预测等多种机器学习任务,为亚洲劳动力市场研究及政策分析提供了结构化的数据基础。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)旗下的ILOSTAT数据库于2025年发布,经Electric Sheep Asia团队重新打包并托管于HuggingFace平台。核心研究问题聚焦于亚洲地区雇员月收入中位数在性别与经济活动维度上的分布特征,旨在揭示劳动报酬的性别差异与行业异质性。数据集涵盖27个亚洲国家、1996至2025年的22,723条观测记录,为区域劳动经济学、性别平等评估及可持续发展目标监测提供了关键数据支撑。其影响力体现在:一方面填补了亚洲跨国收入微观数据的整合空白,另一方面通过标准化Schema与可复现的API接口设计,大幅降低了研究者与政策制定者的数据获取门槛,推动基于证据的劳动力市场分析与国际比较研究。
当前挑战
该数据集所解决的领域问题核心挑战在于:亚洲各国因统计体系、调查方法与货币单位差异,导致跨国产出“同工同酬”比较时面临严重的异质性与不可比性;同时,按性别与经济行业细分的中位数收入数据长期零散分布于各国官方报告,缺乏统一的时间序列与元数据标注。构建过程中遭遇了多重困难:需从ILOSTAT的REST API批量拉取原始指标并过滤至亚洲国家ISO码,确保各来源的经济活动分类(如ISIC修订版)与性别编码(SEX_T/M/F/O)严格对齐;处理不同国家的数据源标记(如劳动力调查与行政记录)、数据质量标志(如“断点序列”与“临时性数据”),以维持时间序列的连贯性;此外,还需应对部分国家早期年份数据稀疏、分类字段(classif1/classif2)仅在特定指标下非空等结构性缺失问题,最终通过ILO的“最佳来源”选择逻辑与注释字段保留追溯能力,平衡数据完备性与透明度。
常用场景
经典使用场景
该数据集在劳动经济学与区域发展研究中扮演着基准角色,常被用于跨国横向比较与长时序纵向分析。通过整合亚洲27个国家跨越近三十年的雇员月薪中位数数据,并按照性别与经济活动类型进行精细划分,研究者得以剖析劳动力市场中薪酬结构的差异性与演化趋势。这一数据集尤其适用于构建薪资分布模型、探讨经济发展阶段与薪酬水平之间的关联,以及评估全球化进程中亚洲各国劳动力市场的趋同或分化现象。其结构化面板数据格式使得多元回归、聚类分析与时间序列预测等经典计量方法能够直接应用,为劳动经济学的实证研究提供了高颗粒度的底层支撑。
实际应用
在国际发展机构、各国劳动部门及政策研究机构中,该数据集被广泛用于监测体面劳动目标(SDG 8)的实现进度与评估劳动政策执行效果。通过追踪不同性别和行业维度下的薪资中位数动态,政策制定者能够精准识别薪酬歧视的行业盲区与地区热点,为制定最低工资调整方案、性别平等促进措施及产业升级支持政策提供数据驱动的决策依据。此外,跨国企业人力资源分析团队亦可借助此数据进行区域薪酬基准对比,优化海外分支机构的薪酬设计策略,使其具备跨文化适应性与市场竞争力。
衍生相关工作
围绕该数据集的发布,衍生出多个促进劳动经济学研究深化的经典工作。一方面,研究人员基于其长时序与多国维度构建了预测亚洲国家薪资变动的机器学习模型,如利用Gradient Boosting或LSTM网络对未来不同经济部门的工资水平进行推演,为劳动力市场预警提供工具。另一方面,该数据集被嵌入性别收入差距分解分析的研究框架中,常与Blinder-Oaxaca分解法结合使用,量化个体禀赋差异与市场歧视在性别收入鸿沟中的相对贡献。此外,它还是验证经济学理论——例如库兹涅茨倒U型假说在亚洲区域适用性的重要素材,推动了区域间比较制度分析的经验研究发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务