遇见数据集

electricsheepasia/asia-ilo-ear-emtm-sex-eco-cur-nb-median-monthly-earnings-of-employees-by-sex-econom

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲27个国家从1996年至2025年的员工月收入中位数数据,共计69,581个观测值。核心指标为EAR_EMTM_SEX_ECO_CUR_NB,即按性别、经济活动和货币划分的员工月收入中位数。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤了亚洲国家。数据集提供了详细的列信息,包括国家代码、性别分类(总计、男性、女性等)、经济活动和货币分类、观测年份、观测值以及数据来源和质量标志。该数据集适用于表格分类、回归和时间序列预测等机器学习任务,并遵循CC-BY-4.0许可证。

This dataset contains median monthly earnings data for employees across 27 Asian countries from 1996 to 2025, with 69,581 observations. The core indicator is EAR_EMTM_SEX_ECO_CUR_NB, which represents median monthly earnings of employees disaggregated by sex, economic activity, and currency. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered for Asian countries. The dataset includes detailed columns such as country codes, sex disaggregation (total, male, female, etc.), economic activity and currency classifications, observation year, observed values, and data source and quality flags. It is suitable for machine learning tasks like tabular classification, regression, and time-series forecasting, and is released under the CC-BY-4.0 license.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emtm-sex-eco-cur-nb-median-monthly-earnings-of-employees-by-sex-econom 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API直接拉取原始指标数据,并依据ISO 3166-1 alpha-3国家代码筛选出亚洲地区的观测记录。数据涵盖27个亚洲国家,时间跨度从1996年至2025年,共计69,581条观测值。ILOSTAT采用国际劳工统计学家会议(ICLS)定义对各国调查微观数据进行标准化处理,确保跨国家、跨年份数据的可比性与一致性。数据集中包含的`source.label`字段详细标注了每项观测的原始数据来源,如劳动力调查或行政记录,便于用户追溯数据的生成路径与可信度。
特点
本数据集聚焦于员工按性别、经济活动与货币类型划分的月收入中位数这一核心劳动经济指标,提供了高颗粒度的多维剖析视角。数据以年频观测呈现,支持按国家、性别、经济活动部门及货币种类进行灵活切分,其中性别维度包含总计、男性、女性及其他人四种类别。数据集结构规范,包含`ref_area`、`sex`、`classif1`等分类列以及`obs_value`数值列,辅以`obs_status`和注释列标识数据质量标记与处理说明,为用户开展区域劳动市场对比、收入不平等研究及时间序列建模提供了坚实的数据基础。
使用方法
用户可通过HuggingFace Datasets库中的`load_dataset`函数便捷加载该数据集,随后将数据集转换为Pandas DataFrame格式进行后续分析。支持按国家代码(如`ref_area`)快速筛选特定国家的观测数据,亦可针对单一指标按时间排序构建时序数据并进行可视化。此外,用户可借助透视表操作将数据重塑为以年份为行、国家为列的矩阵形式,便于开展跨国的横向比较与面板数据分析。数据集的标准化列名与清晰模式使得从数据加载到高级分析的流程极为流畅,尤其适合从事劳动经济学、发展经济学及亚洲区域研究的学者与数据科学家使用。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门于2025年构建,经Electric Sheep Asia团队重新整合后发布,聚焦亚洲地区劳动者收入的核心研究问题。基于ILOSTAT数据库的权威劳动统计数据,数据集收录了1996年至2025年间亚洲27个国家的69,581条观测值,涵盖按性别、经济活动类型及货币分类的员工中位月收入指标。作为全球劳动经济学领域的关键数据资源,该数据集为亚洲劳动力市场的性别收入差距分析、产业结构变迁研究及可持续发展目标(SDG)中的体面工作指标监测提供了标准化、可复用的量化基础,推动了跨国比较研究与数据驱动政策评估的发展。
当前挑战
该数据集旨在解决劳动经济学中亚洲地区收入数据的碎片化与可比性难题:不同国家的收入统计口径、货币单位及调查方法差异显著,ILO通过ICLS国际定义进行协调统一,但部分观测值仍存在序列断裂或来源标记不一致的问题。构建过程中,数据抽取自ILOSTAT的多源API接口,需处理各国劳动调查、行政记录等异构数据的归一化转换;同时,性别、经济活动等分类维度的缺失值处理及年度频率数据的时效性保障构成技术挑战,数据集通过标注最佳来源与状态标志(如临时值、不可靠值)来提升透明度,但其覆盖范围仍受限于各国统计体系的完善程度。
常用场景
经典使用场景
在劳动经济学与社会科学研究领域,该数据集为深入剖析亚洲地区劳动力市场的薪酬结构提供了珍贵的量化素材。研究者常利用其丰富的跨年度面板数据(1996—2025年)与国别细分维度,构建回归模型以探究性别、经济行业与货币类型对中位月收入水平的多元影响。通过整合ILOSTAT标准化定义下的时间序列观测,该数据集亦被广泛用于追踪全球化进程中亚洲各国工资增长轨迹,比较不同经济发展阶段下薪酬分布的异质性特征,从而为跨国劳动收入研究奠定了坚实的实证基础。
解决学术问题
该数据集有效解决了亚洲区域薪酬研究中长期存在的数据碎片化与口径不统一难题。通过整合27个亚洲国家长达近三十年的ILO官方统计数据,学者得以系统性地检验性别工资差异在不同经济部门与历史阶段的演变规律,量化国际贸易、产业结构升级等宏观因素对劳动力回报的影响。数据集所附带的分类注释与来源标记更提升了实证研究的内外部效度,推动了对体面劳动指标(SDG Decent Work)的定量评估,其公开可获得性也降低了复现与检验的门槛,有力促进了劳动经济学领域的透明化与知识积累。
衍生相关工作
该数据集衍生了一系列经典工作,其中最具代表性的是关于亚洲女性劳动力收入追赶效应的纵向研究,利用性别字段的交叉分类揭示了建筑业、制造业与服务业中性别收入差距的收敛模式。另有学者基于经济活动的细分编码,构建了行业收入弹性模型,探讨了汇率波动对以本币计价的薪酬竞争力的影响。近年来,该数据集还被整合进东亚劳动力市场动态比较的元分析框架中,作为关键数据源验证了“收入-生产率”脱钩假说。此外,Electric Sheep Asia团队采用标准化的Parquet格式与统一的API接口,使得该数据集易于与全球劳工统计数据库联动,催生了多项跨国面板计量经济学的实证复现研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务