遇见数据集

electricsheepasia/asia-ilo-ear-ehrm-sex-ocu-cur-nb-median-hourly-earnings-of-employees-by-sex-occupat

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲25个国家从1997年到2025年的员工中位小时收入数据,共有25,498个观测值,覆盖1个主要指标(EAR_EHRM_SEX_OCU_CUR_NB),即按性别、职业和货币划分的员工中位小时收入。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤为亚洲国家代码。数据集包括国家代码、国家名称、数据来源、指标代码、性别分类、职业分类、货币分类、观测年份、观测值及其状态等字段。数据以表格形式组织,支持分类和回归任务,适用于时间序列预测和分析。数据质量方面,为年度频率,ILO选择最佳来源处理重复数据,分类字段仅在指标发布细分数据时非空。数据集由Electric Sheep Asia重新打包,以Parquet格式发布,便于机器学习使用,遵循CC-BY-4.0许可。

This dataset contains 25,498 observations of median hourly earnings of employees across 25 Asia countries, spanning from 1997 to 2025, covering 1 distinct indicator (EAR_EHRM_SEX_OCU_CUR_NB), which represents median hourly earnings of employees by sex, occupation, and currency. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, pulled via the REST API and filtered to Asia ISO3 country codes. It includes fields such as country code, country name, data source, indicator code, sex disaggregation, occupation classification, currency classification, observation year, observed value, and status flags. The dataset is organized in tabular format, suitable for tabular classification, regression, and time-series forecasting tasks. Data quality notes include annual frequency, use of ILO-selected best source for duplicate entries, and non-null disaggregation columns only when breakdowns are published. Repackaged by Electric Sheep Asia in Parquet format for ML readiness, it is released under the CC-BY-4.0 license.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehrm-sex-ocu-cur-nb-median-hourly-earnings-of-employees-by-sex-occupat 数据集图片
构建方式
该数据集由Electric Sheep Asia团队从ILOSTAT REST API直接获取原始数据,并依据亚洲ISO3国家代码进行筛选与重构。ILOSTAT作为国际劳工组织的核心统计数据库,基于各国劳动力调查、家庭收入调查等原始微观数据,采用国际劳工统计学家会议(ICLS)定义进行统一整合与标准化处理。数据集最终以25498条观测记录的形式呈现,涵盖了25个亚洲国家自1997年至2025年间的数据,且所有原始来源均在`source.label`列中予以标注,保证了数据的可追溯性。
特点
数据集聚焦于亚洲地区雇员按性别、职业和货币划分的每小时收入中位数这一单一指标,具有高度的专题聚焦性。其特点在于提供了多维度的分类变量,包括性别(总、男、女、其他)、职业类型及货币种类,使得深层次的分组分析与比较成为可能。数据来源多样,标注了来自劳动力调查等不同渠道的源头信息,且通过观测状态标志(如数据中断、暂定值)为用户提供了数据质量方面的参考,便于研究者审慎使用。
使用方法
该数据集已封装为HuggingFace Datasets格式,用户可通过`load_dataset()`函数一键加载并直接转换为Pandas DataFrame进行使用。支持按国家代码(如`ref_area == "IDN"`)筛选特定国家数据,亦可通过`time`和`obs_value`字段对单一指标进行时间序列分析与可视化。此外,利用`pivot_table`方法可便捷地将数据重塑为国家×年份的矩阵形式,便于跨国比较与面板数据分析。
背景与挑战
背景概述
在劳动经济学与可持续发展目标(SDGs)的交叉领域中,可靠的薪资数据是衡量体面劳动与经济包容性的关键指标。国际劳工组织(ILO)作为全球劳动统计的权威来源,其ILOSTAT数据库系统性地整合了来自200多个经济体的劳动力调查与行政记录数据。在此背景下,Electric Sheep Asia团队于2025年通过ILOSTAT REST API重构并发布了亚洲地区员工按性别、职业及货币划分的时薪中位数数据集,收录了1997年至2025年间跨越25个亚洲国家的25,498条观测数据。该数据集聚焦于单一核心指标——'EAR_EHRM_SEX_OCU_CUR_NB',旨在为区域劳动力市场的性别薪酬差距、职业分层及货币购买力分析提供标准化、机器学习的结构化资源。
当前挑战
该数据集所应对的核心领域挑战在于:亚洲各国因统计能力差异导致的数据碎片化与不可比性,使得跨国的性别薪酬与职业分层分析长期缺乏统一的时间序列基础。在构建过程中,团队面临多重技术壁垒:首先,原始ILOSTAT数据多源异构,需依赖国际劳工统计学家会议(ICLS)定义进行数据协调,并需在国家和地区层面标记‘最优来源’以应对相同指标的多源冲突;其次,数据集仅保留年度频率,但部分国家亦发布月度或季度序列,信息颗粒度取舍成为难题;此外,按性别、职业(技能水平)与货币(如本币与固定汇率)的三维拆解维度中,缺失记录与序列中断(如阿富汗本币变更)的标注要求严格,需通过'obs_status'等字段同步维护数据质量的可追溯性,以确保下游建模中的偏差可控。
常用场景
经典使用场景
该数据集以亚太地区为地理锚点,系统收录了1997年至2025年间25个亚洲国家按性别、职业和货币划分的雇员时薪中位数数据,共计25498条观测记录。其经典使用场景集中于跨国劳动经济学比较研究,研究者可借助此面板数据剖析性别薪酬差异在不同职业等级与经济发展阶段国家中的演化轨迹,亦可结合时间序列分析技术,追踪货币波动对实际购买力的侵蚀效应。此外,该数据为验证人力资本理论、歧视经济学模型以及最低工资政策效果提供了经过ILO标准化处理的实证基础,尤其适合开展亚洲新兴经济体与高收入国家劳动市场结构的异质性分析。
解决学术问题
该数据集精准回应了劳动经济学中关于‘亚洲地区结构性工资不平等’这一长期缺乏可靠跨国可比数据的学术痛点。通过ILO依据国际劳动统计学家会议标准对原始调查微观数据的统一整合,有效解决了因各国统计口径迥异而导致的实证偏差问题,使得研究者得以量化性别、职业层级与收入之间的多元交互效应。其意义在于为验证‘性别薪酬鸿沟在快速工业化背景下的收敛假说’以及‘技能偏向性技术变革对亚洲劳动报酬份额的影响’提供了权威证据,进而推动了发展经济学与劳动市场制度分析领域的理论建构与实证方法论革新。
衍生相关工作
围绕该数据集已衍生出一系列具有影响力的学术与政策研究工作。在方法层面,基于其面板数据结构,学者开发了多层次的薪酬差距分解模型(如Oaxaca-Blinder分解的扩展形式),并引入贝叶斯分层模型以处理小国样本稀疏性问题。在主题层面,相关论文系统考察了东亚出口导向型经济体中性别工资差距随产业结构转型的动态演变,以及南亚非正规就业部门内技能溢价的时间趋势。更值得注意的是,该数据集被用于校准全球可计算一般均衡模型中的劳动供给弹性参数,其成果直接服务于ILO《全球工资报告》中亚洲章节的定量分析,强化了跨国劳动统计在政策制定中的循证实践。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务