遇见数据集

electricsheepasia/asia-ilo-ear-emta-sex-ocu-nb-average-monthly-earnings-of-employees-by-sex-and-o

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含14,027个观测值,覆盖37个亚洲国家,时间跨度为1996年至2025年,涵盖1个独特指标:员工按性别和职业划分的平均月收入(本地货币)。数据源自国际劳工组织(ILO)的ILOSTAT统计数据库,经过统一处理,包含国家代码、数据来源、指标代码、性别分类、观测年份、观测值等字段,适用于表格分类、回归或时间序列预测任务。数据集以CC-BY-4.0许可证发布,由Electric Sheep Asia重新打包,便于机器学习使用。

This dataset contains 14,027 observations across 37 Asia countries, spanning 1996–2025, covering 1 distinct indicator: Average monthly earnings of employees by sex and occupation (local currency). It is sourced from the International Labour Organizations ILOSTAT database, harmonized and includes fields such as country codes, data sources, indicator codes, sex disaggregation, observation years, and values, suitable for tabular classification, regression, or time-series forecasting tasks. Released under the CC-BY-4.0 license and repackaged by Electric Sheep Asia for machine learning readiness.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emta-sex-ocu-nb-average-monthly-earnings-of-employees-by-sex-and-o 数据集图片
构建方式
该数据集由国际劳工组织(ILO)统计数据库ILOSTAT提供,旨在系统记录亚洲地区按性别与职业划分的雇员平均月收入(以当地货币计)。数据通过ILOSTAT REST API直接拉取,经Electric Sheep Asia团队重新封装,筛选出37个亚洲国家的ISO3编码,并依据ICLS定义对原始调查微观数据进行标准化处理。最终汇集了1996年至2025年间共计14,027条观测记录,涵盖单一核心指标,同时保留了来源、性别、职业分类等多元列信息,供研究者追踪数据溯源。
特点
本数据集以年度频率覆盖37个亚洲经济体,时间跨度近三十年,为区域劳动力市场比较研究提供了独特的纵向数据支持。其核心指标EAR_EMTA_SEX_OCU_NB不仅包含总体均值,还按性别(男、女、合计)和职业技能等级进行细粒度拆分,便于分析收入差异的深层结构。数据来源包括劳动力调查、住户收入调查等多种官方渠道,并以标识字段清晰标注了来源类型与观测状态(如临时性或中断序列),兼顾了数据的丰富性与透明度。
使用方法
使用HuggingFace Datasets库即可一键加载数据,调用`load_dataset`命令后,会将14,027条记录以Pandas DataFrame格式呈现。研究者可依据`ref_area`列过滤特定国家的子集,或按年份与指标对`obs_value`进行时间序列分析。数据表结构设计规范,支持通过`pivot_table`快速构建国家-年份矩阵,便于面板数据分析或可视化展示。对于需要追踪数据质量的用户,`obs_status`与各注释列提供了观测值可靠性信息的接口,以辅助研究推断。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其核心统计数据库ILOSTAT发布,经Electric Sheep Asia重新封装后呈现于HuggingFace平台。它聚焦于亚洲37个国家中按性别与职业划分的雇员平均月薪(以当地货币计),覆盖1996年至2025年间约14,027条观测记录。作为全球劳动统计的权威数据源,ILOSTAT整合了来自各国劳动力调查、企业调查及行政记录的资料,并依据国际劳工统计学家会议(ICLS)定义进行标准化处理。该数据集为研究亚洲地区薪资差异、性别不平等及劳动力市场动态提供了宝贵的基础资源,深刻影响了发展经济学、劳动经济学及公共政策分析等领域,尤其为追踪可持续发展目标(SDG)中的体面工作指标贡献了关键数据支撑。
当前挑战
该数据集在领域上面临的核心挑战是,亚洲各国经济发展阶段、劳动力市场结构与数据采集能力的巨大差异导致薪资数据的跨国可比性不足,例如不同国家对职业分类、货币换算及工资外福利的定义存在显著偏差。在构建过程中,团队需处理ILOSTAT原始API返回的庞大多源数据,将同一国家不同调查机构的指标整合为统一时序,并自动标记因调查方法变更或统计口径调整引发的序列中断(如obs_status字段中的“Break in series”标签)。此外,亚洲区域部分国家缺乏长期稳定的月度或季度薪资数据,年均值又掩盖了季节性波动,加之全球通货膨胀与汇率波动的影响,使得以当地货币计的薪资序列需谨慎解读,数据集通过保留丰富元数据字段(如obs_status和note_indicator)来揭示这些潜在的不一致性,但用户仍需自行权衡数据质量与建模风险。
常用场景
经典使用场景
在劳动经济学与区域发展研究的交汇处,该数据集的核心应用场景集中于跨国工资差距的测度与性别收入不平等的时间序列分析。研究者可借助37个亚洲国家横跨近三十年的月度收入面板数据,按性别与职业类别精细拆解,系统考察亚洲劳动力市场中不同国家、不同技能等级从业者的报酬结构及其演化轨迹,揭示经济发展阶段、产业结构变迁与制度环境对薪资水平的差异化塑造作用。
实际应用
在实际政策制定与国际发展合作中,该数据集的潜在价值尤为突出。国际组织与各国劳动部门可据此监测体面劳动目标的进展,评估最低工资调整对性别平等的影响,并为亚洲区域内的社会保障与就业促进政策提供量化依据。企业的人力资源战略部门亦能利用其中性别与职业维度的收入基准,优化薪酬公平性审计与跨国人才竞合策略,推动负责任商业实践的落地。
衍生相关工作
围绕此数据集已衍生出从简单描述统计到复杂推断建模的多元分析工作。经典用例包括构建国家层面的收入趋势线图、计算按性别和职业分类的薪资中位数比,以及利用面板回归模型探究制度因素对工资分布的影响。更前沿的工作则涉及将ILO数据与分性别教育成就、产业结构指标进行匹配融合,训练时序预测模型以预警劳动力市场失衡,或作为训练数据赋能亚洲区域经济模拟器,为可持续发展目标的量化评估搭建数据桥梁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务