遇见数据集

electricsheepasia/asia-ilo-ear-emtm-sex-ocu-cur-nb-median-monthly-earnings-of-employees-by-sex-occupa

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的31,306条观测数据,涵盖了26个亚洲国家从1996年至2025年期间员工月收入中位数的统计信息。数据按性别(总计、男性、女性)、职业(按技能水平分类)和货币类型(本地货币等)进行细分。核心指标为EAR_EMTM_SEX_OCU_CUR_NB,即按性别、职业和货币划分的员工月收入中位数。数据集包含国家代码、国家名称、数据来源、指标代码、指标标签、性别分类、职业分类、货币分类、观测年份、观测值、观测状态标志以及相关注释等多列信息,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 31,306 observations of median monthly earnings data for employees across 26 Asian countries, spanning the years 1996 to 2025. It is sourced from the ILOSTAT database of the International Labour Organization (ILO). The data is disaggregated by sex (total, male, female), occupation (by skill level), and currency type (e.g., local currency). The primary indicator is EAR_EMTM_SEX_OCU_CUR_NB, which represents Median monthly earnings of employees by sex, occupation and currency. The dataset includes columns such as country code, country name, data source, indicator code, indicator label, sex classification, occupation classification, currency classification, observation year, observed value, observation status flags, and related notes. It is suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emtm-sex-ocu-cur-nb-median-monthly-earnings-of-employees-by-sex-occupa 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过REST API从官方数据源提取指标代码为EAR_EMTM_SEX_OCU_CUR_NB的观测值,并依据亚洲ISO3国家代码进行地理筛选。原始调查微观数据经由国际劳工统计学家会议(ICLS)定义进行统一协调,同时在source.label列中标注了数据来源,以保障可追溯性。最终由Electric Sheep Asia重新打包为HuggingFace格式,形成了包含31,306条观测记录的数据集。
特点
该数据集聚焦于亚洲地区雇员按月薪中位数计算的收入情况,覆盖了26个亚洲国家,时间跨度从1996年至2025年,时间频率为年度数据。其核心特点在于多维度细分,包括按性别(总、男、女)、职业技能等级和货币种类进行划分,提供了4种性别分类值。此外,数据集标注了观测状态标志(如数据中断)和来源编码,便于用户评估数据质量,是研究亚洲劳动力市场收入差异与趋势的权威资源。
使用方法
用户可通过HuggingFace的datasets库直接加载该数据集,利用load_dataset()函数获取完整的训练集,并转换为Pandas DataFrame进行后续分析。实践中,可依据ref_area列筛选特定国家(如印度尼西亚)的观测值,或借助obs_value列对单一指标进行时间序列的可视化分析。此外,用户还可通过pivot_table方法将数据重塑为国家×年份的矩阵形式,便于进行跨国的横向对比与面板数据分析。
背景与挑战
背景概述
由国际劳工组织(ILO)主导构建的ILOSTAT数据库是全球劳动统计领域最具权威性的数据源之一。该数据集于2025年由Electric Sheep Asia重新打包并发布于HuggingFace平台,聚焦亚洲地区劳动者的性别与职业收入差异。核心研究问题在于通过系统性整合1996至2025年间26个亚洲国家的横截面与时间序列数据,揭示不同性别、职业类别及货币单位下雇员月收入中位数的分布规律。其影响力体现在为学术界和政策制定者提供了跨越近三十年的标准化微观数据,推动了发展经济学、性别不平等及劳动力市场动态等领域的实证研究,同时为联合国可持续发展目标中关于体面工作的指标监测提供了关键支撑。
当前挑战
该数据集所解决的领域挑战在于填补亚洲区域收入数据的细粒度与可比性缺口——传统收入统计常因口径不一或缺失性别-职业交叉维度而难以进行跨国比较研究。构建过程中面临多重困难:首先,ILOSTAT需从各国来源不一(如劳动力调查与行政记录)的原始问卷数据中,依据国际劳工统计学家会议(ICLS)定义进行协调统一,以克服统计口径与时间段差异;其次,针对部分国家部分年份数据可靠性标志(如断裂序列或粗略估计),需设计筛选与标注机制以保障分析质量;此外,多分类变量(性别与职业技能等级)的非空约束以及不同货币单位的换算压力,也对数据处理流水线的鲁棒性提出了严苛要求。
常用场景
经典使用场景
该数据集整合了国际劳工组织ILOSTAT数据库中关于亚洲26个国家1996至2025年间员工月收入中位数的官方统计信息,涵盖性别、职业技能等级和货币类型等多个维度。其经典的使用场景在于为劳动经济学、发展经济学以及区域比较研究提供标准化的面板数据基础。研究者能够利用这三万余条高质量观测记录,精确刻画亚洲各国劳动力市场的收入分布格局,并开展跨时期、跨国别的纵向与横向对比分析。数据集的清洗与重构工作已由Electric Sheep Asia完成,用户可通过HuggingFace的`load_dataset()`接口直接调用为Pandas DataFrame,极大简化了数据预处理流程,适用于时间序列建模、分类与回归任务。
衍生相关工作
该数据集的出现衍生了一系列重要的学术与工程工作。在模型层面,研究者基于其时间序列属性开发了针对亚洲劳动力市场的多步预测模型,探讨了传统ARIMA、Prophet与深度学习长短期记忆网络(LSTM)在收入预测上的表现差异。在分析框架上,有工作将其与ILOSTAT的其他就业与失业指标结合,构建了综合性的亚洲体面劳动指数。同时,数据集的标准化格式也激发了关于多源异构劳动统计数据的自动融合与质量标记方法的研究,相关成果常被引用为开发面向发展中国家的通用型劳动经济数据库的范例。
数据集最近研究
最新研究方向
在当前全球劳动力市场重塑与性别平等议程深入推进的背景下,该数据集聚焦于亚洲26个国家1996至2025年间雇员月收入中位数的结构性变迁,按性别、职业与货币维度展开精细化刻画。其前沿研究价值体现在两大方向:其一,支撑跨国别劳动收入动态比较研究,尤其可结合ILO提出的“体面劳动”指标框架,量化评估亚洲各国在全球供应链重塑、数字经济兴起等热点事件中对收入分配的影响;其二,为性别收入差距的纵向追踪提供高颗粒度证据,通过职业细分类别与本地货币单位,揭示传统制造业、服务业与新兴技术行业间工资分布的非对称性演进。该数据集的整合发布显著降低了亚洲区域劳动力研究的获取门槛,为政策模拟、时空归因分析与可持续目标监测提供了可靠基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务