遇见数据集

electricsheepasia/asia-ilo-ear-emtm-sex-age-nb-median-monthly-earnings-of-employees-by-sex-and-ag

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的按性别和年龄划分的员工月收入中位数(本地货币)指标数据,专门针对亚洲地区。数据集涵盖了27个亚洲国家从1996年到2025年的12,385个观测值,核心指标为EAR_EMTM_SEX_AGE_NB,用于衡量员工月收入中位数,并按性别(总计、男性、女性、其他)和年龄组(如15岁以上)进行细分。数据来源于各国的劳动力调查、家庭收入调查、机构调查和行政记录,经过ILO根据国际劳工统计学家会议(ICLS)定义进行协调。数据集包含多个列,如国家代码、国家名称、数据来源、指标代码、指标标签、性别分类、年龄分类、观测年份、观测值、观测状态标志等,提供了详细的数据点和元信息,适用于表格分类、回归和时间序列预测等任务。

This dataset contains the Median monthly earnings of employees by sex and age (local currency) indicator data from the International Labour Organization (ILO) ILOSTAT database, specifically for the Asia region. It includes 12,385 observations across 27 Asia countries from 1996 to 2025, with the core indicator EAR_EMTM_SEX_AGE_NB that measures median monthly earnings of employees, disaggregated by sex (total, male, female, other) and age groups (e.g., 15+ years). The data is sourced from national labour force surveys, household income surveys, establishment surveys, and administrative records, harmonized by the ILO using International Conference of Labour Statisticians (ICLS) definitions. The dataset features columns such as country code, country name, data source, indicator code, indicator label, sex classification, age classification, observation year, observed value, observation status flags, and more, providing detailed data points and metadata for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emtm-sex-age-nb-median-monthly-earnings-of-employees-by-sex-and-ag 数据集图片
构建方式
该数据集由Electric Sheep Asia团队从国际劳工组织(ILO)的ILOSTAT REST API直接抽取,原始数据来源为ILOSTAT中央统计数据库。数据采集时,通过API接口获取EAR_EMTM_SEX_AGE_NB指标,并依据ISO 3166-1 alpha-3标准筛选出亚洲27个国家的观测值。所有原始微观数据均经过ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行统一规范化处理,数据集内亦保留了source.label字段以追溯数据出处,确保数据源的可溯性与一致性。最终形成包含12,385条观测值的时间序列数据集,覆盖1996年至2025年的时间跨度。
特点
该数据集聚焦于亚洲27个国家雇员的月收入中位数,数据按性别与年龄组进行细致分层,性别维度涵盖总人口、男性及女性四类细分(SEX_T、SEX_M、SEX_F、SEX_O),反映不同劳动群体的收入分布特征。所有观测值以本地货币为单位,连续多年跨度的记录支持横截面与时序分析。数据集同时标注了观测状态与多种注释字段,如数据序列中断、货币类型变动及非标准年龄组等,为用户提供完善的数据质量警示,有助于在分析时审慎处理异常值与结构性断点。
使用方法
用户可通过HuggingFace Datasets库快速加载该数据集,使用Python的load_dataset函数即可获取训练集DataFrame对象。针对特定国家的研究,可基于ref_area字段进行行级筛选,如提取印度尼西亚的全部记录。时间序列分析可对indicator字段进行过滤,按time列排序后绘制观测值变化趋势。此外,借助pivot_table方法可将数据重塑为国家-年份矩阵,便于进行面板数据分析与跨国家比较。数据集支持回归、分类及时间序列预测三类下游任务,适合劳动经济学、收入不平等及发展经济学等领域的计量建模与政策评估。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)辖下ILOSTAT数据库于2025年整理发布,经Electric Sheep Asia团队重新封装后托管于HuggingFace平台,旨在系统记录亚洲27个国家1996至2025年间雇员按月性别与年龄划分的中位数月收入(以本币计)。作为全球劳动统计领域的权威来源,ILOSTAT依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查微观数据进行统一化处理,使得跨时间、跨国别的收入比较成为可能。该数据集共计12,385条观测记录,覆盖印度尼西亚、菲律宾、土耳其等经济体,填补了亚洲区域分性别、分年龄劳动报酬精细化数据的空白,为劳动经济学、收入不平等、性别薪酬差距及可持续发展目标(SDG)相关研究提供了高价值的标准化时间序列基础。
当前挑战
该数据集所解决的核心领域问题是亚洲地区劳动收入统计数据碎片化与不可比性——各国在收入调查口径、年龄分组、币值稳定性和数据质量标记上存在显著差异,使得跨区域或纵向分析面临严峻挑战。构建过程中,技术挑战主要体现在三方面:其一,需从ILOSTAT REST API提取原始数据后仅保留亚洲国家,涉及复杂的地理筛选与多来源合并;其二,不同来源(如劳动力调查与行政记录)的数据标记方式各异,必须保留source.label字段以确保可追溯;其三,年龄分组(classif1)与性别维度(SEX_T、SEX_M、SEX_F)的非完整覆盖,以及序列中断标注(如obs_status标记‘B’)要求使用者进行额外数据清洗与质量控制,增加了建模前的预处理复杂度。
常用场景
经典使用场景
在劳动经济学与区域发展研究中,该数据集常被用于构建亚洲国家间性别与年龄维度的收入不平等测度模型。通过整合27个亚洲经济体跨越近三十年的月度工资中位数信息,学者能够开展跨国比较分析,探究不同年龄段劳动者在劳动力市场中的回报差异,并揭示性别收入差距的演变轨迹。时间序列属性使其适用于面板数据回归,以控制国家固定效应后评估经济发展阶段与制度环境对工资水平的影响。
衍生相关工作
基于此数据集衍生出一系列探索收入动态与劳动结构变迁的经典工作,包括将时间序列分解为结构性趋势与周期性波动以区分经济收缩与长期增长对工资的异质性影响。部分研究通过匹配同一来源的就业率及行业构成数据,构建了分析女性劳动参与率与收入中位数之间联动关系的联立方程模型。此外,也有学者利用其离散化维度特征,采用分位数回归方法考察高技能与低技能劳动者在相同国家内部的工资极化现象。
数据集最近研究
最新研究方向
依托ILOSTAT框架下亚洲27国1996至2025年间按性别与年龄划分的雇员月收入中位数数据,当前研究前沿聚焦于收入性别差距的动态演化、劳动力市场结构性变迁对薪酬分布的影响,以及跨国收入收敛模式的实证检验。该数据集为分析亚洲地区体面劳动目标(SDG 8)进展、评估最低工资政策效应、揭示非正规就业对收入影响的异质性提供了关键微观基础。结合ILO近年发布的全球工资报告,学者可借助这一长时序面板数据,深入探讨后疫情时代亚洲劳动力市场的复苏韧性、数字转型对性别收入鸿沟的调节作用,以及区域经济一体化(如RCEP)对跨国收入趋同的驱动机制。其精细的分组维度与多来源标记,还支撑了关于数据质量、调查方法一致性对统计推断稳健性的方法论研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务