遇见数据集

electricsheepasia/asia-ilo-ear-emtm-sex-age-cur-nb-median-monthly-earnings-of-employees-by-sex-age-an

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的亚洲国家员工月收入中位数数据,覆盖27个亚洲国家,时间跨度为1996年至2025年,共有18,999个观测值。数据集的核心指标是“按性别、年龄和货币划分的员工月收入中位数”(EAR_EMTM_SEX_AGE_CUR_NB),数据通过ILOSTAT REST API获取,并经过筛选和标准化处理。数据集以表格形式呈现,包含国家代码、来源、指标、性别、年龄分类、货币类型、年份、观测值等列,适用于表格分类、回归和时间序列预测等任务。数据由Electric Sheep Asia重新打包,以方便机器学习使用,遵循CC-BY-4.0许可证。

This dataset contains median monthly earnings of employees in Asia, sourced from the International Labour Organization (ILO) ILOSTAT database, covering 27 Asian countries from 1996 to 2025, with 18,999 observations. The primary indicator is Median monthly earnings of employees by sex, age and currency (EAR_EMTM_SEX_AGE_CUR_NB). Data is retrieved via the ILOSTAT REST API, filtered for Asian countries, and harmonized using ICLS definitions. The dataset is presented in tabular format with columns such as country code, source, indicator, sex, age classification, currency type, year, and observed value, suitable for tabular classification, regression, and time-series forecasting tasks. It is repackaged by Electric Sheep Asia for machine learning readiness and released under the CC-BY-4.0 license.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emtm-sex-age-cur-nb-median-monthly-earnings-of-employees-by-sex-age-an 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API直接抽取指标代码为EAR_EMTM_SEX_AGE_CUR_NB的原始数据,并依据亚洲ISO3国家代码进行地理范围过滤。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查等微观数据进行统一协调,数据来源在source.label字段中标注以确保可追溯性。最终由Electric Sheep Asia进行重封装,形成包含18,999条观测记录的表格数据集。
特点
数据集涵盖1996年至2025年间27个亚洲国家的员工按月收入中位数,按性别、年龄组和货币面额进行细分。观测值以年频度呈现,并附有观测状态标志(如临时数据、序列中断)及详细的分类注释信息。数据质量方面,当同一国家同一年份存在多个来源时,采用ILO选定的最佳来源数据,且分类列仅在指标发布相应细分时有效,确保了数据的规范性与可用性。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数一键加载该数据集,并转换为Pandas DataFrame进行后续分析。典型用法包括按国家代码过滤特定国家的子集、按时间序列对单一指标进行可视化,或通过数据透视表构建国家-年份的面板矩阵。数据集采用CC-BY-4.0许可协议,使用时需同时引用ILO原始数据来源及Electric Sheep Asia的重封装版本。
背景与挑战
背景概述
该数据集名为“asia-ilo-ear-emtm-sex-age-cur-nb-median-monthly-earnings-of-employees-by-sex-age-an”,由国际劳工组织(ILO)于2025年通过其ILOSTAT数据库构建,并由Electric Sheep Asia在HuggingFace上重新打包发布。数据集聚焦于亚洲地区27个国家1996年至2025年间员工按性别、年龄和货币分组的月收入中位数,涵盖18,999条观测记录。作为全球劳动统计的核心来源,ILOSTAT数据在劳动经济学、性别工资差距分析及可持续发展目标(SDG)监测中扮演关键角色。该数据集为研究亚洲劳动力市场动态、评估就业质量及制定收入政策提供了细粒度的时空基准,尤其因覆盖长达近30年的性别和年龄分层,对追踪结构性不平等和区域经济变迁具有重要学术与应用价值。
当前挑战
该数据集所解决的领域问题包括:1)劳动收入数据的细粒度缺失——现有跨国数据多聚焦均值或总量,难以反映劳动力内部的异质性,而该数据集通过性别与年龄的交叉分类,揭示了隐性的收入不平等与代际差异;2)亚洲地区统计口径不一,导致跨国产出难以直接比较,ILOSTAT通过一致性协调了来自27国的调查数据,减少了方法学偏差。在构建过程中,面临的挑战包括:数据源多样性(如劳动力调查、行政记录)导致的格式与定义差异,需借助ICLS标准进行统一;部分国家年份存在序列中断或数据质量标记(如“B”表示断点),需在清洗中谨慎处理;此外,多维度分类变量(如性别、性别年龄组、货币类型)的非空约束与注释信息的语义解析,亦对数据规范化和元数据映射提出了高要求。
常用场景
经典使用场景
作为亚太地区劳动经济学研究的基石性数据集,Asia-ILO-EAR-EMTM-SEX-AGE-CUR-NB汇聚了国际劳工组织ILOSTAT体系中27个亚洲国家长达三十载的雇员月收入中位数观测记录。研究者可通过性别与年龄的双重维度进行精细化剖析,利用其结构化面板数据开展跨国收入差异的纵向比较分析,或构建混合效应模型以剥离时间与地域异质性带来的干扰。该数据集特别适用于评估各国最低工资政策对实际收入分布的调控效果,以及追踪全球化进程中不同劳动力群体的收入变迁轨迹。
衍生相关工作
围绕该数据集衍生的经典工作包括基于分位数回归方法的亚洲性别工资差距动态分解研究,以及利用贝叶斯结构时间序列模型对各国收入冲击传导机制的因果推断。ILO自身发布的《全球工资报告》中亚洲章节的统计分析,其核心数据源头正源于此数据集。此外,结合世界银行的微观调查数据,已有学者构建了亚洲国家收入弹性与教育回报率的联合估计模型,揭示了技能偏向型技术进步对收入分布的非线性影响。这些衍生工作不仅深化了学术界对亚洲劳动力市场异质性的理解,也为后续研究提供了可复现的分析框架与基准结果。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区雇员月度收入中位数的性别与年龄差异分析,依托国际劳工组织(ILO)权威的ILOSTAT数据库,覆盖1996至2025年间27个亚洲国家近1.9万条观测记录。当前前沿研究主要围绕后疫情时代亚洲劳动市场的收入不平等加剧现象,利用该数据探索性别薪资差距的跨年龄段演变路径,以及不同货币计价下的实际购买力变动。结合ILO近期推行的体面劳动议程与可持续发展目标(SDG)监测框架,该数据集为量化亚洲区域内的结构性就业挑战提供了精细化的面板数据支撑,尤其对评估非正规就业转型、最低工资政策效果及代际收入流动具有关键实证价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务