遇见数据集

electricsheepasia/asia-ilo-ear-emtm-sex-dsb-cur-nb-median-monthly-earnings-of-employees-by-sex-disabi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲18个国家从1996年至2024年的员工月收入中位数数据,按性别、残疾状况和货币分类。数据集共有2,471个观测值,覆盖一个核心指标:EAR_EMTM_SEX_DSB_CUR_NB,即按性别、残疾状况和货币划分的员工月收入中位数。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过API获取并过滤为亚洲国家代码,经过ILO的标准化处理以确保一致性。数据结构包括国家代码(ref_area)、指标代码(indicator)、性别分类(sex)、时间(time)、观测值(obs_value)等列,并提供数据来源、分类标签和备注信息。数据集可用于表格分类、回归和时间序列预测等任务,适用于劳动力市场分析和收入研究。

This dataset contains median monthly employee income data for 18 Asian countries from 1996 to 2024, categorized by gender, disability status and currency. It includes 2,471 observations, with one core indicator: EAR_EMTM_SEX_DSB_CUR_NB, which represents the median monthly employee income categorized by gender, disability status and currency. The data is sourced from the ILOSTAT statistical database of the International Labour Organization (ILO), obtained via API, filtered to retain only Asian country codes, and standardized by the ILO to ensure consistency. The dataset features columns such as country code (ref_area), indicator code (indicator), gender classification (sex), time (time), and observed value (obs_value), and also provides data sources, classification labels and supplementary notes. This dataset can be applied to tasks including table classification, regression and time series forecasting, and is suitable for labor market analysis and income-related research.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emtm-sex-dsb-cur-nb-median-monthly-earnings-of-employees-by-sex-disabi 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)旗下的ILOSTAT核心统计数据库,该数据库汇集了全球200多个经济体的劳动统计数据。数据通过ILOSTAT REST API接口直接抓取,原始指标代码为EAR_EMTM_SEX_DSB_CUR_NB,代表按性别、残疾状况和货币分类的雇员月收入中位数。获取到的全球数据进一步依据亚洲ISO3国家代码进行地理过滤,最终整合成涵盖18个亚洲国家的结构化数据集。数据经过ILO依据国际劳工统计学家会议(ICLS)定义进行统一协调处理,确保了不同来源微观数据之间的可比性,并在source.label字段中标注了原始数据来源,保证了数据的可追溯性。
特点
该数据集包含2,471条观测记录,时间跨度从1996年至2024年,覆盖了亚洲18个国家。数据核心指标为雇员月收入中位数,并提供了性别(男、女、总计等)、残疾状态(有残疾、无残疾、总计等)以及货币类型(本地货币、特定货币等)等多维度分类变量。数据列包括国家代码、来源、指标、性别、分类变量、观测年份、观测值及其状态标记。数据质量方面,对于同一国家与年份的多源数据,采用了ILO评选的'最佳来源',并提供了一系列注释字段(如序列中断说明、非标准定义说明),帮助用户理解数据波动与潜在偏差。
使用方法
该数据集以HuggingFace Datasets格式发布,用户可通过load_dataset()函数一键加载。加载后的数据可转换为Pandas DataFrame进行灵活操作。典型应用包括:通过ref_area列过滤特定国家的数据以进行国家层面的收入分析;针对单一指标按时间排序后绘制时间序列图,观察收入趋势;还可利用pivot_table将数据重塑为国家×年份的矩阵,便于进行跨国面板数据分析。数据集许可证为CC-BY-4.0,使用时需注明原始数据来源(ILO)及重组方Electric Sheep Asia,特别适合劳动经济学、残疾研究与亚洲劳动力市场比较等领域的学术探索。
背景与挑战
背景概述
在国际劳动统计领域,薪资数据的细粒度分解对于揭示劳动力市场的结构性不平等至关重要。该数据集由国际劳工组织(ILO)统计司(ILOSTAT)创建,经Electric Sheep Asia于2024年重新整理发布,聚焦于亚洲18个国家1996至2024年间按性别与残疾状况划分的员工月收入中位数。核心研究问题在于量化收入在性别与残疾交叉维度上的差异,填补了亚洲区域缺乏标准化、跨时间可比薪资微观数据的空白。作为ILOSTAT全球劳动力数据库的区域子集,其发布为可持续发展目标(SDG)中体面工作指标的监测提供了关键支撑,对发展经济学、劳动政策及社会公平研究具有深远影响力。
当前挑战
该数据集面临的领域挑战在于系统性地解析收入在性别与残疾身份交叉性上的分化机制,揭示传统统计中易被掩盖的群体间差异,并服务于包容性政策设计。构建过程中遭遇多重挑战:首先,各国数据来源不一致,涵盖劳动力调查、行政记录等多种渠道,导致方法连续性断裂(如'Break in series'标记);其次,残疾定义标准因国而异(见`note_classif.label`中'Nonstandard definition of disability'的说明),使得跨国际比较面临标准化障碍;再者,货币类型(本地货币)与通胀差异增加了时间序列分析中的可比性困难;最后,部分国家观测稀少(如3个国家的数据点不足30行),限制了稳健统计推断的可行性。
常用场景
经典使用场景
在劳动经济学与社会政策研究领域,该数据集最经典的使用场景是开展跨国别、长时序的工资差异分析。研究者可借助其中按性别与残疾状况交叉分类的月收入中位数数据,精准量化亚洲18个国家在1996至2024年间劳动力市场中的收入不平等格局。例如,通过构建面板数据模型,分析性别与残疾双重身份对雇员薪酬的交互效应,为识别弱势群体的经济边缘化程度提供坚实的实证基础。
解决学术问题
该数据集系统解决了亚洲区域劳动统计中残疾人群收入数据的稀缺与碎片化问题。它使得学者能够跨越单一国家限制,在统一的数据口径下探讨残疾歧视与性别薪酬差距的跨国异质性,填补了ILOSTAT全球数据库中亚洲子区域的纵向数据空白。其重要意义在于,为评估《残疾人权利公约》等国际条款在劳动收入维度的实施效果提供了可靠证据,推动了包容性增长理论的实证检验。
衍生相关工作
基于此数据集已衍生出若干关键工作,包括国际劳工组织发布的《世界就业与社会展望》系列报告中亚洲残疾工人收入章节的分析。在学术界,有研究利用该数据构建多水平模型,分解国家层面制度因素与个体层面特征对收入差异的贡献。此外,数据仓库如Electric Sheep Asia的重新打包工作,通过统一模式与Parquet格式,极大降低了机器学习研究者调用劳动统计数据的门槛,催生了基于时间序列预测的亚洲劳动力市场预警模型等前沿探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务