遇见数据集

electricsheepasia/asia-ilo-ear-emta-sex-dsb-nb-average-monthly-earnings-of-employees-by-sex-and-d

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲18个国家从1996年至2024年的856个观测值,核心指标为EAR_EMTA_SEX_DSB_NB,即按性别和残疾状况划分的员工月平均收入(以本地货币计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲国家代码,使用国际劳工统计学家会议(ICLS)定义进行协调。数据集包括国家代码、国家名称、数据来源、指标代码、性别分类、时间年份、观测值等列,提供按性别(总计、男性、女性、其他)和残疾状况的细分维度。数据为年度频率,涵盖劳动收入统计主题,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 856 observations from 18 Asian countries spanning 1996 to 2024, focusing on the indicator EAR_EMTA_SEX_DSB_NB, which represents the average monthly earnings of employees disaggregated by sex and disability status in local currency. Sourced from the ILOSTAT database of the International Labour Organization (ILO), the data is retrieved via API and filtered for Asian country codes, harmonized using International Conference of Labour Statisticians (ICLS) definitions. It includes columns such as country code, country name, data source, indicator code, sex classification, time year, observed value, and provides disaggregation dimensions by sex (total, male, female, other) and disability status. The data is annual frequency and covers labour earnings statistics, suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emta-sex-dsb-nb-average-monthly-earnings-of-employees-by-sex-and-d 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,专注于亚洲地区雇员按性别和残疾状况划分的平均月收入(以当地货币计)。数据通过ILOSTAT REST API直接获取,并筛选出亚洲ISO3国家代码。ILO依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,数据来源在source.label列中清晰标注,确保了数据的可追溯性和一致性。最终,由Electric Sheep Asia进行再包装,形成包含856条观测、覆盖18个亚洲国家、时间跨度为1996年至2024年的结构化表格数据集。
特点
该数据集的核心特点在于其精细的维度分解能力,不仅提供了按性别(总、男、女、其他)和残疾状态分类的月收入数据,还包含了观测状态标记(如临时、不可靠)以及详尽的注释信息,如货币单位和数据系列中断说明。数据为年度频率,并在同一国家与年份存在多个来源时,选用ILO认定的“最佳来源”。这一设计使得研究者能够深入分析亚洲地区不同性别和残疾状况雇员在收入上的差异与趋势,为劳动经济学、社会政策及可持续发展目标(SDG)相关研究提供了可靠的数据基础。
使用方法
该数据集的使用极为便捷,用户可通过HuggingFace的datasets库以一行代码load_dataset()完成加载,并直接转换为pandas DataFrame进行后续分析。典型应用场景包括:按国家过滤进行单一国家的时间序列分析;利用pivot_table构建国家×年份的收入矩阵,以进行跨国的横向比较;或结合obs_status列筛选高质量观测值。数据集中丰富的分类与注释列还支持复杂的多维分析,如探索不同残疾状态定义对收入统计的影响,以及评估数据质量对结论的潜在干扰。
背景与挑战
背景概述
在劳动经济学与可持续发展目标的交叉研究中,收入数据是衡量体面工作与经济增长(SDG 8)及减少不平等(SDG 10)的核心指标。该数据集由国际劳工组织(ILO)通过其ILOSTAT数据库发布,并由Electric Sheep Asia于2024年重新打包整理,涵盖18个亚洲国家从1996年至2024年的856条观测记录,核心变量为按性别和残疾状况划分的雇员平均月收入(本币)。作为全球劳动统计的权威来源,ILO对各国劳动力调查数据进行统一标准化处理,使得该数据集能够服务于跨国比较分析、时间序列建模及政策评估,特别在探讨残疾人群体的劳动收入差异与性别收入差距的交叉效应方面具有独特价值。其影响力体现在为亚洲区域内的包容性劳动政策提供了实证基础,促进了以证据为基础的国际发展议程制定。
当前挑战
该数据集所解决的领域问题包括:第一,劳动收入统计中普遍存在的性别与残疾状态交叉分类数据缺失,导致对弱势群体经济状况的估计存在偏差;第二,跨国比较时因各国调查口径、货币单位及通胀因素导致的不可比性。在构建过程中遭遇的挑战包括:其一,ILO需从各国差异化的劳动力调查(如住户调查、企业调查)中提取并统一按ICLS定义进行标准化,过程涉及大量数据清洗与元数据追溯;其二,数据时间跨度近三十年间,部分国家因调查方法变更或统计断代产生观测值标记(如“序列中断”),需额外标注以警示用户;其三,数据集仅收录年度频率数据,无法反映季度或月度波动,限制了高频劳动市场动态分析的应用场景。
常用场景
经典使用场景
该数据集以亚洲18个国家1996至2024年间雇员平均月收入为核心变量,按性别与残疾状态进行精细分层,可广泛用于劳动经济学中的收入不平等分析、性别工资差距研究以及残疾人群体的劳动市场融入状况评估。经典的使用方式包括对时间序列数据进行趋势追踪、构建面板数据模型以识别不同国家维度的收入差异,以及结合人口统计学特征进行交叉比较,从而揭示亚洲地区劳动力市场中结构性收入分布的演变规律。
解决学术问题
数据集有效回应了劳动经济学中关于性别与残疾状态如何影响收入分配的核心学术问题。通过提供跨国、长时段的标准化分层收入数据,研究者可以突破此前因数据碎片化而难以开展的系统性比较分析瓶颈。该数据集为验证人力资本理论、劳动力市场歧视假说以及制度因素对收入调节作用提供了扎实的实证基础,其意义在于推动亚洲地区的劳动市场研究从案例描述走向量化推断。
衍生相关工作
基于ILOSTAT体系,该数据集衍生了一系列关于亚洲劳动市场不平等的前沿工作。典型成果包括构建跨国收入收敛性模型以评估全球化对地区收入差距的影响,开发结合性别与残疾交叉维度的双层分解方法,以及将时间序列预测模型应用于收入变动预警。此外,该数据常被整合至多源劳动统计面板数据库之中,支撑了多项关于体面劳动(Decent Work)指标体系的实证研究,成为亚洲区劳动经济学研究的重要基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务