遇见数据集

electricsheepasia/asia-ilo-ear-ehrg-sex-dsb-nb-gini-index-of-hourly-earnings-of-employees-by-sex

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲15个国家的542个观测值,时间跨度为1997年至2024年,主要指标为“按性别和残疾状况划分的员工小时收入基尼指数”(Gini index of hourly earnings of employees by sex and disability status)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲国家代码,涵盖收入与薪酬不平等主题。数据集包括国家、年份、指标值、性别分类(总计、男性、女性等)、残疾状况分类等字段,用于分析亚洲地区收入不平等趋势。数据经过ILO统一处理,采用国际劳工统计学家会议(ICLS)定义,并标注来源以便追溯。

This dataset contains 542 observations of income and pay inequality data across 15 Asia countries, spanning 1997–2024, covering the indicator Gini index of hourly earnings of employees by sex and disability status. It is sourced from the ILOSTAT database of the International Labour Organization (ILO), filtered to Asia ISO3 country codes, and includes fields such as country code, year, indicator value, sex disaggregation, and disability status classification for analyzing income inequality trends in Asia. The data is harmonized by ILO using ICLS definitions and includes source flags for traceability.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehrg-sex-dsb-nb-gini-index-of-hourly-earnings-of-employees-by-sex 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API直接获取指标代码为EAR_EHRG_SEX_DSB_NB的原始数据,并依据亚洲ISO3国家代码进行地理过滤。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,数据来源在source.label字段中加以标注,保证了数据来源的可追溯性。数据集由Electric Sheep Asia进行重新封装,以Parquet格式发布,便于机器学习流水线的直接加载。
特点
数据集涵盖1997年至2024年间15个亚洲国家的542条观测记录,聚焦于小时收入的基尼指数这一核心指标,并按性别和残疾状况进行分层细分。数据维度包括性别(总、男、女、其他)以及残疾状态等多重分类变量,为分析劳动力市场收入不平等提供了精细化的视角。数据集采用年度频率,并通过obs_status字段标注数据质量(如序列中断、临时性等),便于研究者甄别数据可靠性。
使用方法
研究者可通过HuggingFace Datasets库的load_dataset函数一键加载数据,并转换为Pandas DataFrame进行后续分析。典型操作包括按国家代码过滤单一国家的时间序列数据,按指标排序并绘制基尼指数的时间演变图,以及利用pivot_table构建以时间为行、国家为列的矩阵,便于跨区域比较。数据集中的ref_area、time和obs_value字段构成了面板数据的核心结构,适合进行回归分析与时间序列建模。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2024年通过其ILOSTAT数据库整理发布,并由Electric Sheep Asia重新包装,聚焦于亚洲15个国家1997年至2024年间按性别和残疾状况划分的雇员时薪基尼系数。基尼系数作为衡量收入不平等程度的核心指标,在劳动经济学、社会政策及可持续发展目标(SDG)研究中具有举足轻重的地位。该数据集包含542条观测值,覆盖从阿富汗到印尼等亚洲经济体的收入分配数据,为探究亚洲地区劳动力市场中性别与残疾双重维度下的薪酬差异提供了标准化、跨时空的比较基础。其发布填补了亚洲区域高粒度收入不平等数据的空白,尤其对评估SDG第8项(体面工作与经济增长)及第10项(减少不平等)的进展具有关键支撑作用,推动了基于证据的政策制定与学术研究的深化。
当前挑战
该数据集所解决的核心领域问题是如何系统量化亚洲地区因性别与残疾状况引发的收入不平等动态,这一研究长期受限于数据碎片化与口径不一。在构建过程中,主要挑战包括:1)数据整合挑战,需从15国各异的劳动力调查、家庭收入调查等原始数据源中提取一致指标,并依据国际劳工统计学家会议(ICLS)定义进行标准化处理,例如处理不同调查中残疾状态的界定差异;2)时空覆盖不均,如柬埔寨(107条)与马尔代夫(仅9条)的观测频次悬殊,早期年份数据(如1997年)稀疏,导致时间序列分析面临选择偏差;3)数据质量标注复杂,需区分“最佳来源”与“中断序列”等状态标记,且部分观测值因统计方法变更(如break in series)需要额外验证,增加了模型训练的噪声控制难度。
常用场景
经典使用场景
该数据集收录了国际劳工组织ILOSTAT数据库中关于亚洲15个国家1997至2024年间按性别和残疾状况分层的小时工资基尼系数,共计542条观测值。研究人员常将其用于衡量亚洲地区劳动力市场中收入不平等的演变趋势,尤其是通过性别和残疾状况的双重视角,剖析不同群体在工资分配中的结构性差异。数据以年度频率呈现,便于进行国家间横向比较与时间序列纵向分析,是劳动经济学中评估体面工作目标实现进程的核心数据资源。
实际应用
在实际应用层面,该数据集为国际组织、各国劳动部门及非政府组织提供了监测和评估劳动政策的量化工具。政策制定者可利用其中按性别和残疾状况分列的基尼指数,识别哪些亚洲国家在缩小工资差距方面进展缓慢,从而针对性调整最低工资标准、反歧视法规及残疾人就业支持项目。此外,数据集中的来源标注和断点标识有助于追踪统计口径变化,确保跨年代比较的可靠性,进而辅助联合国、世界银行等机构编制《世界社会报告》和《全球就业与社会展望》等权威出版物。
衍生相关工作
该数据集衍生了若干具有影响力的学术工作。基于ILOSTAT统一口径的劳动力数据,众多研究构建了亚洲区域收入不平等面板数据,并据此分析了全球化、技术进步与制度变迁对工资分布的影响。例如,部分学者利用该基尼系数序列验证了库兹涅茨曲线在亚洲新兴经济体的适用性,另有工作将其与性别工资比率结合,探讨了女性劳动参与率上升对家庭内部资源分配的重塑作用。此外,该数据也催生了机器学习领域的尝试,研究者通过时间序列模型预测收入不平等走势,或利用分类算法识别高不平等国家的共同制度特征。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务