遇见数据集

electricsheepasia/asia-ilo-ear-ehrg-sex-ocu-nb-gini-index-of-hourly-earnings-of-employees-by-sex

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲25个国家按性别和职业划分的员工每小时收入基尼指数的表格数据,涵盖1997年至2025年,共9,009个观测值,涉及1个核心指标(EAR_EHRG_SEX_OCU_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过重新打包以适用于机器学习任务,包括国家代码、数据来源、性别分类、时间年份、观测值等列,用于收入不平等分析和预测。

This dataset contains tabular data on the Gini index of hourly earnings of employees by sex and occupation across 25 Asian countries, spanning from 1997 to 2025, with 9,009 observations and one core indicator (EAR_EHRG_SEX_OCU_NB). It is sourced from the ILOSTAT database of the International Labour Organization (ILO), repackaged for machine learning applications, and includes columns such as country codes, data sources, sex classifications, time years, and observed values, aimed at income inequality analysis and forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehrg-sex-ocu-nb-gini-index-of-hourly-earnings-of-employees-by-sex 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,聚焦于亚洲地区雇员时薪基尼系数这一关键收入不平等指标。数据通过ILOSTAT提供的REST API接口直接获取,原始指标编码为EAR_EHRG_SEX_OCU_NB,并依据亚洲ISO3国家代码进行地理筛选。ILOSTAT基于国际劳工统计学家会议(ICLS)定义对各国原始调查微观数据进行统一协调处理,数据来源在source.label字段中予以标注,确保了跨国的可比性与可追溯性。数据集由Electric Sheep Asia团队重新打包,以标准化的表格格式呈现,便于机器学习与统计分析场景下的直接使用。
特点
该数据集包含9,009条观测记录,覆盖25个亚洲国家,时间跨度从1997年至2025年,展现了近三十年间亚洲地区收入分配格局的演变。数据按性别(男、女、总体)和职业技能水平进行分层,提供了多维度的不平等测度视角。每个观测值均附带详细的元数据,包括数据来源、观测状态标识(如连续性中断)以及注释信息,为用户评估数据质量提供了坚实依据。数据集以年度频率发布,并采用国际劳工组织认定的“最佳来源”处理同一国家同年份的多源数据,确保了指标的一致性与权威性。
使用方法
用户可通过HuggingFace的datasets库一键加载该数据集,命令为load_dataset('electricsheepasia/asia-ilo-ear-ehrg-sex-ocu-nb-gini-index-of-hourly-earnings-of-employees-by-sex'),返回的Dataset对象可轻松转换为pandas DataFrame进行分析。基于清晰的列结构,用户可按国家代码(ref_area)筛选特定国家的子集,也可通过时间列(time)与观测值列(obs_value)绘制时间序列图,直观展示特定指标在亚洲不同经济体的演变趋势。此外,利用pivot_table方法可便捷地将长格式数据重塑为国家×年份的矩阵,便于进行面板数据分析或跨区域比较研究。
背景与挑战
背景概述
收入不平等是劳动经济学与社会分层研究的核心议题,基尼系数作为衡量收入分配差距的权威指标,长期受到国际组织与学术界的密切关注。该数据集由国际劳工组织(ILO)于2025年发布,经Electric Sheep Asia整合后面向机器学习社区开放,聚焦亚洲25个国家1997至2025年间按性别与职业划分的雇员小时收入基尼指数。数据集源于ILOSTAT统计数据库,涵盖9,009条观测值,其构建基于ILO对各国家庭收入调查与劳动力调查数据的一致性协调。该数据的问世不仅填补了亚洲区域收入不平等细粒度时序数据的空白,更使得研究者得以跨国家、跨性别、跨职业分析收入差异的动态演化,对探讨全球化背景下的收入分配机制、性别工资差距及职业分层规律产生了深远影响。
当前挑战
该数据集所解决的领域挑战在于,亚洲发展中经济体的收入不平等研究长期受困于数据颗粒度不足、时间序列短且跨国可比性差,现有基尼系数多按国家年度汇总,难以揭示性别与职业维度下的深层不平等结构。本数据集通过整合ILO的标准化统计框架,提供了统一的按性别与技能职业分类观测值,使跨国的性别工资差距与职业隔离效应分析成为可能。在构建过程中,面临的挑战包括各国调查数据的来源多元化与元数据异构,需对多种劳动力调查类型进行同质化处理,并采用ICLS定义对齐不同年代的统计口径;同时,部分国家的观测年份稀疏、分类标签不完整,要求在保持溯源可追踪的前提下进行缺失标记与数据质量标注,最终生成规则化的时序表格数据。
常用场景
经典使用场景
该数据集汇集了1997至2025年间亚洲25个国家的雇员小时收入基尼系数,按性别和职业因素进行细分,覆盖9,009条观测记录。这一标准化的面板数据结构使其成为研究亚洲劳动力市场收入分配不平等演变趋势的权威资料,特别适合用于跨国比较研究和纵向时间序列分析。研究者可以通过性别分类字段(SEX_T/SEX_M/SEX_F)识别不同性别群体内部的收入差距,利用职业分类变量洞察不同技能层级劳动者的薪酬分化格局。其典型使用方式包括:筛选特定国家的观测值以开展国别案例研究,或构建国家-年份交叉矩阵,为后续计量经济学建模提供基础数据支撑。
衍生相关工作
该数据集作为ILOSTAT核心指标在亚洲区域的浓缩版本,催生了多项衍生研究工作。其一,研究者基于该面板数据构建动态面板回归模型,检验了外商直接投资、产业结构升级与收入不平等之间的非线性关系;其二,学者利用性别分类字段开展Oaxaca-Blinder分解分析,量化了亚洲国家内劳动力市场歧视对性别工资差距的相对贡献;其三,该数据与ILO其他就业指标(如非正规就业率、失业率)结合,生成了综合性的劳工权益评价指数。这些衍生工作从多重维度深化了对亚洲劳动力市场收入分配机制的理解,也突显了该数据在跨学科学术对话中的桥梁作用。
数据集最近研究
最新研究方向
在亚洲劳动力市场不平等研究前沿,该数据集为评估区域内25个国家1977至2025年间按性别和职业划分的小时工资基尼指数提供了标准化、机器可读的时间序列基础。当前学术热点集中于利用此类高频面板数据,结合ILOSTAT统一分类框架,剖析亚洲新兴经济体在经济转型与后疫情复苏过程中的结构性工资差距演变。通过整合性别、职业技能等级等多重细分维度,研究者得以量化女性在非正规就业中的报酬劣势,并追踪职业技能二元分化对基尼系数的动态影响,从而为国际劳工组织及各国内部推进体面劳动目标提供交叉验证的实证依据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务