遇见数据集

electricsheepasia/asia-ilo-ear-emtg-sex-edu-nb-gini-index-of-monthly-earnings-of-employees-by-sex

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自27个亚洲国家的9,786条观察数据,涵盖1996年至2025年期间,涉及1个独特指标,主题为收入和薪酬不平等。具体指标为按性别和教育程度划分的员工月收入基尼指数(Gini index of monthly earnings of employees by sex and education)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲国家。数据集提供了按国家、年份、性别、教育程度等维度的细分数据,适用于表格分类、回归分析和时间序列预测等机器学习任务。

This dataset contains 9,786 observations of Income and pay inequality data across 27 Asia countries, spanning 1996–2025, covering 1 distinct indicator: Gini index of monthly earnings of employees by sex and education. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, filtered for Asia countries, and includes disaggregation by dimensions such as country, year, sex, and education. It is suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emtg-sex-edu-nb-gini-index-of-monthly-earnings-of-employees-by-sex 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API直接提取指标代码为EAR_EMTG_SEX_EDU_NB的数据,并依据亚洲ISO3国家代码进行地理范围过滤。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调处理,并在source.label列中标注数据来源以供追溯。最终数据由Electric Sheep Asia重新打包,形成包含9786条观测、覆盖27个亚洲国家、时间跨度为1996年至2025年的结构化表格数据集。
特点
该数据集聚焦于亚洲地区按性别和教育程度划分的雇员月收入基尼系数,是衡量收入与薪酬不平等状况的核心指标。其特色在于提供多维度分解信息,包括性别(总、男、女、其他)和教育程度分类,并附带详尽的数据质量注释,如观测状态标记、序列中断说明及来源注释。数据集还包含27个亚洲国家的广泛地理覆盖,时间跨度近三十年,为区域收入不平等研究提供了丰富而细致的纵向数据支持。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数一键加载数据,并将其转换为Pandas DataFrame进行后续分析。典型应用包括按国家筛选子集以进行国别时间序列分析,利用obs_value列对特定指标进行时序趋势绘制,或通过透视表操作构建国家×年份的观测值矩阵,便于跨区域比较。数据集的schema清晰定义了各列字段类型与含义,支持灵活的tabluar分类、回归及时序预测任务,直接适配机器学习工作流。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)通过其核心统计数据库ILOSTAT构建,并由Electric Sheep Asia于2025年重新打包发布,聚焦于亚洲地区性别与教育维度下的月收入基尼系数,包含27个亚洲国家1996至2025年间共9786条观测记录。基尼系数作为衡量收入不平等程度的经典指标,在劳动经济学与社会分层研究中具有核心地位,而按性别与教育水平的分层分析更揭示了不同群体间收入差距的结构性特征。该数据集不仅为亚洲劳动经济学与收入分配领域提供了标准化的跨国家时间序列数据,还因其ILOSTAT官方来源与ILO国际专家团队对各国调查微观数据的协调处理,成为研究者分析亚洲劳动力市场不平等演变趋势、评估政策干预效果以及开展跨国比较研究的重要基础资源。
当前挑战
数据集所解决的领域核心问题在于量化亚洲地区收入不平等的多维结构,弥补了现有全球数据库中亚洲国家性别与教育维度基尼系数碎片化、缺乏统一标准的不足。构建过程中面临的挑战包括:各国调查体系存在差异,如劳动力调查与家庭收支调查的统计口径、抽样方法及时间频率不一,ILOSTAT需依据国际劳工统计学家会议(ICLS)定义进行数据协调;部分国家存在统计断层与序列断裂,数据质量标签(如'B'代表序列中断)提示了历史数据的可比性风险;性别与教育水平的分层缺失问题普遍,当特定国家或年份未发布该细分数据时,相应列为空,增加了多变量分析的复杂性。这些挑战要求使用者审慎处理观测值状态与注释字段,以避免因数据质量不均导致的推断偏倚。
常用场景
经典使用场景
在劳动经济学与不平等研究领域,该数据集最经典的使用场景是追踪亚洲国家内部不同性别与教育程度群体的劳动收入不平等演化轨迹。研究者可基于ILO国际标准定义的基尼指数,结合覆盖27个亚洲国家近30年(1996–2025年)的年度观测,系统刻画性别薪资差距在横向国家间与纵向时间维度上的差异。尤为关键的是,数据提供了按性别(总、男、女)与教育水平聚合的细分维度的基尼系数,使得学者能够精确剖析教育回报率在性别间的分布变化,进而探讨人力资本投资、劳动力市场歧视以及经济发展阶段的交互作用。这一应用为揭示亚洲快速工业化与社会转型过程中的结构性不平等提供了可靠的数据基础。
实际应用
在实际应用层面,该数据集为国际组织、国家劳动部门以及发展智库提供精准的循证决策支持。国际劳工组织可据此监测亚洲各国在可持续发展目标(SDG)目标10(减少国家内部和国家之间不平等)上的进展,特别是指标10.4.1(劳动收入份额)的衍生分析。国家劳动与社会保障部门可基于数据中反映的性别薪资差异与教育回报率变化,设计针对性的职业培训计划、反歧视立法或工资补贴政策。此外,非政府组织在撰写区域不平等报告或进行政策影响力评估时,可利用该数据集计算特定国家教育投资对缩小基尼系数的边际贡献,从而优化扶贫与教育援助资源的配置策略。
衍生相关工作
这一数据集的发布推动了多项衍生性经典工作的诞生,尤其在方法论与跨学科融合层面。在计量经济学领域,学者基于该面板数据开发了针对非平衡面板数据中异质性处理效应的估算方法,例如利用交互固定效应模型分离教育在不同性别群体间的不平等传导路径。在机器学习领域,研究者构建了基于时序基尼系数的预测框架,利用长短期记忆网络(LSTM)或Transformer架构对亚洲各国未来3–5年的收入不平等趋势进行概率预测,并引入注意力机制识别关键驱动因子(如性别或教育水平)。此外,结合地理空间分析与劳动力流动数据,还衍生出联合估计城市与农村基尼系数空间溢出效应的工作,为区域协调发展策略提供计算社会科学的量化洞见。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务