遇见数据集

electricsheepasia/asia-ilo-ear-emtg-sex-age-nb-gini-index-of-monthly-earnings-of-employees-by-sex

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含6,609个观测值,涉及27个亚洲国家,覆盖1996年至2025年,专注于收入和薪酬不平等数据,具体指标为按性别和年龄划分的雇员月收入基尼指数。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤至亚洲国家,涵盖了性别(总、男性、女性等)和年龄等分类维度,用于表格分类、回归和时间序列预测任务。数据集包括国家代码、年份、观测值、数据来源和质量标志等列,适用于劳动力市场分析和经济研究。

This dataset contains 6,609 observations of income and pay inequality data across 27 Asia countries, spanning 1996–2025, covering 1 distinct indicator: Gini index of monthly earnings of employees by sex and age. It is sourced from the ILOSTAT database of the International Labour Organization (ILO), filtered to Asian countries via API, and includes disaggregation dimensions such as sex (total, male, female, etc.) and age. The data is structured for tabular classification, regression, and time-series forecasting tasks, with columns for country codes, years, observed values, source information, and quality flags, suitable for labor market and economic analysis.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emtg-sex-age-nb-gini-index-of-monthly-earnings-of-employees-by-sex 数据集图片
构建方式
该数据集由Electric Sheep Asia团队基于国际劳工组织ILOSTAT数据库精心整理与封装。研究团队通过调用ILOSTAT官方REST API接口,获取以基尼系数为指标的雇员月收入不平等数据,并严格筛选出覆盖27个亚洲国家的观测记录,时间跨度自1996年至2025年,共计6609条高质量数据条目。在数据清洗与标准化过程中,团队遵循国际劳工统计学家会议定义,确保不同来源的微观调查数据得以统一,同时保留原始来源标签以保障数据可追溯性,最终以Parquet格式存储并发布至HuggingFace平台。
特点
本数据集聚焦于亚洲地区雇员月收入的基尼系数,并依据性别与年龄维度进行细致分层,提供了SEX_T(总计)、SEX_M(男性)、SEX_F(女性)及SEX_O(其他)四种性别分类。数据来源涵盖劳动力调查、家庭收入调查等多类权威统计资料,每条记录均包含观测值、观测状态标志及详尽的分类注释。此外,数据集标注了数据质量警告,如序列中断或非标准年龄分组,为研究者提供了透明且可靠的元数据支撑,尤其适合开展跨国家、跨时段的收入不平等比较研究。
使用方法
用户可通过HuggingFace `datasets`库的`load_dataset()`函数快速加载该数据集,并直接转换为Pandas DataFrame进行剖析。借助`ref_area`列可筛选特定国家子集,利用`time`与`obs_value`字段可绘制单一指标的时间序列趋势。研究者还可通过`pivot_table`方法将数据重塑为国家×年份的矩阵形式,便于面板数据分析或构建预测模型。该数据集兼容分类、回归与时间序列预测任务,为劳动经济学与不平等研究提供了便捷、高效的机器学习就绪数据接口。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)通过其核心统计数据库ILOSTAT发布,并于2025年由Electric Sheep Asia在HuggingFace平台重新打包整合,旨在为亚洲地区收入与薪酬不平等研究提供标准化、机器可读的微观数据资源。数据集聚焦于1996年至2025年间27个亚洲国家的员工月薪基尼系数,按性别与年龄进行细分,包含6609条观测记录,是研究劳动力市场中收入分配差异、性别薪酬差距及代际经济不平等问题的关键数据基础。其影响力体现在为发展经济学、劳动社会学及公共政策领域提供了跨时空的可比性指标,支撑了联合国可持续发展目标(SDGs)中关于体面劳动与经济增长的量化评估。
当前挑战
该数据集所解决的领域问题涵盖亚洲发展中国家与新兴经济体内收入不平等测量的多重困境,包括基层劳动力调查覆盖率不均、不同国家调查问卷设计差异导致的数据可比性不足,以及历史数据缺失造成的时序分析断裂。在构建过程中,核心挑战在于从ILOSTAT REST API海量异构数据中筛选并标准化亚洲国家子集,处理多种抽样调查(如劳动力调查、家庭收入调查)间的方法论差异,并针对性别与年龄分类变量中出现的非标准分组(如排除特定年龄段的注释)实施数据清洗与标识。此外,数据质量标注(如观测状态为“序列中断”或“临时性”)的解析和跨来源“最佳选择”规则的自动化应用,进一步增加了数据集构建的复杂度。
常用场景
经典使用场景
该数据集汇聚了27个亚洲国家自1996年至2025年间近六千余条关于雇员月收入基尼系数的观测记录,按性别与年龄维度精细分层。作为衡量收入分配平等程度的经典指标,基尼系数在此被系统性地整理为结构清晰的表格数据,为分析亚洲地区收入不平等的时间演变与跨国差异提供了扎实的纵向面板数据基础。研究者可借助该数据集开展跨国家、跨时段的不平等动态比较,或结合性别与年龄子群体进行细分分析,从而揭示经济发展、劳动力市场结构与收入分配格局之间的深层关联。其规整的年度时间序列格式也使其天然适配于时间序列预测与回归建模任务,便于模型捕捉不平等指标的变化趋势与潜在转折点。
衍生相关工作
这一数据集的系统化发布催生了多条富有成效的研究脉络。一方面,基于该面板数据的基尼系数序列,学者们构建了亚洲收入不平等的聚类分析图谱,识别出南亚、东南亚与西亚内部不同类型的分配格局演化模式。另一方面,研究者利用性别维度的分解数据,衍生出一系列关于女性劳动参与率、教育回报率与工资歧视程度之间交互作用的计量分析,深化了对性别工资差距驱动因素的理解。在方法论层面,该数据集推动了混合效应模型与贝叶斯结构时间序列模型在收入不平等预测中的应用,部分工作还尝试将基尼系数与宏观经济指标(如GDP增长率、城镇化率)进行格兰杰因果关系检验,揭示了经济发展阶段与分配公平之间复杂的非对称反馈机制。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区员工月收入基尼系数的性别与年龄差异分析,依托国际劳工组织ILOSTAT官方统计资料,整合了1996至2025年间27个亚洲国家的6609条观测记录。在劳动经济学前沿研究中,这一结构化时序数据为探究全球化背景下亚洲劳动力市场的收入不平等动态提供了关键实证基础,尤其可服务于性别薪酬差距演变、代际福利差异及区域经济政策效果的量化评估。伴随亚太地区劳动人口结构转型与零工经济崛起,研究者可借助该数据集揭示传统统计与新兴就业形态间的收入分布张力,推动包容性增长政策的循证设计。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务