遇见数据集

electricsheepasia/asia-ilo-ear-ehrg-sex-mts-nb-gini-index-of-hourly-earnings-of-employees-by-sex

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲地区25个国家从1996年至2025年的5,424个观测值,专注于收入与薪酬不平等指标,具体为“按性别和婚姻状况划分的员工每小时收入基尼指数”。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤为亚洲国家。数据集涵盖了国家代码、国家名称、数据来源、指标代码、指标名称、性别分类、婚姻状况分类、观测年份、观测值、观测状态等字段,适用于表格分类、表格回归和时间序列预测等任务。数据经过ILO的标准化处理,使用国际劳工统计学家会议(ICLS)定义,并标注了数据来源和质量信息,以确保可追溯性和可靠性。数据集以Parquet格式发布,便于机器学习应用,并遵循CC-BY-4.0许可证。

This dataset contains 5,424 observations of income and pay inequality data across 25 Asia countries, spanning from 1996 to 2025. It focuses on the indicator Gini index of hourly earnings of employees by sex and marital status. The data is sourced from the International Labour Organizations (ILO) ILOSTAT database, retrieved via REST API and filtered to Asia ISO3 country codes. It includes fields such as country code, country name, source code, source label, indicator code, indicator label, sex disaggregation, marital status classification, observation year, observed value, and observation status. The dataset is suitable for tabular classification, tabular regression, and time-series forecasting tasks. Data is harmonized using ICLS definitions, with source flags for traceability, and is published in Parquet format for machine learning applications under the CC-BY-4.0 license.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehrg-sex-mts-nb-gini-index-of-hourly-earnings-of-employees-by-sex 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过调用其REST API接口,针对亚洲地区国家筛选出与按性别和婚姻状况划分的雇员小时收入基尼系数相关的观测数据。原始数据由ILO基于各国劳动力调查、家庭收入调查及行政记录等微观数据,依据国际劳工统计学家会议(ICLS)定义进行统一整理与编纂。Electric Sheep Asia团队对获取的数据进行了重新封装,形成结构化的表格数据集,确保每个观测值均附有来源标识以便追溯。
特点
数据集包含5,424条观测记录,覆盖25个亚洲国家,时间跨度从1996年至2025年,聚焦于收入与薪酬不平等这一核心议题。其独特之处在于提供了按性别(总、男性、女性)及婚姻状况维度细分的基尼指数,并附有详尽的元数据列,如数据来源、观测状态标记及注释信息,便于用户评估数据质量。此外,各条目均保留原始指标代码与标签,支持跨国家、跨时间的纵向比较与聚合分析。
使用方法
用户可通过HuggingFace Datasets库的`load_dataset()`函数直接加载该数据集,无缝转换为Pandas DataFrame格式进行后续分析。典型应用包括:按国家筛选子集进行国别研究,利用时间列对特定指标绘制时序图以观察变化趋势,或通过数据透视表构建国家×年份的矩阵实现多维度比较。数据集的规范化Schema设计使其适用于表格分类、回归分析及时间序列预测等多种机器学习任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,并由Electric Sheep Asia于2025年重新打包发布,聚焦于亚洲地区员工小时收入的基尼系数(Gini index),覆盖25个亚洲国家、1996年至2025年的5,424条观测记录。作为衡量收入不平等程度的经典指标,基尼系数在劳动经济学与公共政策研究中扮演着核心角色。ILOSTAT作为全球劳动统计的权威来源,通过整合各国劳动力调查与行政记录,提供了标准化的跨国可比数据。该数据集的发布填补了亚洲区域收入不平等研究在时间跨度和性别、婚姻状况等维度上的数据空白,为探究经济发展、劳动力市场结构与收入分配关系提供了关键支撑,对实证劳动经济学和可持续发展目标(SDGs)中的体面工作评估具有显著的学术与政策价值。
当前挑战
该数据集所解决的领域问题在于:全球尤其是亚洲地区缺乏长期、细颗粒且性别间可比的收入不平等面板数据,传统收入调查常因口径不一而难以进行跨国时序分析。构建过程中面临的挑战包括:1)ILOSTAT需协调来自25国不同统计体系的原始微观数据,依据国际劳工统计学家会议(ICLS)定义进行标准化处理,处理调查方法差异、缺失值和断点序列(如'Break in series'标记);2)数据以年度频率发布,而部分国家存在月度或季度序列,需在保持可比性的前提下进行频率整合;3)对于同一国家-年份组合的多源数据,需遴选ILO认定的'最佳来源',确保指标一致性;4)性别、婚姻状况等分类维度存在潜在的非完备性,如classif1变量可能因国家而异,增加了跨域分析的复杂性。
常用场景
经典使用场景
该数据集聚焦于亚洲地区按性别与婚姻状况分组的雇员小时收入基尼系数,涵盖1996年至2025年期间25个国家的5,424条观测记录。其最经典的用途在于支撑劳动经济学中收入不平等的时间序列分析与跨国比较研究。研究者可通过该数据追踪特定国家或区域间收入差距的演变趋势,结合性别与婚姻状态等维度进行差异化剖析,从而揭示不同社会经济群体在劳动报酬分配中的结构性差异。此外,该数据集为面板数据回归、分层线性模型及非参数估计等方法提供了标准化的输入素材,适用于检验库兹涅茨曲线假设、性别工资差距收敛性等经典理论命题。
实际应用
在实际应用中,该数据集为多边组织、政府统计部门及政策研究机构提供了基准化的不平等监测工具,支持国别间收入分配的动态评估与趋势预警。依托ILOSTAT的标准化口径,分析师能够精准识别性别工资鸿沟的演变节点及高不平等群体的分布特征,为制定针对性的劳动报酬干预措施、完善最低工资制度及推进性别平等政策提供数据驱动的决策依据。该数据还可被整合进全球经济模型或社会核算矩阵中,用于模拟收入再分配政策在区域尺度上的潜在效果,提升公共治理的科学性与前瞻性。
衍生相关工作
围绕该数据集衍生了一系列经典的学术研究与方法论工作。在实证层面,基于该基尼系数时间序列的研究常将其与教育回报率、产业结构转型及劳动力市场制度等变量耦合,构建收入不平等的多层次解释框架,典型代表包括对东南亚新兴经济体性别工资趋同现象的成因分析。在方法论方面,该数据集推动了缺失数据插补、调查数据质量一致性评估以及跨国面板数据协调技术的进步,部分研究还探讨了基尼系数与泰尔指数等替代不平等测度在不同细分群体下的适用性。这些衍生工作共同丰富了劳动统计学的理论工具与实证边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务