遇见数据集

electricsheepasia/asia-ilo-ear-ehrg-sex-eco-nb-gini-index-of-hourly-earnings-of-employees-by-sex

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含19,442个观测值,覆盖25个亚洲国家,时间跨度为1997年至2025年,主要指标为按性别和经济活动划分的员工小时收入基尼指数。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,主题涉及收入与薪酬不平等。数据集提供了国家代码、指标代码、年份、观测值等列,并包含性别和经济活动等细分维度。数据经过ILO harmonisation处理,使用ICLS定义,适用于表格分类、回归和时间序列预测等任务。数据集由Electric Sheep Asia重新打包,以Parquet格式发布,便于机器学习使用。

This dataset contains 19,442 observations across 25 Asia countries from 1997 to 2025, focusing on the indicator Gini index of hourly earnings of employees by sex and economic activity. It is sourced from ILOSTAT, the International Labour Organizations statistics database, with a topic of income and pay inequality. The dataset includes columns such as ref_area (country code), indicator (indicator code), time (year), obs_value (observed value), and disaggregation dimensions like sex and economic activity. Data is harmonized using ICLS definitions and repackaged by Electric Sheep Asia in Parquet format for machine learning applications, suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehrg-sex-eco-nb-gini-index-of-hourly-earnings-of-employees-by-sex 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过REST API接口直接提取指标EAR_EHRG_SEX_ECO_NB的原始数据,并依据亚洲ISO3国家代码进行地理范围过滤而构建。ILOSTAT整合了各国劳动力调查、家庭收入调查、机构调查及行政记录等多元来源的微观数据,并采用国际劳工统计学家会议(ICLS)定义进行标准化处理,以保障数据的一致性与可比性。最终数据集包含19,442条观测记录,覆盖25个亚洲国家,时间跨度从1997年至2025年,由Electric Sheep Asia团队重新打包整理形成机器学习就绪的Parquet格式。
特点
该数据集聚焦于按性别和经济活动划分的雇员小时收入基尼系数这一核心指标,为研究亚洲地区的收入与薪酬不平等提供了精细化的量化视角。数据集合有丰富的分类维度,包括性别(总、男、女、其他)和经济活动部门,并附有详细的来源标签与观测状态标志,便于用户追溯数据质量。值得注意的是,数据集囊括了土耳其、印度尼西亚、柬埔寨等观测数量较多的国家,同时覆盖了阿富汗、不丹等较少被关注的区域,呈现出多样化的地理与时间覆盖特性,为跨国家、跨时期的比较分析奠定了坚实基础。
使用方法
用户可通过HuggingFace Datasets库直接加载该数据集,使用`load_dataset`函数一键获取训练集,并便捷地转换为Pandas DataFrame进行后续操作。使用方式灵活多样:可按国家代码筛选特定地区的数据进行聚焦分析;可针对单一指标按时间排序,绘制基尼系数的时间序列变化图;还可利用透视表功能构建以时间为行、国家为列的矩阵,便于观察横向对比与纵向演变趋势。该数据集的标准化结构与清晰列名设计,使其能够无缝融入时间序列预测、表格分类与回归等机器学习任务流程。
背景与挑战
背景概述
收入与薪酬分配不均是发展经济学与劳动经济学领域的核心议题,其度量依赖于可靠且具备跨国可比性的统计数据。国际劳工组织(ILO)自1919年成立以来,始终致力于通过其统计数据库ILOSTAT为全球劳工政策提供数据支撑。在此背景下,发布于2025年的亚洲小时收入基尼系数数据集(Asia-ILO-EAR_EHRG_SEX_ECO_NB)由Electric Sheep Asia在HuggingFace平台重新封装发布,依托ILO的权威官方数据源,系统整合了1997年至2025年间覆盖25个亚洲国家的收入不平等指标。该数据集聚焦于按性别和经济活动分类的小时收入基尼系数,为研究亚洲地区劳动力市场的结构性差异、性别收入差距以及经济发展阶段对收入分配的影响提供了精细化、标准化的时间序列数据,填补了区域级微观劳动统计在机器学习与因果推断领域中易用性不足的空白,对推动亚洲发展经济学、劳动经济学及基于数据的社会政策研究具有重要意义。
当前挑战
该数据集所解决的领域核心挑战在于如何克服跨国收入不平等研究中普遍存在的指标口径不一致、时间跨度碎片化以及性别与行业维度细分数据的缺失问题。ILOSTAT通过统一采纳国际劳工统计学家会议(ICLS)的定义标准,对各国劳动力调查、家庭收支调查等原始微观数据进行协调与标准化,从而保障了跨国与跨时期的可比性。在构建过程中,数据集面临的首要挑战是复杂的异构数据整合:原始数据源于多种调查类型(如劳动力调查、行政记录),来源标记与观测状态标志(如序列中断、临时数据)的差异需要精细清洗与合理简化。此外,部分国家与年份的基尼系数因样本量限制或统计能力差异而缺失,若直接按国家-年份矩阵展开将导致高维稀疏性,因此需要审慎处理缺失值,并依赖ILO选定的‘最佳来源’逻辑来平衡数据质量与覆盖完整度。
常用场景
经典使用场景
该数据集汇聚了1997年至2025年间亚洲25个国家和地区雇员小时收入的基尼系数,按性别和经济活动进行分类,为研究亚洲地区收入分配不平等提供了横跨近三十年的面板数据。经典使用场景包括利用时间序列模型分析亚洲各国收入不平等程度的演变趋势,或结合国家层面的宏观经济变量构建回归模型,探究经济增长、产业结构转型与工资差距之间的内在关联。研究者亦可借助该数据集的性别维度,比较男性和女性雇员在收入分配上的差异,揭示劳动力市场中性别工资不平等的动态特征。
实际应用
在实际应用层面,该数据集可为国际组织、政府机构及非政府组织制定和评估收入分配相关政策提供量化依据。例如,劳动部门可基于不同性别和行业的基尼系数变动趋势,识别出收入不平等最为突出的经济部门或社会群体,从而精准设计最低工资调整方案或性别平等促进措施。此外,该数据集亦可被整合进经济监测预警系统,辅助决策者及时发现由收入差距扩大可能引发的社会风险,为亚洲各国实现联合国可持续发展目标中关于减少不平等和体面工作的具体目标提供数据支撑。
衍生相关工作
基于该数据集的典范性工作主要包括对亚洲劳动力市场收入不平等的多维分解与预测研究。研究者可借助该数据集构建经济计量模型,将总体基尼系数按性别、经济活动等维度进行因子分解,识别导致收入差距扩大的关键结构性因素。此外,数据集的时间序列特性也催生了一系列预测性研究,如运用自回归移动平均模型或机器学习中的梯度提升算法,对未来数年亚洲各国的工资不平等指标进行前瞻性估算。该数据集还常被用作跨国比较研究的基准,与欧洲、美洲等其他区域同类数据联动,开展全球收入不平等的对比分析。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务