遇见数据集

electricsheepasia/asia-ilo-ear-ehrg-sex-nb-gini-index-of-hourly-earnings-of-employees-by-sex

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲25个国家1996年至2025年间按性别划分的员工小时收入基尼系数数据,共663个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API获取并过滤为亚洲国家。核心指标为EAR_EHRG_SEX_NB,即按性别划分的员工小时收入基尼系数,用于衡量收入不平等程度。数据集包含国家代码、国家名称、数据来源、指标代码、指标名称、性别分类(总计、男性、女性等)、观测年份、观测值、观测状态及备注等字段。数据频率为年度,当同一国家同年份有多个数据源时,采用ILO选择的最佳来源。该数据集由Electric Sheep Asia重新打包,旨在为亚洲地区提供统一、机器学习就绪的数据层。

This dataset contains 663 observations of the Gini index of hourly earnings of employees by sex across 25 Asian countries, spanning from 1996 to 2025. The data is sourced from the International Labour Organization (ILO)s ILOSTAT database, retrieved via its REST API and filtered for Asian countries. The core indicator is EAR_EHRG_SEX_NB, which measures income inequality through the Gini index of hourly earnings disaggregated by sex. The dataset includes fields such as country code, country name, data source, indicator code, indicator name, sex classification (total, male, female, etc.), observation year, observed value, observation status, and notes. The data is annual in frequency, and when multiple sources exist for the same country and year, the ILO-selected best source is used. The dataset is repackaged by Electric Sheep Asia as part of a unified, ML-ready data layer for Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehrg-sex-nb-gini-index-of-hourly-earnings-of-employees-by-sex 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API直接抓取,筛选出亚洲地区的ISO3国家代码对应数据。ILOSTAT对全球200多个经济体的原始调查微观数据进行了标准化处理,遵循国际劳工统计学家会议(ICLS)的定义,并在source.label字段中标注了数据的原始来源,如劳动力调查、家庭收入调查等,确保了数据的可追溯性与一致性。数据集由Electric Sheep Asia重新打包,形成了包含663条观测值、覆盖25个亚洲国家、时间跨度为1996年至2025年的结构化表格数据。
使用方法
用户可通过HuggingFace的datasets库便捷加载该数据集,使用load_dataset函数即可获得Pandas DataFrame格式的数据。支持按国家过滤观测值,例如筛选印度尼西亚的数据;也可针对特定指标进行时间序列分析与可视化;还支持将数据透视为国家×年份的矩阵形式,便于进行面板数据分析。数据集以CC-BY-4.0许可证发布,使用时需注明原始数据来源及再打包方Electric Sheep Asia。
背景与挑战
背景概述
在劳动经济学与不平等研究领域,薪酬分配的性别差异始终是衡量社会公平与可持续发展目标(SDG)进展的核心议题。国际劳工组织(ILO)作为全球劳动统计的权威机构,其ILOSTAT数据库系统整合了来自200多个经济体的劳动力调查、家庭收支调查及行政记录数据。该数据集由Electric Sheep Asia于2025年重新打包,聚焦亚洲地区,涵盖1996年至2025年间25个亚洲国家的663次观测,专门记录按性别分列的每小时收入基尼系数。这一精细化的时间序列数据为探究亚洲经济体内部薪酬不平等演变轨迹、评估性别薪酬差距以及检验经济增长与分配正义之间的关系提供了关键实证基础,对区域比较研究及政策制定具有显著参考价值。
当前挑战
该数据集所应对的领域核心挑战在于如何量化并追踪亚洲多元社会经济背景下薪酬不平等的动态变化。基尼系数虽能刻画总体收入差距,但受限于各国调查方法、数据质量与周期不一致(如印度仅2018年后有连续数据,土耳其横跨20年),导致面板数据中大量缺失值与方法学断裂。在构建过程中,ILO需从不同国家的劳动力调查、家庭调查及行政记录中协调统一,依据国际劳工统计学家会议(ICLS)定义进行标准化,并标注数据来源与观测状态(如参考期中断、不可靠标识)。此外,性别维度的细分(男性、女性、总计)虽有助于分析性别差距,但部分国家年度数据稀疏或按性别报告的分组不完整,增加了跨时间与跨国比较的统计不确定性。
常用场景
经典使用场景
在劳动经济学与收入分配研究中,该数据集以基尼系数为核心指标,精准刻画亚洲25国1996至2025年间雇员小时收入的性别差异与不平等态势。使用者可借助其按性别、国别和年份三重维度的精细拆解,构建面板数据模型,系统追踪收入不平等的时间演化轨迹与国家间异质性,为跨国比较分析提供可靠的数据基石。
解决学术问题
该数据集有效回应了劳动市场研究中长期存在的两大核心难题:一是亚洲地区收入不平等数据的碎片化与可比性缺失,二是性别收入差异的量化测量不足。通过ILOSTAT的标准化采集与一致性处理,研究者得以突破单一国家或短期观测的局限,开展跨国、跨时段的系统性实证研究,从而揭示经济发展阶段、制度安排与收入分配格局之间的内在关联。
实际应用
在实际应用层面,数据集为国际组织、政府部门与智库提供了评估劳工政策成效的量化工具。基于基尼系数的动态监测,政策制定者可识别收入不平等加剧的高危群体与地区,进而设计更具针对性的最低工资调整、税收再分配及性别平等促进方案。同时,该数据也为企业社会责任报告和可持续发展目标(SDG)的进展追踪提供了客观参照。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区按性别分列的雇员小时收入基尼系数,为劳动经济学中收入不平等与性别薪酬差距的交叉研究提供了关键数据支撑。前沿研究方向涵盖利用时间序列分析追踪亚洲各国自1996年至2025年间的收入不平等动态演变,结合ILOSTAT标准化方法论,探讨经济发展与性别平等政策对收入分配的长期效应。当前热点事件包括后疫情时代劳动力市场重构中的性别分化、亚洲新兴经济体结构性转型与薪酬不平等加剧的关联,以及联合国可持续发展目标(SDGs)中体面工作指标的量化监测。该数据集通过覆盖25个国家的663条观测值,弥补了亚洲区域高频次、长周期收入基尼系数数据的不足,为跨国家比较面板分析、机器学习预测模型训练提供了高质量标准化样本,对推动亚洲劳动市场蓝图中性别敏感的包容性增长研究具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务