遇见数据集

electricsheepasia/asia-ilo-ear-ehrg-sex-geo-nb-gini-index-of-hourly-earnings-of-employees-by-sex

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲23个国家1996年至2025年间按性别和城乡划分的员工小时收入基尼指数的观测数据,共计1,809条记录。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过API获取并筛选亚洲国家代码。数据集涵盖单一指标EAR_EHRG_SEX_GEO_NB,即员工小时收入基尼指数,并按性别(总计、男性、女性、其他)和城乡地区进行细分。数据模式包括国家代码、年份、观测值、数据来源、指标标签、性别分类、观测状态等字段。数据集适用于表格分类、回归和时间序列预测等机器学习任务,重点关注亚洲地区的收入不平等分析。

This dataset contains 1,809 observations of the Gini index of hourly earnings of employees by sex and rural/urban areas across 23 Asian countries from 1996 to 2025. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via API and filtered to Asian ISO3 country codes. It covers a single indicator EAR_EHRG_SEX_GEO_NB with disaggregation by sex (total, male, female, other) and area type. The schema includes columns for country code, year, observed value, data source, indicator label, sex classification, observation status, and notes. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, focusing on income inequality analysis in Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehrg-sex-geo-nb-gini-index-of-hourly-earnings-of-employees-by-sex 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,经由Electric Sheep Asia团队重新打包处理。数据通过ILOSTAT REST API接口直接获取,原始指标代码为EAR_EHRG_SEX_GEO_NB,并依据ISO标准筛选出亚洲23个国家的观测记录。ILO统计部门依据国际劳工统计学家会议(ICLS)定义,对各国劳动力调查、家庭收入调查及行政记录中的原始微观数据进行统一协调与标准化处理,最终生成1809条涵盖1996年至2025年间的时间序列观测值。数据集以列式结构存储,包含国家代码、来源标识、指标名称、性别划分、地理分类、观测年份及数值等字段,并在source.label列中标注了数据来源的详细信息,以保障数据的可追溯性。
使用方法
用户可通过HuggingFace Datasets库便捷地加载该数据集,仅需一行代码ds = load_dataset('electricsheepasia/asia-ilo-ear-ehrg-sex-geo-nb-gini-index-of-hourly-earnings-of-employees-by-sex')即可获取训练集并转换为Pandas数据框进行后续分析。对于单一国家的时间序列研究,可依据ref_area字段筛选特定国家(如印度尼西亚IDN),然后利用time与obs_value列进行绘图探索。若需构建用于回归或分类任务的标准面板数据,可基于indicator字段筛选基尼系数指标,并通过pivot_table方法将数据重塑为国家×年份的矩阵形式,便于与其它社会经济变量进行联合建模或跨国的对比分析。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)的统计数据库ILOSTAT创建,并经Electric Sheep Asia于2025年重新整理后发布,聚焦于亚洲地区按性别和城乡划分的雇员小时收入的基尼系数。基尼系数作为衡量收入分配不平等程度的核心指标,在劳动经济学和发展研究中具有举足轻重的地位。数据集覆盖1996年至2025年间23个亚洲国家,包含1809条观测记录,为研究亚洲区域内部收入差距的时空演变、性别分化以及城乡差异提供了标准化、可追溯的量化基础。其权威性源自ILO对各国劳动力调查数据的统一协调与发布,推动了亚洲收入不平等领域跨国比较研究的实证进展。
当前挑战
该数据集所解决的领域核心挑战在于,亚洲各国收入分配数据长期存在来源分散、定义不一致、时间跨度短的问题,难以支持区域性的系统性比较分析。通过整合23个国家近三十年的基尼系数并统一数据口径,数据集有效弥合了跨国收入不平等研究的鸿沟。在构建过程中,挑战主要源于各国调查制度的差异:不同调查类型(如劳动力调查、住户收入调查)的统计标准各异,ILO需依据国际劳动统计学家会议定义进行数据协调与标识,且部分观测值存在序列中断或质量标记,给数据的一致性和完整性带来了严峻考验。
常用场景
经典使用场景
该数据集收录了国际劳工组织(ILO)统计数据库ILOSTAT中亚洲23个国家1996年至2025年间的小时收入基尼系数观测值,共计1809条记录。其核心应用场景在于衡量亚洲各国内部以及城乡之间、不同性别劳动力之间的收入分配不平等程度。研究者可通过该数据构建面板数据模型,追踪亚洲经济体在近三十年间的收入差距演变轨迹,评估经济发展、全球化、劳动力市场政策对分配公平性的长周期影响。
解决学术问题
此数据集的学术价值在于为收入不平等研究提供了高颗粒度、跨国家长时序的标准化基准数据。它解决了传统研究中因各国调查口径不一、数据零散而难以进行系统性比较的痛点,使得学者能够严谨地检验库兹涅茨假说在亚洲语境下的适用性,量化性别工资差距的动态变化,并识别工业化和城镇化进程对收入分配结构的影响机制,从而深化对亚洲发展模式的理解。
实际应用
在实际应用中,该数据集是国际组织、国家统计部门和政策研究机构进行区域劳动市场监测与评估的重要工具。通过分析基尼指数的时空分异,决策者可以识别各国劳动报酬分配的薄弱环节,评估最低工资制度、税收转移支付及社会保障政策的再分配效果。数据所涵盖的城乡分类和性别维度,还能为制定促进包容性增长、缩小性别工资鸿沟的精准政策提供实证依据。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区雇员小时收入基尼系数的性别与城乡维度分解,为劳动经济学中的收入不平等研究提供了精细化的实证基础。当前前沿方向集中于利用该时间序列数据(1996–2025年)结合面板计量模型,量化全球化、技术变革及劳动力市场制度对亚洲收入差距的异质性冲击;同时,结合ILOSTAT标准化调查框架,研究者正通过机器学习方法挖掘性别工资差异的隐蔽结构,并探索基尼系数与联合国可持续发展目标(SDG)体面工作指标之间的联动关系。这一整合将推动亚洲经济体在结构性转型中设计更具包容性的薪酬政策。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务