遇见数据集

electricsheepafrica/africa-ilo-ear-ehrg-sex-age-nb-gini-index-of-hourly-earnings-of-employees-by-sex

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含非洲36个国家从1991年至2024年的3,960个观测值,涵盖1个核心指标:按性别和年龄划分的员工小时收入基尼指数。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤至非洲国家,经过标准化处理,包含国家代码、年份、性别分类、年龄分类、观测值及数据来源等字段。数据集适用于表格分类、回归和时间序列预测等任务,重点关注非洲地区的收入与薪酬不平等问题。

This dataset contains 3,960 observations of Income and pay inequality data across 36 Africa countries, spanning 1991–2024, covering 1 distinct indicator: Gini index of hourly earnings of employees by sex and age. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via API and filtered to African countries, with standardized fields including country codes, year, sex and age classifications, observed values, and data sources. It is suitable for tabular classification, regression, and time-series forecasting tasks, focusing on income and pay inequality in Africa.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-ear-ehrg-sex-age-nb-gini-index-of-hourly-earnings-of-employees-by-sex 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,聚焦于非洲地区按性别和年龄划分的雇员小时收入基尼系数。数据通过调用ILOSTAT的REST API接口获取原始指标,并依据非洲ISO3国家代码进行地理范围过滤。ILO基于国际劳动统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查等微观数据进行统一整合与标准化处理,确保了跨国家与跨年份数据的可比性。数据集中每条记录均标注了来源标识,便于用户追溯原始数据出处。整个处理流程由Electric Sheep Africa完成,旨在为非洲地区劳动经济研究提供即用型结构化数据。
特点
该数据集包含3,960条观测记录,覆盖36个非洲国家,时间跨度从1991年至2024年,是研究非洲劳动力市场收入不平等长期趋势的重要资源。其核心指标为按性别(男性、女性、总计)和年龄分组的小时收入基尼系数,提供了细颗粒度的收入分配分析维度。数据集以年度频率呈现,并标注了观测状态标志(如序列中断、临时数据),有助于用户评估数据质量。此外,数据根据ILO选定的“最佳来源”进行整合,确保国家-年份组合的数据可靠性。丰富的元数据列(如来源标签、分类变量)进一步增强了数据的可解释性与可追溯性。
使用方法
用户可通过HuggingFace Datasets库的`load_dataset()`函数一键加载该数据集,并将其转换为Pandas DataFrame进行灵活操作。典型使用场景包括按国家筛选分析特定区域(如`df[df["ref_area"]=="KEN"]`),或按年份排序某一指标以生成时间序列图。数据也可通过透视表操作转换为国家×年份的矩阵格式,便于进行面板数据分析或跨国家比较。鉴于数据以结构化表格形式组织,研究人员能便捷地将其整合至统计学模型、机器学习回归任务或时间序列预测工作中。此外,丰富的分类维度(如性别)允许进行分组统计,深入探究特定人群的收入不平等特征。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计数据库ILOSTAT整理,经Electric Sheep Africa于2024年重新打包发布,聚焦非洲36个国家1991至2024年间按性别和年龄分组的雇员小时收入基尼指数。基尼指数作为衡量收入分配不平等程度的经典指标,在劳动经济学与发展研究中具有核心地位。然而,撒哈拉以南非洲地区长期面临微观调查数据稀缺、统计口径不一以及时间序列断裂等瓶颈,导致区域内收入不平等问题的跨国比较与纵向分析严重受限。该数据集通过整合ILO统一规范化的劳动调查数据,首次为非洲大陆提供了覆盖长达34年、包含3960条观测值的标准化收入不平等面板数据,显著填补了该领域的数据空白,为深入探究非洲劳动力市场结构变迁、性别收入差距演化以及经济增长与分配正义的互动关系奠定了定量基础。
当前挑战
在领域问题层面,该数据集致力于解决非洲地区收入不平等研究长期受困于数据可用性低与可比性差的核心挑战。非洲各国劳动调查的实施频率、问卷设计、抽样框架及收入定义差异巨大,导致构建一致的跨国基尼指数困难重重,传统研究多依赖零散且滞后的世界银行或联合国数据。在构建过程中,数据集面临多重技术挑战:首先,ILOSTAT原始API返回的指标维度复杂,需按非洲国家ISO3代码精准筛选并处理多源标记冲突;其次,数据存在明显的观测值稀疏性,部分国家仅有少数年份记录,且伴有序列中断标记(如“Break in series”),要求在时间序列建模中谨慎处理缺失值与结构性突变;最后,不同来源调查中的货币单位与购买力平价校准也增加了数据清洗与归一化的复杂度。
常用场景
经典使用场景
该数据集收录了1991年至2024年间36个非洲国家按性别和年龄分列的雇员小时收入基尼系数,共计3960条观测值。基于ILOSTAT官方统计框架,它整合了来自劳动力调查、家庭收入调查等多源数据,为研究者提供了长时间跨度、多国别、细颗粒度的收入不平等面板数据。经典使用场景涵盖:构建非洲收入不平等纵向比较模型,追踪基尼系数在时间序列上的演变轨迹;利用性别与年龄维度进行分解分析,揭示不同人口群体内部的收入分配差异;以及作为监督学习任务中的回归或分类目标变量,预测或解释影响不平等的社会经济驱动因素。
衍生相关工作
该数据集衍生出一系列前沿研究工作。在方法论层面,研究者将其与非洲大陆微观调查数据(如LSMS、DHS)融合,通过多层级模型分解基尼系数中不可观测的个体异质性与国家固定效应,揭示了收入不平等背后的结构性成因。在预测建模方向,基于该数据集训练的机器学习模型(如梯度提升树、时序Transformer)能够对未来5至10年的收入分配趋势进行推估,为预警机制提供量化依据。在交叉学科领域,经济地理学家利用空间统计方法揭示了基尼系数在非洲次区域间的空间自相关特征,识别出“不平等热点”与“不平等洼地”,这些工作共同推动了非洲收入分配研究从描述性分析向因果推断与预测科学的跃迁。
数据集最近研究
最新研究方向
该数据集聚焦于非洲地区按性别和年龄划分的雇员时薪基尼系数,为劳动经济学中的收入不平等研究提供了长达三十余年(1991–2024年)、覆盖36个非洲国家的系统观测数据。当前前沿研究方向集中于利用该时间序列数据开展跨国的性别收入差距动态分析,结合ILOSTAT等权威来源的劳动力调查微观数据,探究非洲大陆在经济发展与全球化进程中收入分配格局的演变规律,并评估劳动政策、教育普及及产业结构变迁对缩小性别收入差距的实际效应。其意义在于为联合国可持续发展目标(SDG)中的体面劳动与经济增长指标提供可量化的实证基础,同时支撑机器学习模型对非洲区域收入不平等趋势的预测与干预策略的制定,填补了该地区高时空分辨率收入不平等数据集的空白。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务