遇见数据集

electricsheepafrica/africa-ilo-ear-ehrg-sex-edu-nb-gini-index-of-hourly-earnings-of-employees-by-sex

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为按性别和教育程度划分的员工小时收入基尼指数 | 非洲(ILOSTAT),是一个表格型数据集,包含6,902个观测值,覆盖36个非洲国家,时间范围为1991年至2024年。数据集的核心指标是按性别和教育程度划分的员工小时收入基尼指数(指标代码:EAR_EHRG_SEX_EDU_NB),用于衡量收入不平等程度。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API获取,并经过处理以仅包含非洲国家的数据。数据集提供了详细的字段,包括国家代码、国家名称、数据来源、指标、性别分类(总计、男性、女性)、教育水平分类、观测年份、观测值、观测状态以及相关注释。这些数据可用于表格分类、回归分析或时间序列预测等任务,特别适用于研究非洲地区的劳动力市场、收入不平等和性别差异等主题。数据集由Electric Sheep Africa重新打包,以方便机器学习使用,并遵循CC-BY-4.0许可协议。

This dataset is titled Gini index of hourly earnings of employees by sex and education | Africa (ILOSTAT). It is a tabular dataset containing 6,902 observations across 36 African countries, spanning the years 1991 to 2024. The core indicator is the Gini index of hourly earnings of employees by sex and education (indicator code: EAR_EHRG_SEX_EDU_NB), which measures income inequality. The data is sourced from the International Labour Organization (ILO)s ILOSTAT database, retrieved via its REST API and filtered to include only African countries. The dataset includes detailed fields such as country codes, country names, data sources, indicators, sex disaggregation (total, male, female), education level classifications, observation year, observed value, observation status, and related notes. This data can be used for tabular classification, regression, or time-series forecasting tasks, particularly for studying labor markets, income inequality, and gender disparities in Africa. The dataset has been repackaged by Electric Sheep Africa for machine learning readiness and is released under the CC-BY-4.0 license.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-ear-ehrg-sex-edu-nb-gini-index-of-hourly-earnings-of-employees-by-sex 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过REST API接口提取特定指标(EAR_EHRG_SEX_EDU_NB)的原始数据,并依据非洲ISO3国家代码进行地理过滤。ILOSTAT遵循国际劳工统计学家会议(ICLS)的定义标准,对各国劳动力调查、家庭收入调查等微观数据进行了系统化整合与清洗,确保了跨国家与跨年份数据的可比性。最终由Electric Sheep Africa团队重新封装为HuggingFace数据集格式,提供了6,902条观测记录,覆盖36个非洲国家及1991至2024年的时间跨度。
特点
本数据集聚焦于非洲地区员工小时收入的基尼系数,并按性别与教育水平进行细分,揭示了收入不平等在人口群体间的分布差异。数据集中包含丰富的元数据列,如数据来源、观测状态标志、分类注释等,便于用户追溯数据质量与处理细节。其独特价值在于,为研究非洲劳动力市场的性别收入差距、教育回报率以及长期不平等演变趋势提供了稀缺的结构化时序数据,支持横截面比较与面板数据分析。
使用方法
用户可通过HuggingFace Datasets库以`load_dataset()`函数一键加载数据,并转换为Pandas DataFrame进行后续分析。推荐按国家代码过滤以聚焦特定区域,或按指标进行时间序列可视化。亦可利用透视表功能将数据重塑为国家×年份矩阵,便于进行跨国的面板数据建模。数据集支持回归、分类及时间序列预测等任务,其标准化的Schema设计使得与机器学习工作流的集成高效而直观。
背景与挑战
背景概述
收入不平等是劳动经济学与发展研究中的核心议题,其度量与跨国比较对于评估可持续发展目标(SDG)中的体面工作进展至关重要。在此背景下,国际劳工组织(ILO)于2024年通过其ILOSTAT数据库发布了基于性别与教育程度划分的非洲雇员小时收入基尼指数数据集。该数据集由Electric Sheep Africa在HuggingFace上重新封装,涵盖1991年至2024年间36个非洲国家的6,902条观测记录,其核心研究问题在于揭示非洲大陆内部收入分配差距的时空演变规律。作为ILO统计部门权威数据的精炼整合,该数据集为分析教育回报的性别差异、追踪劳动力市场结构性不平等提供了标准化、机器可读的宝贵资源,显著降低了非洲区域经济学研究的准入门槛。
当前挑战
该数据集所解决的核心领域问题在于量化非洲劳动市场中多维度的收入不平等现象,尤其是性别与教育如何共同塑造收入分配。然而,其构建过程面临多重挑战:首先,非洲各国数据采集能力不均,部分国家观测年份稀疏(如安哥拉仅覆盖2019-2024年),且存在严重的时序缺失;其次,基尼指数本身对异常值敏感,ILOSTAT标记的“不可靠”(obs_status栏)观测值需审慎甄别;此外,各国调查方法(如劳动力调查、行政记录)与教育分类标准(如classif1中的非标准教育级别)的异质性,增加了跨国民间比较的复杂性,要求研究者在建模时充分考虑数据质量标志与来源差异。
常用场景
经典使用场景
该数据集广泛应用于非洲国家的收入不平等研究,尤其聚焦于按性别与教育水平划分的小时工资基尼系数分析。研究者可借助这一标准化、跨年度的时间序列数据,开展跨国面板回归分析,评估经济发展、教育普及或劳动力市场政策对收入分配格局的长期影响。数据集覆盖36个非洲国家、跨越1991年至2024年,包含6902条高质量观测值,为探索非洲大陆收入差距的演变轨迹提供了珍贵量化基础。常见的建模任务包括基尼系数的预测与分类,以及结合宏观经济指标进行因果推断。
解决学术问题
该数据集有效弥补了非洲地区收入不平等研究中长期存在的高质量微观数据匮乏的困境。传统上,非洲国家因统计基础设施薄弱,难以产出连续、可比且细分性别的劳动收入数据,这导致学术探讨多局限于个案或跨截面描述。该数据汇集了国际劳工组织(ILO)统一整合的官方统计数据,使得研究者得以系统考察性别工资差距、教育回报差异以及结构性不平等在非洲经济转型中的变化规律。其对实证劳动经济学、发展经济学以及社会分层研究具有重要的推动意义,助力检验人力资本理论、劳动力市场分割假说等经典学说在非洲语境下的适用性。
衍生相关工作
基于该数据集已衍生出一系列具有影响力的学术工作。一方面,研究者利用其时间跨度和国别维度,构建了融合教育层次与性别的收入不平等面板模型,发表了关于非洲劳动力市场结构性不平等的实证论文。另一方面,该数据被用于训练机器学习模型,以预测基尼系数在政策干预下可能的演化路径。部分工作还将其与地理遥感数据、教育年限调查数据关联,形成多模态社会-经济分析框架。此外,该数据集的标准化打包与公开共享,也促进了开源社区中面向非洲的劳动力统计工具包和可视化平台的开发,进一步降低了该领域的研究门槛。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务