遇见数据集

electricsheepafrica/africa-ilo-ear-ehrm-sex-age-nb-median-hourly-earnings-of-employees-by-sex-and-age

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含非洲36个国家1991年至2024年按性别和年龄分列的员工每小时收入中位数(本地货币)数据,总计3,960个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API提取并过滤至非洲国家。数据集涵盖单一指标(EAR_EHRM_SEX_AGE_NB),包括国家代码、年份、收入值、性别分类(总计、男性、女性)、年龄分组、数据来源标签和质量状态标志等列。数据为年度频率,经过ILO标准化处理,适用于表格分类、回归和时间序列预测等任务。数据集由Electric Sheep Africa重新打包发布,遵循CC-BY-4.0许可证,旨在为非洲提供机器学习就绪的数据层。

This dataset contains 3,960 observations of median hourly earnings of employees by sex and age in local currency across 36 African countries from 1991 to 2024. The data is sourced from the International Labour Organizations (ILO) ILOSTAT database, extracted via the REST API and filtered to African country codes. It includes a single indicator (EAR_EHRM_SEX_AGE_NB) with columns for country code, year, earnings value, sex disaggregation (total, male, female), age classification, source labels, and quality flags. The data is annual frequency, harmonized by ILO standards, and suitable for tabular classification, regression, and time-series forecasting tasks. Repackaged by Electric Sheep Africa under the CC-BY-4.0 license, it aims to provide a machine-learning-ready data layer for Africa.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-ear-ehrm-sex-age-nb-median-hourly-earnings-of-employees-by-sex-and-age 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,后者是全球劳动统计领域的权威来源,汇集了各国劳动力调查、家庭收支调查、企业调查及行政记录等多源数据。具体而言,本数据集通过ILOSTAT的REST API接口直接提取了指标代码为EAR_EHRM_SEX_AGE_NB的数据,并依据非洲ISO3国家代码进行地域筛选,最终囊括了36个非洲国家。数据经ILO依据国际劳工统计学家会议(ICLS)定义进行统一协调与标准化处理,并在source.label列中标注了原始数据来源,确保了数据的高质量与可追溯性。整份数据由Electric Sheep Africa重新打包为HuggingFace数据集格式,以提供机器学习就绪的便捷访问。
特点
本数据集的核心特点在于其聚焦于非洲地区雇员按性别与年龄分层的时薪中位数(以当地货币计),覆盖1991年至2024年间跨度长达三十余年的3,960条观测记录。数据不仅提供了单一核心指标,更通过sex与classif1等维度实现了精细化的分类统计,例如区分总体、男性、女性三个性别类别,并包含年龄分组信息。数据的附属列如obs_status指示了观测值的状态(如序列中断等),note_indicator等注解列则记录了货币单位等元数据,为研究者提供了充分的数据质量背景。此外,数据集收录了毛里求斯、埃及、南非等国的丰富样本,展现出国家间与时序上的广泛覆盖性。
使用方法
研究者可通过HuggingFace的datasets库直接加载该数据集,仅需一行代码即可获取包含3,960条记录的结构化表格数据。加载后,可借助pandas等数据分析工具进行灵活操作,例如依据ref_area列筛选特定国家的子集以进行国别聚焦分析,或按时间序列对核心指标obs_value进行排序与可视化,探究非洲不同国家间薪资水平的长期演变趋势。进一步地,利用pivot_table函数可将数据重塑为国家×年份的矩阵形式,便于开展跨国的比较研究或作为面板数据输入到计量经济模型中。数据集以Parquet格式存储,兼顾了高效存储与快速读写的需求,适合大规模科研计算场景。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司创建,经Electric Sheep Africa于2024年重新整理并发布在HuggingFace平台上,旨在提供非洲大陆雇员按性别和年龄分组的时薪中位数(以当地货币计)的标准化观测数据。数据集涵盖1991年至2024年间36个非洲国家的3,960条记录,核心研究问题聚焦于揭示非洲劳动力市场中工资水平的性别与年龄差异,为劳动经济学、发展经济学及政策评估提供实证基础。作为ILOSTAT数据库在非洲区域的子集,该数据为研究非正规经济占比高、性别工资差距显著等非洲特有劳动问题提供了关键量化工具,对推动可持续发展目标(SDG)中体面工作指标的监测具有重要影响力。
当前挑战
该数据集面临的主要挑战包括:其一,非洲劳动市场数据收集困难,许多国家依赖不连续的家庭调查或企业调查,导致时间序列不完整且数据质量参差不齐,观测值中出现的断点标记(如'Break in series')直接反映了这种不稳定性。其二,构建过程中需要处理多国货币单位不统一、通货膨胀影响、以及各国对'雇员'和'工资'定义差异带来的可比性问题,ILO虽进行了标准化处理,但分类变量(如年龄组、学历)的空值和数据来源的多元性仍增加了分析复杂性。其三,数据频率以年度为主,缺乏更精细的月度或季度信息,难以捕捉季节性就业模式,且部分国家观测样本过少(如仅涵盖个别年份),限制了面板数据分析的稳健性。
常用场景
经典使用场景
在劳动经济学与非洲发展研究的交叉领域,该数据集凭借其横跨36个非洲国家、涵盖1991年至2024年的长时间序列观测,成为分析非洲大陆员工收入动态演变的核心资源。经典使用场景包括构建多国面板数据模型,探究性别、年龄与小时收入中位数之间的异质性关联,以及刻画不同国家收入分配格局的时间趋势。研究者常借助该数据集进行跨国比较研究,揭示非洲地区劳动力市场结构的共性与差异,并识别收入不平等在年龄代际与性别维度上的演变特征。
解决学术问题
该数据集系统性地回应了非洲劳动经济学中长期存在的两大核心学术挑战:一是缺乏统一、可比的跨国收入微观数据,导致区域性的收入决定因素研究难以推进;二是性别与年龄维度的收入差距在非洲语境下的量化证据不足。凭借ILO标准化的方法论与多源调查数据的整合,它使得研究者能够在控制国家与时间固定效应的框架下,稳健地估计性别收入差距的规模及其随年龄的变化轨迹,进而为理解非洲劳动力市场的结构性不平等提供了坚实的实证基础。
衍生相关工作
围绕这一数据集,学界与政策研究领域已衍生出一系列经典工作,主要集中在三个方向:其一,基于该数据构建的跨国面板数据被广泛用于检验人力资本理论在非洲背景下的适用性,例如教育与工作经验回报率的性别差异分析;其二,时间序列分析方法被应用于预测不同非洲国家收入分布的长期趋势,为社会保障基金的可持续性评估提供输入;其三,机器学习领域的研究者利用该数据开发了针对稀疏面板数据的插值与预测模型,以克服非洲统计调查中存在的数据缺失问题,推动了小样本下区域经济预测方法论的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务