遇见数据集

electricsheepafrica/africa-ilo-ear-ehrm-sex-edu-nb-median-hourly-earnings-of-employees-by-sex-and-edu

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含非洲36个国家从1991年至2024年按性别和教育程度划分的雇员每小时收入中位数数据(以当地货币计),共有6,902个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API获取,并经过筛选以仅包括非洲国家。数据集涵盖一个主要指标:EAR_EHRM_SEX_EDU_NB,即按性别和教育程度划分的雇员每小时收入中位数。数据模式包括国家代码、国家名称、数据来源、指标代码、性别分类、教育分类、观测年份、观测值、观测状态和相关注释等列。数据质量方面,数据集为年度频率,ILO会选择同一国家×年份下的最佳来源,且分类列仅在指标发布细分数据时非空。该数据集适用于表格分类、回归和时间序列预测等任务,旨在为非洲提供机器学习就绪的数据层。

This dataset contains 6,902 observations of median hourly earnings of employees by sex and education (in local currency) across 36 African countries, spanning from 1991 to 2024. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via its REST API and filtered to include only African countries. It covers one main indicator: EAR_EHRM_SEX_EDU_NB, which represents median hourly earnings of employees by sex and education. The schema includes columns such as country code, country name, data source, indicator code, sex classification, education classification, observation year, observed value, observation status, and related notes. Data quality notes indicate that the data is annual in frequency, with ILO selecting the best source for duplicate country×year entries, and disaggregation columns are non-null only when the indicator publishes that breakdown. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, and is part of a unified, ML-ready data layer for Africa.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-ear-ehrm-sex-edu-nb-median-hourly-earnings-of-employees-by-sex-and-edu 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API接口直接抽取指标EAR_EHRM_SEX_EDU_NB的原始观测值,并依据非洲ISO3国家代码进行地理过滤,最终汇聚了36个非洲国家自1991年至2024年间共6,902条有效记录。数据汇集过程中,ILOSTAT依照国际劳工统计学家会议(ICLS)定义对各国劳动力调查微观数据进行标准化处理,并在source.label列中标注了数据来源,确保了数据源的可追溯性与跨国家可比性。Electric Sheep Africa进一步对原始接口进行了重封装,统一了数据格式与元数据结构,旨在为机器学习与统计分析提供简洁、直接的即用数据集。
使用方法
该数据集借助HuggingFace Datasets库提供统一的加载接口,使用者可通过load_dataset函数快速读入数据,并直接转换为Pandas DataFrame进行后续分析。典型使用流程包括按国家筛选(如df[df['ref_area']=='KEN'])、针对单一指标的时间序列构建与可视化,以及通过pivot_table方法将数据重塑为国家×年份的面板矩阵,进而适配计量回归模型或统计描述。由于数据已预先清洗并标准化为表格格式,使用者无需进行复杂的预处理即可专注于模型构建与分析任务,显著降低了非洲劳动经济学研究的数据获取与技术门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2024年通过其ILOSTAT数据库创建,并由Electric Sheep Africa在HuggingFace上重新打包发布,旨在为非洲劳动力市场研究提供标准化的收入数据。数据集聚焦于按性别和教育水平分列的雇员小时收入中位数,覆盖1991年至2024年间36个非洲国家的6,902次观测,是分析非洲人力资本回报、性别收入差距及教育对工资影响的宝贵资源。ILD的ILOSTAT作为全球劳动统计的权威来源,基于各国劳动力调查、家庭收入调查及行政记录进行统一协调,为经济学、社会学及公共政策领域的学者提供了跨国家、跨时间的高质量可比数据,对推动非洲发展议程中的体面劳动目标具有深远意义。
当前挑战
该数据集解决的领域挑战在于量化非洲劳动力市场中性别与教育对收入的影响,填补了该地区细粒度收入数据的长期空白。然而,数据构建面临多重困难:其一,非洲各国统计能力参差不齐,导致数据来源多样,如劳动力调查、行政记录等,需通过ILO复杂的方法论进行标准化协调;其二,收入数据受货币波动、通货膨胀及非正式经济影响,观测值以本币计价且部分年份被标记为“不可靠”,需谨慎解读;其三,时间序列不连续,36个国家中部分仅覆盖短暂年份,且总观测数有限(6,902条),限制了长期趋势分析和稳健统计推断。
常用场景
经典使用场景
该数据集汇集了国际劳工组织(ILO)的权威统计数据,涵盖1991年至2024年间36个非洲国家按性别与教育程度划分的雇员小时收入中位数,共计6902条观测记录。经典使用场景包括劳动经济学面板数据分析,研究者可通过年份、国家、性别和教育水平等多维度分组,构建平衡或非平衡面板模型,考察非洲大陆内不同教育回报率的时空差异。此外,该数据同样适用于时间序列预测任务,如采用ARIMA或Prophet模型对特定国家(如毛里求斯或埃及)的未来收入趋势进行前瞻性估计。数据集中附带的观测状态标记(如'不可靠'或'临时')为数据质量评估提供了关键参考,使得研究者在进行敏感性分析或稳健性检验时能够依据来源标注信息过滤低质量样本,从而提升结论的可靠性。
解决学术问题
该数据集为解决非洲劳动经济学中若干长期悬而未决的学术难题提供了坚实的数据基础。它直接回应了教育回报率在性别维度上的异质性这一关键议题,使得学者能够量化不同教育层次(从基础到高级)对男女雇员收入差异的边际贡献,进而验证人力资本理论在非洲情境下的适用性与局限性。此外,通过追踪近三十年的收入演变,该数据有助于识别非洲范围内性别收入差距的收敛或发散趋势,并揭示经济发展阶段、制度变迁与劳动力市场政策对收入分配的影响机制。这些分析对于理解结构性不平等、教育政策有效性以及包容性增长途径具有深远意义,填补了非洲大陆层面精细化收入数据长期匮乏的研究空白。
实际应用
在政策制定与国际发展领域,该数据集可被国际组织(如ILO、世界银行)及非洲各国统计部门用于监测可持续发展目标(SDGs)中体面工作与经济增长相关的具体指标进展。开发团队能够基于这些数据构建交互式可视化仪表板,直观展示不同国家按性别教育分组的收入差距演变,为政府调整最低工资标准、设计针对性职业教育培训项目及优化社会福利分配提供量化依据。同时,非政府组织和研究机构可以借助该数据评估特定劳动政策(如同工同酬法案或教育扩展计划)的实际影响效果,推动循证决策的落地。在私营部门,企业人力资源部门能够利用匿名化的收入中位数开展行业薪酬基准分析,从而制定更具吸引力且公平的薪酬结构。
数据集最近研究
最新研究方向
该数据集聚焦于非洲地区按性别与教育程度划分的劳动者小时工资中位数,为劳动经济学与可持续发展研究提供了跨时空的微观证据。当前前沿方向涵盖性别工资差距的深层成因解析、教育回报率的动态演变,以及非洲劳动力市场结构与体面劳动(SDG 8)的关联分析。结合ILOSTAT标准化来源与36国长面板数据,该资源正推动基于机器学习的多维不平等预测与政策干预效果评估,为非洲大陆自贸区背景下的就业质量监测与包容性增长策略提供关键数据支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务