遇见数据集

electricsheepafrica/africa-ilo-ear-ehrm-sex-edu-cur-nb-median-hourly-earnings-of-employees-by-sex-educati

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含非洲36个国家从1991年至2024年的员工每小时收入中位数数据,共19,717条观测值,涵盖1个核心指标(按性别、教育水平和货币细分)。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过API获取并过滤为非洲国家。数据集提供结构化表格,包括国家代码、年份、指标值、性别分类(总计、男性、女性)、教育水平分类和货币类型等字段,适用于表格分类、回归和时间序列预测等任务。数据经过ILO标准化处理,标注了来源和质量状态,可用于劳动力市场分析和经济研究。

This dataset contains 19,717 observations of median hourly earnings of employees across 36 Africa countries from 1991 to 2024, covering 1 distinct indicator disaggregated by sex, education, and currency. Sourced from the ILOSTAT database of the International Labour Organization (ILO), it provides structured tabular data including country codes, years, indicator values, sex classifications (total, male, female), education levels, and currency types. The data is harmonized using ICLS definitions and includes source and quality flags, suitable for tabular classification, regression, and time-series forecasting tasks in labor market analysis and economic research.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-ear-ehrm-sex-edu-cur-nb-median-hourly-earnings-of-employees-by-sex-educati 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API直接获取名为“EAR_EHRM_SEX_EDU_CUR_NB”的指标数据,并依据非洲ISO3国家代码进行筛选。ILOSTAT依据国际劳工统计学家会议定义,对来自各国劳动力调查、家庭收入调查及行政记录等原始调查微观数据进行统一协调。经Electric Sheep Africa重新整理后,数据集以Parquet格式打包,在HuggingFace平台发布,确保每一观测值均可追溯至原始来源。
使用方法
用户可通过HuggingFace Datasets库的`load_dataset()`函数一键加载数据集,并转换为Pandas DataFrame进行后续分析。推荐操作包括:按国家代码(`ref_area`)筛选特定国家数据、基于`time`列对单个指标进行时间序列分析与可视化、以及利用`pivot_table`将数据重塑为国家×年份矩阵,以支持面板数据分析或回归建模。数据集的列结构清晰,包含国家、来源、指标、时间及观测值等字段,适合用于劳动经济学研究、政策评估及教育—性别收入差异分析。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门维护,经Electric Sheep Africa于2024年重新整理并发布在HuggingFace平台上,聚焦于非洲36个国家1991至2024年间按性别、教育程度和货币划分的雇员中位数小时收入数据,共包含19,717条观测记录。作为ILOSTAT核心统计数据库的子集,该数据集旨在弥补非洲地区在劳动力市场报酬维度上高质量、可机读数据的匮乏,为研究非洲大陆性别收入差异、教育回报率以及劳动经济学中的结构性不平等问题提供了统一、细粒度的时空数据资源。其发布对于推动非洲劳动经济学的实证研究、可持续发展目标中体面工作指标的监测以及跨国比较分析具有重要价值。
当前挑战
该数据集面临的核心挑战在于所解决的领域问题:非洲地区普遍存在的劳动力调查数据碎片化、可比性差及按性别/教育维度详细记录的缺失,阻碍了跨国家与跨时期的收入分配与性别工资差距的系统性分析。在构建过程中,挑战源自ILOSTAT对多国原始调查微观数据的标准化处理,需在各国不尽相同的调查设计、分类体系和货币单位间进行协调,部分观测被标记为不可靠(obs_status=U)。时间序列的不连续性(如多国首尾年份差异显著)、教育分类标准非统一性(如note_classif标注的非标准教育水平)以及折旧货币单位带来的实际购买力比较难题,进一步增加了数据清洗与稳健分析的复杂程度。
常用场景
经典使用场景
在劳动经济学与非洲发展研究的交叉领域中,该数据集为分析性别、教育水平与货币因素对时薪中位数的影响提供了结构化、标准化的数据基础。研究者可以基于此数据集构建分类或回归模型,探索非洲36个国家1991至2024年间劳动力市场报酬的演变与差异。其时间序列特性也使其适用于预测各细分群体的收入趋势,从而揭示教育与性别在工资决定机制中扮演的角色。
解决学术问题
该数据集有效回应了长期困扰学术界的非洲劳动力市场微观数据匮乏难题。它填补了跨国、跨时间的高频工资数据的空白,使学者能够量化性别收入差距的动态变化,评估教育投资对提升收入的实际回报率,以及识别不同货币环境下真实购买力的差异。通过提供经ILO标准化的可比指标,该数据集推动了非洲国家间劳动力市场制度的比较研究,并为验证新古典与制度主义工资理论在非洲情景下的适用性提供了关键证据。
实际应用
在实际应用层面,该数据集为国际发展机构、政府统计部门与社会政策研究者提供了制定与评估薪酬平等政策的量化工具。例如,可用于监测联合国可持续发展目标中关于体面工作与经济增长的进展情况,辅助识别哪些国家或行业的教育回报率较低,从而为技能培训与教育改革提供数据支撑。就业服务与薪酬咨询机构也能利用这些数据为客户提供非洲各国不同性别和教育水平下的市场基准薪酬参考。
数据集最近研究
最新研究方向
该数据集源于国际劳工组织ILOSTAT数据库,聚焦非洲36国1991至2024年间按性别、教育程度及货币分列的雇员每小时收入中位数,为劳动经济学中的薪酬不平等与人力资本回报研究提供了稀缺的跨时空细粒度样本。在当前全球聚焦可持续发展和体面劳动议程的背景下,该数据支撑研究者深入剖析非洲劳动力市场中性别薪酬鸿沟的动态演变、教育溢价的地理异质性,以及本地化货币波动对实际购买力的影响。结合非洲大陆自由贸易区的推进与青年就业危机等热点,这一结构化语料库还为基于机器学习的时序预测模型与面板数据分析提供了坚实训练基础,助力政策制定者识别结构性障碍并设计精准干预策略。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务