遇见数据集

electricsheepafrica/africa-ilo-ear-emtm-sex-edu-cur-nb-median-monthly-earnings-of-employees-by-sex-educat

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的统计数据,主题为收入。具体涵盖了非洲44个国家从1991年至2024年的23,654条观测数据,核心指标为EAR_EMTM_SEX_EDU_CUR_NB,即按性别、教育和货币分列的员工月收入中位数。数据通过ILOSTAT REST API获取,并经过ILO根据国际劳工统计学家会议(ICLS)定义进行标准化处理。数据集包含多个维度,如国家(ISO3代码)、性别(总计、男性、女性)、教育分类、货币类型以及观测年份和数值等,适用于表格分类、回归和时间序列预测等任务。数据由Electric Sheep Africa重新打包,以统一、机器学习就绪的格式提供,便于研究人员和开发者使用。

This dataset contains statistical data from the International Labour Organization (ILO) ILOSTAT database on the topic of Earnings. It specifically includes 23,654 observations across 44 African countries from 1991 to 2024, with the core indicator being EAR_EMTM_SEX_EDU_CUR_NB, which represents the median monthly earnings of employees disaggregated by sex, education, and currency. The data is sourced via the ILOSTAT REST API and harmonized by the ILO using International Conference of Labour Statisticians (ICLS) definitions. The dataset includes multiple dimensions such as country (ISO3 code), sex (total, male, female), education classification, currency type, observation year, and value, making it suitable for tasks like tabular classification, regression, and time-series forecasting. Repackaged by Electric Sheep Africa, it is provided in a unified, ML-ready format for easy use by researchers and developers.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-ear-emtm-sex-edu-cur-nb-median-monthly-earnings-of-employees-by-sex-educat 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的核心劳动统计数据库ILOSTAT,聚焦于非洲大陆雇员按性别、教育程度及货币类型划分的中位月收入指标。数据通过ILOSTAT REST API直接采集,索引为EAR_EMTM_SEX_EDU_CUR_NB,并依据非洲ISO3国家代码进行地理过滤。ILO统计部门依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,每一观测值的来源均在source.label字段中明确标注,确保了数据的可追溯性与标准化。Electric Sheep Africa团队将原始数据重新打包为Parquet格式,构建成一个包含23,654条观测记录、覆盖44个非洲国家、时间跨度从1991年至2024年的结构化面板数据集。
特点
该数据集具有鲜明的层次化特征。首先,它以中位月收入为核心观测指标,避免了均值受极端值干扰的缺陷,更真实反映典型雇员的收入水平。其次,数据按性别(男、女、总计)、教育程度(细分至不同教育层级)以及货币类型(本地货币)三个维度进行精细拆解,为交叉分析提供了丰富切口。时间维度覆盖三十余年,地理维度囊括毛里求斯、南非、埃及等样本量充裕的国家,且对数据质量进行了严谨标注,如通过obs_status字段识别不可靠观测值。其单一指标、多维度拆解的结构,既保证了变量聚焦,又兼顾了研究的复杂性需求。
使用方法
用户可通过HuggingFace Datasets库便捷加载该数据集,核心命令为load_dataset(),返回的数据集可直接转换为Pandas DataFrame。针对时间序列分析,可按indicator筛选特定指标后,利用sort_values按年份排序并进行可视化。跨国家比较时,可采用pivot_table函数将数据重塑为国家×年份的矩阵。地域分析则可通过ref_area字段高效过滤至特定国家。数据集以Parquet格式存储,支持快速读写与高效内存管理,配合丰富的分类标签(如sex.label、classif1.label),极大降低了数据清洗的预处理门槛,适合直接用于回归、分类或时间序列预测等机器学习任务。
背景与挑战
背景概述
在全球劳动力市场研究中,收入数据是衡量经济平等、性别差异及教育回报的核心指标。国际劳工组织(ILO)通过其ILOSTAT数据库,长期致力于收集和标准化各国劳动统计信息,为政策制定与学术研究提供坚实的数据基础。在此背景下,Electric Sheep Africa于2024年重新打包并发布了非洲地区雇员月收入中位数数据集,该数据集整合了44个非洲国家1991至2024年间共23,654条观察记录,涵盖性别与教育程度的细分维度。数据集源自ILOSTAT官方API,经由严格的国际劳动统计学家会议定义进行数据清洗与标准化,填补了非洲区域劳动收入精细数据的空白,为研究非洲劳动力市场结构、性别工资差距以及教育对收入的影响提供了关键资源。
当前挑战
该数据集所解决的领域问题核心在于非洲劳动力市场中收入数据的碎片化与不可比性。非洲各国统计体系差异显著,调查时间跨度大,导致跨国家、跨时期的收入比较极为困难。数据构建过程中面临多重挑战:首先,各国采用的货币单位、教育分类标准及调查方法不一,需通过ILO统计部门进行统一编码与协调;其次,数据质量标志(如“不可靠”)需谨慎处理,以避免引入偏误;此外,部分国家部分年份数据缺失,且存在多个数据源冲突时需依赖ILO选定的“最佳来源”,这要求用户具备一定的数据筛选与处理能力。这些挑战凸显了非洲劳动统计领域数据整合与标准化工作的复杂性。
常用场景
经典使用场景
该数据集收录了国际劳工组织ILOSTAT数据库中1991至2024年间44个非洲国家雇员月收入中位数的面板数据,按性别、教育程度与货币单位进行精细分层。在劳动经济学与发展经济学领域,研究者常将其作为核心数据源,用于分析非洲大陆内部工资水平的时空演变趋势,并构建多水平回归模型以揭示教育回报率与性别收入差距的跨区域异质性。时间跨度达三十余年、覆盖国家广泛的特性,使其成为评估非洲劳动力市场结构性变迁的珍贵素材。
实际应用
在实际政策评估与社会治理层面,该数据集被非洲各国统计机构、世界银行及国际发展组织广泛采纳,用于旗舰报告如《全球工资报告》中非洲板块的基准测算与趋势预警。基于其按月发布的中位数指标,项目官员与劳动经济学家可实时锁定特定国家或行业内的收入异常波动,辅助设计精准的最低工资调整方案及教育与就业衔接干预措施。此外,民间社会组织利用该数据衡量经济赋权项目的实施效果,推动基于证据的劳资谈判与女性收入赋权行动。
衍生相关工作
该数据的可复现性与结构化特性催生了一系列衍生研究,包括基于机器学习的非洲各国工资预测模型,以及运用多水平贝叶斯方法对缺失教育层次数据进行后验插补的统计框架。在公开学术层面,已有若干利用该数据集验证人力资本溢出效应的内生增长模型,另有工作侧重解构货币换算与购买力平价对跨国收入排序的扭曲效应。作为Electric Sheep Africa在HuggingFace平台上发布的首批非洲标准化劳动统计数据集之一,它亦作为基准被后续若干关于非洲就业质量与体面劳动指数的元分析工作所引用,推动了非洲劳动数据科学生态的成型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务