遇见数据集

electricsheepafrica/africa-ilo-ear-ehra-sex-cur-nb-average-hourly-earnings-of-employees-by-sex-and-cu

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含1499个观测值,涵盖37个非洲国家,时间跨度为1969年至2024年,涉及1个不同指标的收入数据。具体指标为“按性别和货币划分的员工平均小时收入”,数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过Electric Sheep Africa重新包装,用于表格分类、回归和时间序列预测等任务。

This dataset contains 1,499 observations of Earnings data across 37 Africa countries, spanning 1969–2024, covering 1 distinct indicators. The indicator is Average hourly earnings of employees by sex and currency, sourced from the International Labour Organization (ILO) ILOSTAT database, repackaged by Electric Sheep Africa, and intended for tasks such as tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-ear-ehra-sex-cur-nb-average-hourly-earnings-of-employees-by-sex-and-cu 数据集图片
构建方式
该数据集由Electric Sheep Africa通过ILOSTAT REST API直接获取,筛选至非洲ISO3国家代码区域,并进行了标准化处理。ILOSTAT作为国际劳工组织(ILO)的核心统计数据库,基于各国劳动力调查、家庭收入调查、企业调查及行政记录等原始微观数据,采用国际劳工统计学家会议(ICLS)定义进行统一协调。数据以Parquet格式封装,确保机器学习就绪,并保留了source.label列以追踪数据来源,构建过程严格遵循CC-BY-4.0许可协议。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数直接加载数据集,轻松转换为Pandas DataFrame进行探索。典型应用包括按国家筛选(如df[df['ref_area']=='KEN'])进行国别分析,或按指标排序生成时间序列图。对于跨国家比较,可利用pivot_table创建国家×年份的观测值矩阵,支持面板数据分析。文档提供了简洁的Python代码示例,便于快速上手,适合时间序列预测、分类与回归等机器学习任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门于2024年整理发布,并由Electric Sheep Africa团队在HuggingFace平台重新封装,旨在提供非洲地区1969年至2024年间按性别和货币分类的雇员平均时薪数据。数据集覆盖37个非洲国家,包含1499条观测记录,核心研究问题聚焦于非洲劳动力市场中的性别薪酬差异及货币单位的时薪变动趋势。作为ILOSTAT全球劳动统计数据库的一部分,该数据集为理解非洲各经济体的就业质量、收入不平等及体面劳动指标提供了关键数据支撑,对劳动经济学、发展经济学及性别研究领域具有重要参考价值。其影响力体现在为跨国家、跨时间维度的比较分析奠定了标准化数据基础,尤其有助于填补非洲地区劳动收入统计的空白。
当前挑战
该数据集面临的挑战体现在多个层面。在领域问题方面,它主要解决非洲劳动力市场中性别薪酬差异的量化评估难题,但数据来源的多元性导致观测值在统计口径、调查方法和时间频率上存在异质性,尤其当同一国家不同年份采用不同调查来源时,需谨慎处理数据连贯性。在构建过程中,挑战包括:从ILOSTAT REST API获取原始数据时需进行非洲国家ISO3代码的过滤与匹配;原始数据中分类变量(如性别、货币类型)的非空处理与标准化;以及应对观测状态标记(如序列中断、临时数据)带来的质量控制问题。此外,年度频率的数据无法捕捉季度或月度波动,限制了高频时间序列分析的应用场景,而部分国家覆盖年份稀疏(如仅6年数据)也削弱了面板数据的统计可靠性。
常用场景
经典使用场景
该数据集汇集了国际劳工组织ILOSTAT数据库中37个非洲国家1969至2024年间雇员按性别和货币分类的平均小时工资观测值,共计1499条记录。其最经典的使用场景在于进行非洲大陆劳动力市场的时间序列与面板数据分析,研究者可通过性别这一关键维度切入,系统性地追踪和比较各国工资水平的长期演变趋势,为理解非洲经济结构转型与劳动报酬动态提供了标准化的量化基础。
解决学术问题
该数据集有效解决了非洲地区因统计口径不一、数据零散而导致的跨国劳动力报酬比较难题。通过统一的数据结构与性别细分,它助力学者实证检验性别工资差距的演化路径及收敛假设,并评估贸易开放、产业结构调整、制度变迁等宏观因素对工资分配的影响。其重要意义在于填补了非洲劳动经济学实证研究的底层数据空白,为验证和修正发展经济学中的经典理论提供了可靠证据支撑。
实际应用
在实际应用层面,该数据集是国际发展机构、各国劳工部门及研究智库进行政策评估与监测的宝贵工具。它可用于量化分析最低工资政策、性别平等倡议及就业促进计划对员工实际收入的影响效果,支持基于证据的劳动力市场治理决策。同时,企业投资选址时,可借助该数据评估不同国家的人力成本水平与性别构成,优化区域发展战略。
数据集最近研究
最新研究方向
非洲劳动力市场性别薪酬差异的时空动态分析。基于国际劳工组织ILOSTAT数据源,该数据集整合了37个非洲国家1969至2024年间按性别和货币分类的雇员平均小时收入数据,为揭示非洲大陆劳动力市场中性别薪酬不平等的历史演变与地域异质性提供了稀缺的纵向实证基础。当前前沿研究聚焦于利用此类细粒度时序数据构建解释性模型,以剖析全球化、产业结构转型及性别平等政策对非洲多国薪酬差距的异质性冲击效应,进而为联合国可持续发展目标中体面工作与性别平等议题的在地化监测与干预策略设计提供数据驱动的决策支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务