遇见数据集

electricsheepafrica/africa-ilo-ear-ehrm-sex-dsb-cur-nb-median-hourly-earnings-of-employees-by-sex-and-dis

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含非洲22个国家从2005年至2024年的1,548条观测数据,聚焦于员工小时收入中位数指标,具体按性别(总计、男性、女性)和残疾状况(总计)以及货币类型(本地货币)进行细分。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖了劳动统计中的收入主题,包括员工小时收入中位数的年度数据,并提供了国家代码、来源、指标代码、分类变量、观察年份、观测值及状态等详细字段。数据集旨在支持表格分类、表格回归和时间序列预测等任务,适用于劳动市场分析和机器学习应用。

This dataset contains 1,548 observations of Earnings data across 22 Africa countries, spanning 2005–2024, covering 1 distinct indicator: Median hourly earnings of employees by sex and disability status and currency. It provides detailed data on median hourly earnings, disaggregated by sex (total, male, female) and disability status (total) and currency (local currency), sourced from the ILOSTAT database of the International Labour Organization (ILO). The dataset includes columns such as country code, source, indicator code, classification variables, observation year, observed value, and status flags, and is designed for tasks like tabular classification, regression, and time-series forecasting in labor market analysis.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-ear-ehrm-sex-dsb-cur-nb-median-hourly-earnings-of-employees-by-sex-and-dis 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,经由Electric Sheep Africa重新封装而成。数据通过ILOSTAT REST API接口直接抽取,并依据非洲ISO3国家代码进行筛选过滤。ILOSTAT基于国际劳工统计学家会议(ICLS)定义,对各国原始调查微观数据进行协调统一,并在source.label列中标注数据来源以供追溯。数据集包含1548条观测记录,覆盖22个非洲国家,时间跨度从2005年至2024年,聚焦于“按性别和残疾状况及货币划分的员工中位时薪”这一单一核心指标。
使用方法
研究人员可通过HuggingFace Datasets库的load_dataset()函数便捷加载数据集,并将其转换为pandas DataFrame进行后续分析。典型使用场景包括:按国家筛选子集以进行国别分析;针对特定指标进行时间序列可视化,揭示中位时薪的年度演变趋势;利用数据透视表构建国家×年份的矩阵面板,以便开展跨国比较或面板数据回归。该数据集兼容表格分类、回归与时间序列预测等任务,为劳动经济学领域的研究与建模提供了标准化、ML-Ready的数据基础。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2024年构建,经由Electric Sheep Africa重新封装发布,聚焦非洲22个国家2005至2024年间按性别与残疾状态分组的雇员中位数时薪数据。数据集源自ILOSTAT这一全球劳动统计权威数据库,其核心研究问题在于揭示非洲劳动力市场中不同性别及残疾群体的收入差异,为评估体面劳动与可持续发展目标(SDG)第八条提供量化基础。数据集收录1548条观测值,涵盖多元分类维度,为探究非洲劳动报酬的结构性不平等提供了宝贵的标准化时间序列资料,对区域劳动经济学、政策评估及公平就业研究具有重要影响。
当前挑战
该数据集面临的核心挑战在于所解决的领域问题:劳动力市场中性别与残疾群体间的收入鸿沟长期缺乏系统性的高频微观数据支撑,传统调查常因样本量小、分类粗糙而无法精细刻画交叉不平等(如残疾女性与健全男性的薪酬差异)。构建过程中亦遭遇显著困难,包括:非洲各国统计机构在调查工具、定义标准(如残疾状态界定)与数据质量上存在巨大差异,需通过ILO的ICLS定义进行跨国家协调整合;原始数据源可能涵盖月度或季度序列,而该数据集仅保留年度频率,在时间粒度上存在信息折损;同时,观测值中标记为“不可靠”(obs_status=U)的记录警示了部分国家数据置信度不足的问题。
常用场景
经典使用场景
该数据集最经典的使用场景在于探究非洲地区雇员的薪酬不平等现象,特别是基于性别和残疾状态的双重维度。研究者能够利用这一精细化的纵向面板数据,通过构建回归模型或进行差异分解分析,量化性别薪酬差距与残疾薪酬差距在非洲22个国家中的具体表现与演变趋势。作为ILOSTAT官方数据在非洲区域的标准化重打包成果,它为劳动经济学、发展经济学以及社会分层研究提供了可靠的基础数据底座。
解决学术问题
该数据集直接回应了非洲劳动市场中长期存在的实证难题:缺乏高质量、跨国家且时间连续的薪酬微观数据来支撑性别与残疾歧视研究。通过提供经过国际劳工组织协调的标准化调查数据,学术研究得以在更严格的统计框架下评估残疾状态对小时工资的中位数影响,并分离出性别与残疾状态的交互效应。这不仅填补了非洲区域薪酬不平等实证研究的空白,也推动了国际比较视野下的社会正义议题从理论探讨走向数据驱动。
实际应用
在实际应用中,该数据集被国际组织、国家统计部门以及非政府机构用于监测联合国可持续发展目标中关于体面劳动和减少不平等的进展。政策制定者可以借助这些数据识别特定国家或产业中劳动报酬较低的弱势群体,从而设计出更具针对性的最低工资调整方案、就业扶持计划以及残疾人职业培训项目。数据经过脱敏并以标准格式发布,降低了机器学习模型在劳动经济学预测任务中的调用门槛,有助于构建自动化监测预警系统。
数据集最近研究
最新研究方向
该数据集聚焦于非洲地区按性别与残疾状态划分的员工时薪中位数,为劳动经济学与包容性发展研究提供了宝贵的时间序列数据。当前前沿方向主要包括利用该数据探究残疾群体在劳动力市场中的薪酬差异与性别交叉效应,结合ILOSTAT标准化调查方法,分析非洲国家在实现联合国可持续发展目标(SDG)体面工作议程上的进展。随着非洲各国逐步完善残疾人权益保障政策,该数据集成为量化评估薪酬公平性、揭示结构性歧视、以及推动基于证据的政策干预的关键资源,尤其在新冠疫情后全球经济复苏背景下,对理解弱势就业群体的脆弱性与韧性具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务