遇见数据集

electricsheepafrica/africa-ilo-ear-ehrm-sex-mts-cur-nb-median-hourly-earnings-of-employees-by-sex-marital

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含非洲35个国家从1991年至2024年的员工中位小时收入数据,按性别、婚姻状况和货币细分。数据集共有4,580个观测值,涵盖一个核心指标:EAR_EHRM_SEX_MTS_CUR_NB(按性别、婚姻状况和货币划分的员工中位小时收入)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API提取并过滤为非洲国家代码,经过ILO的统计部门使用国际劳工统计学家会议(ICLS)定义进行标准化处理。数据集以表格形式组织,包含国家代码、年份、观测值、性别分类、婚姻状况分类、货币类型等列,适用于机器学习任务,如表格分类、回归分析和时间序列预测。数据质量方面,注意数据为年度频率,ILO会选择同一国家×年份的“最佳来源”,且细分列仅在指标发布该细分时非空。数据集由Electric Sheep Africa重新打包发布,采用CC-BY-4.0许可证。

This dataset contains 4,580 observations of median hourly earnings of employees across 35 Africa countries, spanning 1991–2024, disaggregated by sex, marital status, and currency. It covers one distinct indicator: EAR_EHRM_SEX_MTS_CUR_NB (Median hourly earnings of employees by sex, marital status and currency). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, pulled via API and filtered to Africa ISO3 country codes, with harmonization using ICLS definitions. The dataset is structured in tabular format with columns such as country code, year, observed value, sex classification, marital status classification, and currency type, suitable for machine learning tasks like tabular classification, regression, and time-series forecasting. Data quality notes include annual frequency, ILOs selection of best source for duplicate country×year entries, and non-null disaggregation columns only when published. Repackaged by Electric Sheep Africa and released under CC-BY-4.0 license.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-ear-ehrm-sex-mts-cur-nb-median-hourly-earnings-of-employees-by-sex-marital 数据集图片
构建方式
本数据集基于国际劳工组织(ILO)下属ILOSTAT统计数据库构建,通过其REST API接口直接获取指标代码为EAR_EHRM_SEX_MTS_CUR_NB的原始数据,并严格筛选出非洲地区的ISO3国家代码。数据经由Electric Sheep Africa团队进行标准化处理与重新封装,转化为机器学习就绪的Parquet格式。ILOSTAT自身依据国际劳工统计学家会议(ICLS)定义对各国调查微观数据进行协调处理,来源信息在source.label列中予以标注,确保了数据的可追溯性与一致性。
特点
数据集涵盖了1991年至2024年间35个非洲国家的4,580条观测记录,聚焦于雇员中位数小时工资这一核心指标,并按性别(男、女、合计)、婚姻状况及货币种类进行了细致的分类解构。各字段均包含原始代码及英文标签,便于非专业人员理解。数据频率为年度,并附有观测状态标记(如序列中断)及来源注释,提供了丰富的元数据支撑,使其不仅适用于常规统计分析,亦可用于时间序列预测与分类回归建模任务。
使用方法
用户可通过HuggingFace的datasets库以一行代码load_dataset()完成加载,并直接转换为Pandas DataFrame进行后续操作。典型使用方式包括:按国家代码过滤子集以进行国别分析;依据indicator字段筛选特定指标后按时间排序,绘制中位数小时工资的趋势图;以及利用pivot_table函数重塑数据为年份×国家的矩阵形式,便于面板数据分析或作为时序模型的输入。数据以Apache 2.0许可发布,使用时需同时引用原始ILO数据源及Electric Sheep Africa的再封装版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2024年通过其ILOSTAT数据库构建,并由Electric Sheep Africa在HuggingFace平台上重新封装发布,旨在提供非洲大陆35个国家自1991年至2024年间雇员按性别和婚姻状况划分的时薪中位数数据。作为全球劳动统计领域的权威来源,ILOSTAT通过整合国家劳动力调查、家庭收入调查及行政记录,并遵循国际劳工统计学家会议(ICLS)的定义进行标准化处理,为研究非洲劳动力市场的收入不平等、性别薪酬差距以及婚姻状况对薪酬的影响提供了关键数据基础。这一数据集填补了非洲地区在精细粒度薪酬统计方面的空白,尤其因覆盖了从毛里求斯(621条记录)到安哥拉(162条记录)等不同发展水平的经济体,成为分析区域经济结构转型与劳工权益演变的重要资源,对发展经济学、劳动经济学及公共政策研究具有深远影响。
当前挑战
该数据集所解决的领域核心挑战在于,非洲地区长期缺乏系统、可比且高时空分辨率的薪酬统计数据,导致基于证据的劳动力市场政策制定受阻。具体而言,首先,数据构建过程中需克服多国不同来源调查方法(如劳动力调查、企业调查)间的口径差异,ILOSTAT通过ICLS标准化定义实现了跨国产出的一致性,但部分观测值仍标注了“序列断裂”等质量标识。其次,数据稀疏性显著——在35个国家、34年跨度内仅含4,580条观测,且国家间记录数量极不均衡(如毛里求斯占621条,而20个国家不足百条),这使得面板数据分析面临严重的小样本偏差和代表性挑战。此外,数据以年度频率发布,缺失月度或季度波动信息,限制了高频经济周期研究,同时分类变量(性别、婚姻状况)的缺失值进一步提高了多维度交叉分析的复杂度。
常用场景
经典使用场景
在劳动经济学与性别不平等的研究领域中,该数据集的核心应用场景在于揭示非洲各国不同性别与婚姻状况下雇员的时薪中位数分布规律。研究者可借助其细粒度的分类维度,系统比较男性与女性在相同婚姻状态下的薪资差异,并追踪1991至2024年间薪资结构的动态演变。该数据集覆盖35个非洲国家,为跨国面板分析提供了坚实的数据基础,尤其适合用于探究婚姻溢价、性别工资差距及货币折算对实际收入的影响机制。通过时间序列与横截面数据的结合,学者能够构建多维回归模型,评估政策干预与经济转型对劳动力市场公平性的长期效应。
衍生相关工作
该数据集衍生了一系列影响深远的经典工作,尤其在劳动经济学与机器学习交叉领域。基于其分类与回归特性,研究者开发了预测非洲各国性别薪资差距的随机森林模型,以及识别薪资异常值的无监督学习算法。在时间序列预测方面,Prophet与LSTM模型被用于推断未来五年内不同婚姻状态群体的薪资趋势,为提前预警结构性不平等提供了技术路径。此外,该数据集的标准化架构启发了Electric Sheep Africa对其他ILOSTAT指标的批量封装,形成了覆盖就业、失业与工时等主题的数据族,进一步推动了非洲劳动统计数据的机器可读化与可复现性。引用该数据集的论文多发表于发展与人口学期刊,其核心贡献在于为宏观计量与数据驱动的政策评估之间架设了桥梁。
数据集最近研究
最新研究方向
该数据集聚焦于非洲劳动力市场中按性别与婚姻状况分层的小时工资中位数时序数据,为跨国劳动经济学前沿议题提供了稀缺的粒度化实证支撑。当前研究热点围绕非洲大陆自贸区(AfCFTA)推进过程中的性别工资差距、婚姻溢价效应及非正规就业形态对收入的影响展开,尤其关注ILO《全球工资报告》中揭示的非洲地区工资收敛与分化并存的矛盾态势。数据集覆盖35国34年观测值,可支持面板数据分析以识别婚姻状态与性别在收入决定机制中的交互效应,有助于量化社会规范、家庭分工及劳动力市场制度对薪酬不平等的塑造作用,为SDG目标8(体面劳动)在撒哈拉以南区域的实现路径提供证据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务