遇见数据集

electricsheepafrica/africa-ilo-ear-emta-sex-nb-average-monthly-earnings-of-employees-by-sex-local

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个表格型数据集,包含非洲46个国家从1990年至2024年员工月平均收入(以当地货币计)的观测数据,共642个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API获取并过滤为非洲国家。核心指标为EAR_EMTA_SEX_NB,表示按性别划分的员工月平均收入,数据按性别(总计、男性、女性)和年份进行细分。数据集提供了国家代码、国家名称、数据来源、指标代码和标签、性别分类、观测年份、观测值、观测状态及相关注释等字段,适用于时间序列预测、表格分类和回归等任务。数据以年度频率发布,并经过ILO的标准化处理,确保数据质量。

This dataset is a tabular dataset containing 642 observations of average monthly earnings of employees (in local currency) across 46 African countries from 1990 to 2024. The data is sourced from the International Labour Organizations (ILO) ILOSTAT statistical database, retrieved via REST API and filtered for African countries. The core indicator is EAR_EMTA_SEX_NB, representing average monthly earnings of employees by sex, with disaggregation by sex (total, male, female) and year. The dataset includes fields such as country code, country name, data source, indicator code and label, sex classification, observation year, observed value, observation status, and related notes. It is suitable for tasks like time-series forecasting, tabular classification, and regression. The data is published at annual frequency and harmonized by ILO for quality assurance.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-ear-emta-sex-nb-average-monthly-earnings-of-employees-by-sex-local 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,聚焦非洲地区雇员按性别划分的平均月收入(以当地货币计)。数据通过ILOSTAT REST API直接抽取,并依据非洲ISO3国家代码进行地域筛选。ILOSTAT依据国际劳动统计学家会议(ICLS)定义,对原始调查微观数据进行统一协调与标准化,最终形成涵盖46个非洲国家、时间跨度1990年至2024年、共计642条观测记录的整洁数据集。Electric Sheep Africa团队对其进行了封装与重发布,以Parquet格式存储,便于机器学习任务直接调用。
特点
该数据集的核心特点在于其聚焦性、标准化与可追溯性。其仅包含一项关键指标——按性别分组的平均月收入,但提供了sex(男性、女性、总计)的细粒度拆解,便于分析性别薪酬差异。数据覆盖了非洲大陆绝大多数国家,时间跨度达35年,能够支撑长时序的劳动力市场趋势研究。每一观测均附有来源标识(source.label),确保数据来源透明可溯源。数据质量方面,ILO在存在多个来源时优先选择最佳数据源,并提供观测状态标志(如'中断序列'),以提示使用者潜在的统计口径变化。
使用方法
该数据集可通过HuggingFace Datasets库的load_dataset()函数直接加载,返回一个Pandas DataFrame对象,便于后续分析与建模。使用者可通过ref_area字段筛选特定国家(如Kenya),进而进行单国家的时间序列分析。对于跨国家比较,可利用indicator字段筛选指标后,通过pivot_table方法重构为以时间为行、国家为列的矩阵形式,方便进行面板数据回归或可视化。此外,sex字段的支持使得研究者能够轻松对比男女薪酬差异的演变趋势,极大降低了非洲劳动经济学实证研究的门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门ILOSTAT于2024年创建,经Electric Sheep Africa重新打包发布,聚焦于非洲46个国家1990至2024年间按性别划分的雇员平均月收入(以当地货币计)的642条观测记录。作为全球劳动统计的重要来源,ILOSTAT整合了各国劳动力调查、家庭收入调查及行政记录,旨在提供标准化且可比较的性别收入数据。这一数据集填补了非洲地区长期存在的高质量性别薪酬数据缺口,为研究劳动力市场性别不平等、经济发展与政策评估提供了实证基础,对推动可持续发展目标中体面工作与经济增长的监测具有深远影响。
当前挑战
该数据集面临的核心挑战包括:首先,性别薪酬差异的系统性量化难题。非洲各国统计能力参差不齐,数据采集频率、定义及质量不一,导致跨国家、跨年度的可比性受限,易因方法差异引入偏差。其次,数据构建过程中的整合挑战。ILO从多源异构数据(如劳动力调查、行政记录)中提取并标准化信息,需克服分类不一致、数据缺失及历史序列中断等问题,如数据集中的'obs_status'字段标记了系列间断等异常状态。此外,性别维度仅提供总、男、女三分类,无法细化到行业、职业或教育层级,限制了深层不平等机制的分析。最后,本地货币单位的采用使得跨国比较受汇率波动影响,增加了经济分析的复杂性。
常用场景
经典使用场景
该数据集收录了国际劳工组织(ILO)ILOSTAT数据库中非洲46个国家1990至2024年间按性别划分的员工月均收入数据(以本币计),共642条观测记录。其经典使用场景集中于非洲劳动经济学的横截面与面板数据分析,研究者可据此构建性别工资差距的跨国比较模型,或结合时间序列方法追踪特定国家(如南非、埃及)收入水平的长期演变轨迹。数据集提供了细化的性别分类(总、男、女)及来源标注,便于进行统计推断与重复验证。
解决学术问题
在学术研究中,该数据集解决了非洲地区因数据碎片化而难以系统研究性别收入不平等的核心困境。通过提供ILO官方统一口径的长时间序列数据,研究者得以检验人力资本理论、劳动力市场歧视假说等经典命题在非洲语境下的适用性。其意义在于填补了非洲大陆劳动经济学实证研究的空白,为理解经济发展阶段与性别工资差异的交互作用提供了可靠证据,进而在可持续发展目标(SDG)第八项体面工作的监测评估中发挥了基础支撑作用。
衍生相关工作
该数据集衍生出的代表性工作包括基于ILOSTAT非洲子集的性别工资差距分解研究,研究者运用Oaxaca-Blinder分解方法识别教育、职业隔离等可解释部分与不可解释歧视成分的贡献率。另有团队将其与非洲人口健康调查(DHS)挂钩,探究女性经济赋权与家庭决策权之间的关联。在数据科学领域,该数据已被用于构建面向低资源语境的迁移学习基准——利用多国收入序列训练时序预测模型,以缓解单一国家样本量不足的问题,推动了非洲计算社会科学的方法论创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务