遇见数据集

electricsheepafrica/africa-ilo-ear-emta-sex-cbr-cur-nb-average-monthly-earnings-of-employees-by-sex-place

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含关于非洲31个国家员工月平均收入的数据,按性别、出生地和货币分类。数据涵盖1991年至2025年,共有2,231个观测值。核心指标为EAR_EMTA_SEX_CBR_CUR_NB,即员工月平均收入。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为非洲国家。数据集包括国家代码、指标代码、性别分类(总计、男性、女性)、出生地分类、货币分类、年份和观测值等列,适用于表格分类、回归或时间序列预测任务。数据以年度频率发布,并包含数据来源和质量标记。

许可证:CC-BY-4.0 语言: - 英语 任务类别: - 表格分类 - 表格回归 - 时间序列预测 多语言类型:单语言 样本量范围: - 1000 < n < 10000 标签: - 表格数据 - 非洲 - ILOSTAT - 国际移民存量 - 国际劳工组织(ILO) - 劳工 - 就业 美观名称:"按性别、出生地及货币划分的雇员月均收入 | 非洲(ILOSTAT)" --- # 按性别、出生地及货币划分的雇员月均收入 | 非洲(ILOSTAT) 🌍 **2231条观测样本** · **31个非洲国家** · **1991–2025年** · *由[Electric Sheep Africa](https://huggingface.co/electricsheepafrica)重新整理发布* ![rows](https://img.shields.io/badge/rows-2,231-blue) ![countries](https://img.shields.io/badge/countries-31-green) ![years](https://img.shields.io/badge/years-1991–2025-orange) ![indicators](https://img.shields.io/badge/indicators-1-purple) ![license](https://img.shields.io/badge/license-cc-by-4.0-lightgrey) ## 简短摘要 本数据集包含覆盖31个非洲国家、时间跨度为1991至2025年的**2231条`国际移民存量`数据观测样本**,涉及**1项独立指标**。 ## 关于数据源 **ILOSTAT** 是国际劳工组织(ILO)的中央统计数据库,是全球领先的劳工统计数据来源。其收录的指标涵盖就业、失业、薪资、工作时长、童工、非正规经济、社会保障、职业伤害以及可持续发展目标(Sustainable Development Goals, SDG)体面工作目标——数据来源于全国劳动力调查、家庭收入调查、机构调查及行政记录。该数据库覆盖200多个经济体,由国际劳工组织统计司负责数据的统一协调。 - **来源**:[ILOSTAT](https://www.ilo.org/shinyapps/bulkexplorer/?id=EAR_EMTA_SEX_CBR_CUR_NB) - **发布方**:国际劳工组织(ILO) - **许可证**:[cc-by-4.0](https://creativecommons.org/licenses/by/4.0/) - **主题**:国际移民存量 ## 数据处理方法 数据直接从ILOSTAT的REST API接口`https://rplumber.ilo.org/data/indicator?id=EAR_EMTA_SEX_CBR_CUR_NB`获取,并筛选出非洲的ISO3国家代码。ILOSTAT采用国际劳工统计学家会议(International Conference of Labour Statisticians, ICLS)的定义对原始调查微观数据进行统一协调;数据来源会在`source.label`列中标记,以确保可追溯性。 ## 地理覆盖范围 31个非洲国家,以下展示前若干行(按样本量排序): | 国家 | 样本量 | 起始年份 | 结束年份 | |---------|-----:|-----------:|----------:| | `ZMB` | 192 | 2017 | 2024 | | `GHA` | 188 | 1991 | 2024 | | `RWA` | 162 | 2014 | 2024 | | `AGO` | 159 | 2019 | 2024 | | `LBR` | 126 | 2010 | 2017 | | `EGY` | 123 | 2008 | 2011 | | `MLI` | 105 | 2020 | 2024 | | `TZA` | 96 | 2012 | 2024 | | `BEN` | 90 | 2011 | 2022 | | `UGA` | 90 | 2012 | 2021 | | `BFA` | 81 | 2018 | 2024 | | `SWZ` | 72 | 2016 | 2025 | | `CPV` | 66 | 2015 | 2022 | | `NAM` | 63 | 2016 | 2018 | | `GMB` | 60 | 2012 | 2018 | | ... | _另有16个国家_ | | | ## 指标(示例) - `EAR_EMTA_SEX_CBR_CUR_NB` — 按性别、出生地及货币划分的雇员月均收入 ## 数据架构 | 列名 | 数据类型 | 描述 | 示例 | |--------|------|-------------|---------| | `ref_area` | `string` | ISO 3166-1 alpha-3国家代码 | `AGO` | | `ref_area.label` | `string` | 英文国名 | `安哥拉` | | `source` | `string` | ILOSTAT来源代码(如劳动力调查) | `BA:13951` | | `source.label` | `string` | 英文来源名称 | `劳动力调查(LFS)` | | `indicator` | `string` | ILOSTAT指标代码 | `EAR_EMTA_SEX_CBR_CUR_NB` | | `indicator.label` | `string` | 英文指标名称 | `按性别、出生地及货币划分的雇员月均收入……` | | `sex` | `string` | 性别细分维度(SEX_T=总计,SEX_M=男性,SEX_F=女性) | `SEX_T` | | `sex.label` | `string` | — | `总计` | | `classif1` | `string` | 第一分类变量(年龄、教育程度、就业身份等) | `CBR_BIR_TOTAL` | | `classif1.label` | `string` | — | `出生地:总计` | | `classif2` | `string` | 可选第二分类变量 | `CUR_TYPE_LCU` | | `classif2.label` | `string` | — | `货币:本国货币` | | `time` | `int64` | 观测年份 | `2024` | | `obs_value` | `float64` | 观测指标值(单位随指标变化,详见指标定义) | `111867.158` | | `obs_status` | `string` | 观测状态标记(如临时数据、不可靠数据) | `B` | | `obs_status.label` | `string` | — | `序列中断` | | `note_indicator` | `string` | — | `T30:2` | | `note_indicator.label` | `string` | — | `货币:安哥拉宽扎(AOA)` | | `note_source` | `string` | — | `R1:3513` | | `note_source.label` | `string` | — | `存储库:国际劳工组织统计数据库-微观数据……` | ## 细分维度 以下列提供数据细分维度: - **`sex`**(3个唯一值):`SEX_T`、`SEX_M`、`SEX_F` ## 数据质量与注意事项 - 数据为年度频率。部分指标同时发布月度或季度序列,本数据集未包含此类数据。 - 当同一国家×年份的指标存在多个来源时,将采用国际劳工组织选定的“最佳来源”数据。 - 细分列(`sex`、`classif1`、`classif2`)仅在指标支持对应细分时才非空。 ## 使用方法 python from datasets import load_dataset ds = load_dataset("electricsheepafrica/africa-ilo-ear-emta-sex-cbr-cur-nb-average-monthly-earnings-of-employees-by-sex-place") df = ds["train"].to_pandas() print(df.head()) ### 筛选单个国家 python kenya = df[df["ref_area"] == "KEN"] ### 单个指标的时间序列数据 python sample = (df[df["indicator"] == "EAR_EMTA_SEX_CBR_CUR_NB"] .sort_values("time")) sample.plot(x="time", y="obs_value", title="EAR_EMTA_SEX_CBR_CUR_NB") ### 转换为国家×年份矩阵 python matrix = (df[df["indicator"] == "EAR_EMTA_SEX_CBR_CUR_NB"] .pivot_table(index="time", columns="ref_area", values="obs_value")) print(matrix.tail()) ## 引用格式 bibtex @misc{africa_ilo_ear_emta_sex_cbr_cur_nb_average_monthly_earnings_of_employees_by_sex_place_2025, title = {Average monthly earnings of employees by sex, place of birth and currency | Africa (ILOSTAT)}, author = {International Labour Organization (ILO)}, year = {2025}, url = {https://www.ilo.org/shinyapps/bulkexplorer/?id=EAR_EMTA_SEX_CBR_CUR_NB}, publisher = {HuggingFace Datasets, repackaged by Electric Sheep Africa}, howpublished = {url{https://huggingface.co/datasets/electricsheepafrica/africa-ilo-ear-emta-sex-cbr-cur-nb-average-monthly-earnings-of-employees-by-sex-place}} } ## 许可证 本数据集采用[cc-by-4.0](https://creativecommons.org/licenses/by/4.0/)许可证发布。原始数据版权归国际劳工组织(ILO)所有。使用本数据集时,请同时引用上述原始来源及Electric Sheep Africa的重新整理版本。 ## 关于Electric Sheep Electric Sheep Africa是Electric Sheep使命的一部分:在HuggingFace平台上构建统一的、适配机器学习的非洲数据层。我们从权威开放数据源获取数据,标准化数据架构,打包为Parquet格式,并以统一的数据集卡片发布,使研究人员与开发者可通过`load_dataset()`函数在数秒内启动工作。 浏览完整数据集集合:[huggingface.co/electricsheepafrica](https://huggingface.co/electricsheepafrica) --- _数据溯源:2026年5月27日通过Electric Sheep数据管道获取。源URL:https://www.ilo.org/shinyapps/bulkexplorer/?id=EAR_EMTA_SEX_CBR_CUR_NB_

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-ear-emta-sex-cbr-cur-nb-average-monthly-earnings-of-employees-by-sex-place 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API接口直接抽取指标代码为EAR_EMTA_SEX_CBR_CUR_NB的全部观测数据,并依据非洲ISO3国家代码进行地理过滤。原始数据来自各国劳动力调查、家庭收入调查、企业调查及行政记录等多元渠道,ILOSTAT依据国际劳工统计学家会议(ICLS)定义进行统一标准化处理。数据集中每一条观测均标注了来源代码(source)和观测状态标志(obs_status),确保数据溯源完整。Electric Sheep Africa团队将原始API返回数据重组为结构化的Parquet格式,并发布至HuggingFace平台,使研究者能够便捷地通过一行代码加载使用。
使用方法
用户可通过HuggingFace的datasets库以load_dataset()函数直接加载该数据集,并将训练集转化为pandas DataFrame进行后续分析。针对特定国家的聚焦分析,可基于'ref_area'字段(如'KEN'代表肯尼亚)进行行筛选。时间序列分析时,可依据'indicator'字段过滤核心指标并按'time'排序,以观测平均月薪的趋势变化。为构建国家与年份交叉矩阵,可利用pivot_table方法将数据重塑为宽表形式,其中行索引为年份、列名为国家代码、值为观测数值,从而便于多国面板数据的比较与建模。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)旗下ILOSTAT统计数据库于2025年创建,经Electric Sheep Africa机构重新封装后发布于HuggingFace平台。其核心研究问题聚焦于非洲地区雇员的平均月收入在性别、出生地及货币维度下的分布规律,涵盖1991至2025年间31个非洲国家的2231条观测记录。作为劳动经济学与移民研究领域的重要数据资源,该数据集为分析非洲劳动力市场中的性别收入差距、移民经济融入及收入跨国比较提供了标准化、可复现的实证基础,有力推动了相关区域研究与政策评估的定量化进程。
当前挑战
该数据集所解决的核心领域挑战在于非洲劳动力市场中性别收入差异与移民经济地位的量化评估难题——由于各国统计口径、调查频率及数据质量参差,跨国的收入比较长期缺乏统一基准。构建过程中面临的挑战包括:从ILOSTAT REST API中提取数据时需应对多源调查(如劳动力调查、住户收入调查)的数据异构性与时空覆盖不均衡问题;数据清洗须处理观测值中的中断标记(如'Break in series')及部分国家年度数据稀疏现象;同时需将分类变量(性别、出生地)与国际劳工统计学家会议标准对齐,以确保跨国跨时期的可比性。
常用场景
经典使用场景
该数据集汇聚了非洲31个国家1991至2025年间按性别及出生地划分的雇员平均月薪信息,共计2231条观测记录,在劳动经济学与社会性别研究领域具有广泛适用性。典型的使用场景聚焦于性别薪酬差距的跨国与跨时段比较分析,通过sex字段的细粒度划分,研究者能够量化不同性别群体在就业市场的收入差异。同时,该数据与时间变量结合,可用于构建面板数据模型,探究非洲各国经济发展阶段、劳动力市场政策变迁与薪酬结构演变的内在关联。此外,classif1字段提供的出生地分类为研究移民与本地劳动力薪酬差距提供了宝贵窗口,特别适合评估劳动流动性和社会融入的经济效益。
解决学术问题
这一数据集精准回应了非洲劳动经济学研究中长期面临的数据稀疏难题,为跨国薪酬结构建模提供了标准化、可复用的基础资源。它有效解决了因数据源碎片化导致的比较分析困境,使研究者能够系统探讨性别工资差距的收敛趋势、移民劳动力的薪酬粘性以及本地货币计薪对购买力平价调整的潜在影响。通过统一遵循ILO定义的统计口径,数据集的引入显著降低了测量误差与定义偏差对实证结论的扰动,为验证人力资本理论、劳动力市场分割假说及制度变迁效应提供了坚实的数据支撑,进而强化了非洲地区劳动政策评估的科学基础。
实际应用
在实际应用层面,该数据集为国际组织、国家级统计部门及非营利机构制定和调整就业政策提供了量化依据。例如,国际劳工组织可基于性别薪酬离散度趋势评估非洲各国实现可持续发展目标中体面工作指标方面的进展,识别亟需干预的高差距国家和地区。政府劳动部门可结合当地通货膨胀率和最低工资标准,利用这一数据优化薪资指导意见,促进性别收入公平。此外,专注于非洲经济与劳动力市场的研究咨询公司可将其嵌入预测模型,分析特定行业或地区的人力成本变动规律,为跨国企业投资决策和社会责任项目设计提供可靠的经济参考。
数据集最近研究
最新研究方向
该数据集聚焦于非洲31个国家1991至2025年按性别与出生地划分的员工月均收入动态,为劳动经济学、移民研究与性别平等议题提供了关键实证基础。当前前沿研究方向包括利用时间序列预测模型解析非正规就业与结构性失业对薪资演变的冲击,结合国际劳工组织统计标准追溯数据质量轨迹,并探索跨国迁移浪潮下劳动力市场分割的性别差异。随着ILOSTAT数据与机器学习方法的深度融合,该数据集正支撑起非洲数字治理与可持续发展目标中体面工作指标的可量化评估,成为刻画区域经济韧性、政策干预效应及社会公平维度的核心资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务