遇见数据集

electricsheepafrica/africa-ilo-ear-emta-sex-cur-nb-average-monthly-earnings-of-employees-by-sex-and-c

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的按性别和货币划分的员工平均月收入指标数据,专门针对非洲地区。数据集涵盖45个非洲国家,时间跨度为1969年至2024年,共包含2534个观测值。数据以表格形式组织,包括国家代码、国家名称、数据来源、指标代码、指标标签、性别分类、货币分类、观测年份、观测值、观测状态等列。数据经过ILO的标准化处理,使用国际劳工统计学家会议(ICLS)定义进行统一,并过滤为非洲国家。数据集适用于表格分类、回归和时间序列预测等任务,旨在为研究非洲劳动力市场、收入差异和经济趋势提供机器学习就绪的数据。

许可证:CC BY 4.0 语言:英语 任务类别: - 表格分类 - 表格回归 - 时间序列预测 多语言属性:单语言 样本量区间:1000 < n < 10000 标签: - 表格数据 - 非洲 - ILOSTAT - 收入 - 国际劳工组织(ILO) - 劳工 - 就业 友好名称:"按性别与货币划分的非洲雇员月均收入(ILOSTAT)" --- # 按性别与货币划分的非洲雇员月均收入(ILOSTAT) 🌍 **2,534 条观测样本** · **45 个非洲国家** · **1969–2024** · *由 [Electric Sheep Africa](https://huggingface.co/electricsheepafrica) 重新整理发布* ![rows](https://img.shields.io/badge/rows-2,534-blue) ![countries](https://img.shields.io/badge/countries-45-green) ![years](https://img.shields.io/badge/years-1969–2024-orange) ![indicators](https://img.shields.io/badge/indicators-1-purple) ![license](https://img.shields.io/badge/license-cc-by-4.0-lightgrey) ## 核心摘要(TL;DR) 本数据集包含覆盖45个非洲国家、时间跨度为1969至2024年的**2,534条收入数据观测样本**,涉及**1项独立指标**。 ## 关于数据源 **ILOSTAT(International Labour Organization Statistics Database,国际劳工组织统计数据库)** 是国际劳工组织(ILO)的核心统计数据库,为全球领先的劳工统计权威来源。其收录指标涵盖就业、失业、工资、工作时长、童工、非正规经济、社会保障、职业伤害以及可持续发展目标(SDG)体面工作相关指标,数据源自全国劳动力调查、家庭收入调查、企业调查与行政记录,覆盖200余个经济体,由国际劳工组织统计部门负责数据协调统一。 - **数据源**:[ILOSTAT](https://www.ilo.org/shinyapps/bulkexplorer/?id=EAR_EMTA_SEX_CUR_NB) - **发布方**:国际劳工组织(ILO) - **许可证**:[CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) - **主题**:收入 ## 数据处理方法 本数据集直接从ILOSTAT的REST API接口 `https://rplumber.ilo.org/data/indicator?id=EAR_EMTA_SEX_CUR_NB` 拉取原始数据,并筛选出非洲国家的ISO 3166-1 alpha-3国别代码子集。ILOSTAT采用国际劳工统计学家会议(International Conference of Labour Statisticians, ICLS)的定义对原始调查微观数据进行标准化协调;数据来源信息将在`source.label`字段中标记,以保证可追溯性。 ## 地理覆盖范围 45个非洲国家,以下按样本行数排序展示部分国家: | 国家 | 样本行数 | 起始年份 | 终止年份 | |---------|-----:|-----------:|----------:| | `EGY` | 348 | 1969 | 2024 | | `MUS` | 259 | 1980 | 2024 | | `ZAF` | 188 | 1994 | 2020 | | `BWA` | 161 | 1979 | 2024 | | `SWZ` | 115 | 1972 | 2023 | | `KEN` | 107 | 1969 | 2019 | | `MLI` | 99 | 2013 | 2024 | | `UGA` | 84 | 2002 | 2021 | | `SYC` | 78 | 1990 | 2022 | | `GHA` | 76 | 1975 | 2024 | | `TZA` | 72 | 2001 | 2024 | | `ZMB` | 72 | 2017 | 2024 | | `AGO` | 54 | 2019 | 2024 | | `RWA` | 54 | 2014 | 2024 | | `NER` | 51 | 2009 | 2022 | | ... | 另有30个国家 | | | ## 指标(示例) - `EAR_EMTA_SEX_CUR_NB` — 按性别与货币划分的雇员月均收入 ## 数据结构(Schema) | 字段名 | 数据类型 | 字段说明 | 示例值 | |--------|------|-------------|---------| | `ref_area` | `string` | ISO 3166-1 alpha-3 国别代码 | `AGO` | | `ref_area.label` | `string` | 英文国名 | `安哥拉` | | `source` | `string` | ILOSTAT 数据源代码(如劳动力调查) | `BA:13951` | | `source.label` | `string` | 英文数据源名称 | `劳动力调查(LFS)` | | `indicator` | `string` | ILOSTAT 指标代码 | `EAR_EMTA_SEX_CUR_NB` | | `indicator.label` | `string` | 英文指标名称 | `按性别与货币划分的雇员月均收入……` | | `sex` | `string` | 性别拆分维度(SEX_T=总计,SEX_M=男性,SEX_F=女性) | `SEX_T` | | `sex.label` | `string` | — | `总计` | | `classif1` | `string` | 第一分类变量(年龄、教育程度、就业身份等) | `CUR_TYPE_LCU` | | `classif1.label` | `string` | — | `货币:本地货币` | | `time` | `int64` | 观测年份 | `2024` | | `obs_value` | `float64` | 观测指标值(单位因指标而异,请参考指标定义) | `111867.158` | | `obs_status` | `string` | 观测状态标记(如临时数据、不可靠数据) | `B` | | `obs_status.label` | `string` | — | `序列中断` | | `note_classif` | `string` | — | `C5:3047` | | `note_classif.label` | `string` | — | `非标准经济活动:公共部门……` | | `note_indicator` | `string` | — | `T30:2` | | `note_indicator.label` | `string` | — | `货币:安哥拉宽扎(AOA)` | | `note_source` | `string` | — | `R1:3513` | | `note_source.label` | `string` | — | `存储库:国际劳工组织统计数据库-微观数据……` | ## 数据拆分维度 以下字段提供数据拆分维度: - **`sex`**(共3个唯一值):`SEX_T`、`SEX_M`、`SEX_F` ## 数据质量与注意事项 - 本数据集为年度频率数据,部分指标同时发布月度或季度序列,此类数据未包含在本数据集中。 - 当同一国家×年份的同一指标存在多个数据源时,将采用国际劳工组织选定的“最优数据源”。 - 拆分维度字段(`sex`、`classif1`、`classif2`)仅在指标支持对应拆分时才会非空。 ## 使用示例 python from datasets import load_dataset ds = load_dataset("electricsheepafrica/africa-ilo-ear-emta-sex-cur-nb-average-monthly-earnings-of-employees-by-sex-and-c") df = ds["train"].to_pandas() print(df.head()) ### 筛选单个国家 python kenya = df[df["ref_area"] == "KEN"] ### 单个指标的时间序列数据 python sample = (df[df["indicator"] == "EAR_EMTA_SEX_CUR_NB"] .sort_values("time")) sample.plot(x="time", y="obs_value", title="EAR_EMTA_SEX_CUR_NB") ### 转换为国家×年份矩阵 python matrix = (df[df["indicator"] == "EAR_EMTA_SEX_CUR_NB"] .pivot_table(index="time", columns="ref_area", values="obs_value")) print(matrix.tail()) ## 引用格式 bibtex @misc{africa_ilo_ear_emta_sex_cur_nb_average_monthly_earnings_of_employees_by_sex_and_c_2024, title = {Average monthly earnings of employees by sex and currency | Africa (ILOSTAT)}, author = {International Labour Organization (ILO)}, year = {2024}, url = {https://www.ilo.org/shinyapps/bulkexplorer/?id=EAR_EMTA_SEX_CUR_NB}, publisher = {HuggingFace Datasets, 由Electric Sheep Africa重新整理发布}, howpublished = {url{https://huggingface.co/datasets/electricsheepafrica/africa-ilo-ear-emta-sex-cur-nb-average-monthly-earnings-of-employees-by-sex-and-c}} } ## 许可证 本数据集采用 [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) 许可证发布。 原始数据版权归国际劳工组织(ILO)所有。使用本数据集时,请同时引用上述原始数据源与Electric Sheep Africa的重新整理版本。 ## 关于Electric Sheep Electric Sheep Africa 是Electric Sheep使命的一部分:旨在为HuggingFace平台构建统一的、适配机器学习的非洲数据层。我们从权威开放数据源拉取数据,标准化数据结构,封装为Parquet格式,并发布为格式统一的数据集卡片,以便研究人员与开发者仅需通过`load_dataset()`即可在数秒内开始使用数据。 浏览完整数据集集合:[huggingface.co/electricsheepafrica](https://huggingface.co/electricsheepafrica) --- _数据溯源:2026年5月27日通过Electric Sheep流水线摄入。源URL:https://www.ilo.org/shinyapps/bulkexplorer/?id=EAR_EMTA_SEX_CUR_NB_

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-ear-emta-sex-cur-nb-average-monthly-earnings-of-employees-by-sex-and-c 数据集图片
构建方式
该数据集由国际劳工组织(ILO)下属的ILOSTAT数据库经Electric Sheep Africa团队二次加工而成。原始数据通过ILOSTAT REST API直接获取,仅保留非洲ISO3国家代码对应的观测记录,历经数据清洗与格式统一后,以Parquet格式封装并发布至HuggingFace平台。数据涵盖1969年至2024年间45个非洲国家的雇员平均月收入信息,共计2534条观测值,每条记录均包含国家、性别、货币类型、观测值及其状态标志等多维字段,确保用户能够追溯数据来源与质量。
特点
数据集以时间序列表格为核心形态,聚焦单一指标“按性别与货币划分的雇员平均月收入”,并提供性别(总计、男性、女性)这一关键细分维度。覆盖的45个非洲国家在数据丰富度上差异显著,从埃及的348条观测到部分国家仅数十条,反映了非洲各国劳动统计体系的发展不均衡性。数据标注了来源类型与观测状态(如序列中断),为用户评估数据可靠性提供了透明依据。整体而言,该数据集兼具地域广度与时间深度,是研究非洲劳动力市场长期演变的珍贵资源。
使用方法
用户可通过HuggingFace的`datasets`库一行代码加载数据,并借助`to_pandas()`方法快速转换为Pandas DataFrame进行探索。典型应用包括按国家筛选特定时间序列、绘制指标趋势图,或通过透视表构建国家×年份矩阵以进行跨区域比较。由于数据已标准化为统一Schema,开发者无需额外清洗即可直接用于表格分类、回归分析或时间序列预测等机器学习任务。建议用户在使用时关注`obs_status`列,以识别可能存在的序列断裂或临时性数据波动。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2024年通过其ILOSTAT数据库创建,并经Electric Sheep Africa重新打包发布,聚焦非洲大陆45个国家1969至2024年间雇员平均月收入的性别与货币分布情况。ILOSTAT作为全球劳动统计的权威枢纽,整合了各国家庭调查、劳动力调查及行政记录中的微观数据,依据国际劳工统计学家会议(ICLS)标准进行统一归化,使得跨国比较成为可能。核心研究问题在于揭示非洲地区劳动力市场中性别收入差异的长时期演化趋势及结构性特征,为可持续发展目标中体面工作指标的监测提供数据支撑。该数据集因其覆盖时空范围广、标准统一且可复现,已成为研究非洲劳动经济学、性别平等及区域发展问题的重要基础资源。
当前挑战
所解决的领域问题主要在于非洲劳动统计中长期存在的碎片化、不可比与更新滞后等挑战,特别是雇员收入数据常因各国统计口径、货币单位及调查方法迥异而难以进行跨国或跨年代的可靠分析。构建过程中面临的突出困难包括:一、数据来源多样性导致的一致性维护,需通过ILOSTAT的单一最佳来源选择机制过滤同一国家与年份的重复多头数据;二、性别、经济活动和货币分类维度的稀疏性,使得许多细粒度子集样本量极小,增大了建模与推论的偏差风险;三、部分国家的观测值存在序列断裂或可靠性标记,如非标准经济活动范围和临时替代来源等注释旗标,要求使用者具备精细的数据清洗与预警处理能力。
常用场景
经典使用场景
该数据集收录了来自国际劳工组织ILOSTAT数据库的非洲45个国家1969年至2024年间的雇员月均收入数据,按性别和货币维度进行细致划分。其最经典的应用场景在于支持跨国的劳动经济学面板数据分析,研究者可利用时间序列与截面双重视角,构建固定效应或随机效应模型,系统考察非洲各国工资水平的长期演变趋势、性别收入差距的动态变化,以及不同货币体系下实际购买力的差异。
解决学术问题
该数据集为劳动经济学与发展经济学领域的若干核心学术问题提供了实证基石。它有效解决了非洲大陆因数据稀疏而难以开展跨国比较分析的困境,使学者得以量化性别工资差距的时空异质性,评估劳动力市场政策对收入分配的实际影响,并检验经济增长与工资收敛之间的关系。其意义在于填补了非洲地区系统化薪酬数据的空白,为验证和完善发展经济学理论提供了可靠的实证证据。
衍生相关工作
该数据集的衍生工作主要集中在对薪资数据的深度挖掘与交叉融合方面。基于此数据,研究者已构建了非洲国家劳动力市场绩效的综合评价指标体系,并与世界银行的企业调查数据、联合国的人口统计数据相结合,开发出预测区域工资收敛与收入不平等的统计模型。此外,围绕数据中性别维度的标识,催生了一系列针对非洲女性劳动参与率与薪酬公平性的专题研究,推动了性别经济学在非洲语境下的实证拓展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务