遇见数据集

africa-ilo-emp-temp-sex-age-edu-nb-employment-by-sex-age-and-education-thousands

收藏
Hugging Face2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

该数据集是一个关于非洲国家劳动力市场的结构化表格数据集,专门关注就业统计数据。数据集包含187,044条观测记录,覆盖50个非洲国家,时间跨度为1982年至2025年。核心指标为按性别、年龄和教育程度划分的就业人数(千人)(EMP_TEMP_SEX_AGE_EDU_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,这是全球劳动力统计的权威来源,整合了来自国家劳动力调查、家庭收入调查、企业调查和行政记录等多种数据源的信息。数据集采用标准化模式,包含22个字段,主要涵盖:国家代码和名称、数据来源信息、指标代码和名称、人口统计分类维度(性别、年龄、教育程度及其对应标签)、观测年份、观测数值以及数据质量标志。数据集提供了多层次的数据细分,允许按性别(总计、男性、女性)、年龄组和教育程度进行交叉分析。该数据集适用于多种机器学习任务,包括表格分类、表格回归和时间序列预测。研究人员和开发者可利用这些数据研究非洲劳动力市场趋势、分析就业结构变化、构建经济预测模型,或作为更广泛的社会经济分析的数据基础。数据集由Electric Sheep Africa项目重新打包和标准化,旨在为非洲提供统一、易于使用的机器学习就绪数据层。

This dataset is a structured tabular dataset on the labor market in African countries, specifically focusing on employment statistics. It contains 187,044 observations covering 50 African countries from 1982 to 2025. The core indicator is Employment by sex, age and education (thousands) (EMP_TEMP_SEX_AGE_EDU_NB). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, a authoritative global labor statistics source that integrates information from various data sources such as national labor force surveys, household income surveys, enterprise surveys, and administrative records. The dataset follows a standardized schema with 22 fields, including country codes and names, data source information, indicator codes and names, demographic classification dimensions (sex, age, education level and their corresponding labels), observation year, observation value, and data quality flags. It provides multi-level data granularity, allowing for cross-analysis by gender (total, male, female), age group, and education level. The dataset is suitable for various machine learning tasks, including tabular classification, tabular regression, and time series forecasting. Researchers and developers can use this data to study African labor market trends, analyze employment structure changes, build economic forecasting models, or serve as a data foundation for broader socio-economic analysis. The dataset is repackaged and standardized by the Electric Sheep Africa project, aiming to provide a unified, easy-to-use, machine-learning-ready data layer for Africa.

创建时间:
2026-05-25
原始信息汇总

数据集概述

  • 数据集名称: Employment by sex, age and education (thousands) | Africa (ILOSTAT)
  • 观测数量: 187,044 条
  • 地理覆盖: 50 个非洲国家
  • 时间跨度: 1982–2025 年
  • 指标数量: 1 个(EMP_TEMP_SEX_AGE_EDU_NB——按性别、年龄和教育程度划分的就业人数,单位:千人)
  • 许可证: CC-BY-4.0
  • 语言: 英文

数据来源

数据来源于 ILOSTAT(国际劳工组织中央统计数据库),直接从 ILOSTAT REST API 获取,并过滤至非洲 ISO3 国家代码。ILO 负责对原始调查微观数据进行统一处理,来源列(source.label)可追溯具体数据源。

数据模式与字段说明

字段 类型 描述 示例
ref_area string ISO 3166-1 alpha-3 国家代码 AGO
ref_area.label string 国家英文名称 Angola
source string ILOSTAT 来源代码 BA:13951
source.label string 来源英文名称 LFS - Employment Survey
indicator string ILOSTAT 指标代码 EMP_TEMP_SEX_AGE_EDU_NB
indicator.label string 指标英文名称 Employment by sex, age and education …
sex string 按性别细分(SEX_T=总计,SEX_M=男性,SEX_F=女性) SEX_T
sex.label string — Total
classif1 string 第一个分类变量(年龄、教育程度等) AGE_YTHADULT_YGE15
classif1.label string — Age (Youth, adults): 15+
classif2 string 第二个分类变量(如适用) EDU_AGGREGATE_TOTAL
classif2.label string — Education (Aggregate levels): Total
time int64 观测年份 2025
obs_value float64 指标观测值 13984.984
obs_status string 观测状态标记 U
obs_status.label string — Unreliable
note_classif string 分类注释代码 C3:3710
note_classif.label string — Nonstandard education level: Includin…
note_indicator string 指标注释代码 I11:264
note_indicator.label string — Break in series: Methodology revised
note_source string 来源注释代码 R1:3513
note_source.label string — Repository: ILO-STATISTICS - Micro da…

数据细分维度

  • sex(3 个唯一值):SEX_T(总计)、SEX_M(男性)、SEX_F(女性)
  • 另有 classif1 和 classif2 提供年龄、教育程度等维度的细分。

地理覆盖(部分高数据量国家)

国家代码 行数 起始年份 结束年份
ZAF 18,468 2000 2024
MUS 13,392 2001 2024
EGY 10,817 2008 2024
GHA 7,900 1991 2024
MLI 7,342 2009 2024
AGO 6,975 2004 2025
TZA 6,466 2001 2024
ZMB 6,049 2015 2024
RWA 6,029 2014 2025
TUN 6,000 1994 2023
BWA 5,214 2006 2024
SEN 4,993 2011 2024
UGA 4,926 2010 2021
TGO 4,731 2006 2022
ZWE 4,554 2011 2024

其余 35 个国家数据较上述更少。

数据质量与注意事项

  • 数据频率为年度。某些指标也有月度或季度序列,但未包含在此数据集中。
  • 当同一国家×年份有多个来源时,使用 ILO 选择的“最佳来源”。
  • 细分列(sex、classif1、classif2)仅在指标发布相应细分时非空。

引用该数据集

@misc{africa_ilo_emp_temp_sex_age_edu_nb_employment_by_sex_age_and_education_thousands_2025, title = {Employment by sex, age and education (thousands) | Africa (ILOSTAT)}, author = {International Labour Organization (ILO)}, year = {2025}, url = {https://www.ilo.org/shinyapps/bulkexplorer/?id=EMP_TEMP_SEX_AGE_EDU_NB}, publisher = {HuggingFace Datasets, repackaged by Electric Sheep Africa}, howpublished = {url{https://huggingface.co/datasets/electricsheepafrica/africa-ilo-emp-temp-sex-age-edu-nb-employment-by-sex-age-and-education-thousands}} }

许可证

CC-BY-4.0。原始数据 © 国际劳工组织(ILO)。使用时需同时引用原始来源及 Electric Sheep Africa 的重新打包版本。

搜集汇总
数据集介绍
africa-ilo-emp-temp-sex-age-edu-nb-employment-by-sex-age-and-education-thousands 数据集图片
构建方式
本数据集依托国际劳工组织(ILO)的ILOSTAT数据库构建,通过其REST API接口直接拉取指标EMP_TEMP_SEX_AGE_EDU_NB的原始数据,并依据ISO 3166-1 alpha-3国家代码筛选出非洲地区的观测记录。ILOSTAT基于国际劳工统计学家会议(ICLS)定义的标准,对各国劳动力调查、家庭收入调查及行政记录等微观数据进行规范化处理,确保跨国的可比性。数据集保留了source.label等溯源列,以标注数据来源,同时通过调和机制解决同一国家年份存在多源时的冲突,选取ILO认定的最佳来源。最终由Electric Sheep Africa重新打包为Parquet格式,形成包含187,044条观测、覆盖50个非洲国家、时间跨度1982至2025年的标准化表格数据集。
特点
该数据集的核心特点在于其多维度的精细分解结构与广泛的地理与时间覆盖。观测值不仅按性别(总、男、女)进行划分,还融合了年龄与教育程度的分类变量(classif1和classif2),使得每一行都能呈现出特定性别、年龄段和教育水平下的就业人数,极大丰富了分析维度。数据涵盖50个非洲国家,时间跨度长达44年,为国家间比较与长时序趋势分析提供了坚实基础。此外,数据集附带了观测状态标记(如不可靠、临时)、断点说明及来源注释等元数据列,帮助研究者评估数据质量与可用性。每年一次的频率和单一的就业指标,使其在聚焦劳动力核心议题时既紧凑又专注。
使用方法
数据集可通过HuggingFace的datasets库便捷加载,仅需调用load_dataset函数即可获取训练集,并将其转换为Pandas DataFrame进行后续操作。使用者可以根据国家代码(ref_area列)过滤出特定国家的子集,开展国别层面的就业结构分析。时间序列分析是典型应用场景:通过按指标和年份排序观测值,可以绘制单一指标的时序图,或利用pivot_table重塑数据为以年份为行、国家为列的矩阵,便于进行多国横向对比或面板数据建模。数据集还直接支持表格分类、回归与时间序列预测等机器学习任务,配合其丰富的分类列,可用于构建预测模型或探索就业模式的驱动因素。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)通过其ILOSTAT数据库编译,并由Electric Sheep Africa于2025年重新打包发布,聚焦非洲大陆按性别、年龄及教育程度划分的就业数据。作为全球劳动统计的权威来源,ILOSTAT汇集了来自劳动力调查、家庭收入调查等多源数据,并依据国际劳工统计学家会议(ICLS)标准进行统一。该数据集涵盖1982年至2025年间50个非洲国家的187,044条观测记录,核心研究问题在于揭示非洲劳动力市场中不同人口群体的就业结构与动态演变。这一数据集为发展经济学、劳动经济学及非洲区域研究提供了宝贵的微观基础,尤其在追踪可持续就业目标进展、评估性别与教育不平等等领域具有显著影响力。
当前挑战
该数据集所解决的领域挑战在于非洲大陆长期存在的劳动统计碎片化与不完整性,使得政策制定者难以获取跨国家、跨时期的可比就业数据。构建过程中面临的核心挑战包括:多国数据源的异质性导致分类体系(如教育层级、年龄分组)难以对齐,需要通过ILO的协调机制进行标准化;部分国家在特定年份的数据缺失或可靠性不足(如观测状态标注为‘不可靠’),影响了时间序列的连续性与分析稳健性;此外,数据受调查方法论变更、指标定义调整等因素扰动,需通过注释字段追溯系列中断与修订信息,以确保研究结论的准确性。
常用场景
经典使用场景
该数据集核心服务于非洲大陆就业结构的纵向与横向剖析,经典使用场景在于融合时间序列、分类与回归任务展开跨国劳动力市场研究。研究者可借助187,044条覆盖50国、1982至2025年的观测值,按性别、年龄与教育程度等维度对就业人口进行精准分层,构建从宏观趋势到微观群体的实证分析基础。其规范化的ILOSTAT指标与多重分类字段使数据集天然适配就业参与率预测、教育回报评估与劳动力供需失衡建模,成为非洲劳动经济学领域不可或缺的量化素材。
解决学术问题
在学术研究层面,该数据集系统性地填补了非洲大陆长期缺乏标准化、跨国家与跨年代就业细分数据的空白。它解决了因数据稀疏导致的区域比较研究难题,支持学者验证人力资本理论——即教育水平如何差异化影响各年龄段与性别的就业表现,并揭示性别鸿沟的演变轨迹。通过提供统一的观测结构与来源追溯机制,数据集为辨别方法论变更引发的序列断裂、评估数据质量对因果推断的扰动提供了可操作路径,从而推动非洲劳动市场研究从描述性统计迈向严谨的计量分析。
衍生相关工作
该数据集衍生出一系列聚焦非洲劳动市场的经典工作,包括基于1991年至2024年加纳数据构建的就业结构变迁与教育回报率动态测算模型,以及利用南非18,468条高密度观测值开展的性别就业差异分解与代际流动性分析。研究者还以此为基础开发了融合年龄与教育分类的就业预测算法,用于模拟不同教育普及率情景下的非洲大陆长期就业趋势。此外,围绕数据质量注释如序列断裂标记与来源标识,衍生出了关于方法论差异校正与数据融合技术的专项研究,提升交叉数据整合的严谨性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务