遇见数据集

africa-ilo-eap-teap-sex-edu-cbr-nb-labour-force-by-sex-education-and-place-of-birth-t

收藏
Hugging Face2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

本数据集是一个关于非洲地区劳动力状况的表格数据集,由国际劳工组织(ILO)的ILOSTAT数据库提供原始数据,并由Electric Sheep Africa项目重新打包发布。数据集的核心指标为按性别、教育程度和出生地划分的劳动力(千人),旨在提供非洲国家劳动力市场的结构化统计数据。数据集包含5,806个观测值,覆盖34个非洲国家,时间跨度为1991年至2025年。数据以年度频率呈现,每个观测值包含国家代码、国家名称、数据来源、指标代码、指标名称、性别细分、分类变量(如教育程度、出生地)、观测年份、观测值、观测状态标志以及相关的分类和指标注释等详细字段。数据经过ILO的标准化处理,使用国际劳工统计学家会议(ICLS)的定义进行协调,并标注了数据来源以便追溯。数据集适用于表格分类、回归分析、时间序列预测等机器学习任务,可用于研究非洲劳动力市场趋势、移民对劳动力构成的影响、教育与就业关系等社会经济议题。数据发布遵循CC BY 4.0许可协议。

创建时间:
2026-05-25
原始信息汇总

数据集概述

  • 名称: Labour force by sex, education and place of birth (thousands) | Africa (ILOSTAT)
  • 许可证: cc-by-4.0
  • 语言: 英语
  • 任务类型: 表格分类、表格回归、时间序列预测
  • 多语言性: 单语
  • 数据集大小: 1,000 < 样本数 < 10,000
  • 标签: 表格数据、非洲、ILOSTAT、国际移民存量、ILO、劳动力、就业

数据集规模

  • 观测数量: 5,806 条
  • 覆盖国家: 34 个非洲国家
  • 时间跨度: 1991–2025 年
  • 指标数量: 1 个

数据来源

  • 来源: ILOSTAT(国际劳工组织中央统计数据库)
  • 发布者: 国际劳工组织 (ILO)
  • 主题: 国际移民存量
  • 原始链接: ILOSTAT Bulk Explorer

方法论

  • 数据通过 ILOSTAT REST API 拉取,并筛选至非洲 ISO3 国家代码。
  • 使用 ICLS(国际劳工统计学家会议)定义对原始调查微观数据进行协调,数据来源在 source.label 列中标注。

地理覆盖

覆盖 34 个非洲国家,按行数排序的前 10 个国家如下:

国家代码 行数 起始年份 结束年份
GHA 588 1991 2024
AGO 403 2009 2025
ZMB 379 2017 2024
RWA 364 2014 2025
ZWE 307 2014 2024
MWI 289 2005 2024
TZA 277 2008 2024
UGA 266 2010 2021
LBR 248 2010 2017
GMB 221 2012 2025

(另有 19 个国家,未在此表完整列出)

指标

  • EAP_TEAP_SEX_EDU_CBR_NB: 按性别、教育程度和出生地划分的劳动力(单位:千人)

数据模式 (Schema)

列名 类型 描述 示例
ref_area string ISO 3166-1 alpha-3 国家代码 AGO
ref_area.label string 国家英文名称 Angola
source string ILOSTAT 数据源代码 BA:13951
source.label string 数据源英文名称 LFS - Employment Survey
indicator string ILOSTAT 指标代码 EAP_TEAP_SEX_EDU_CBR_NB
indicator.label string 指标英文名称 Labour force by sex, education and pl…
sex string 性别分类(SEX_T=总计,SEX_M=男性,SEX_F=女性) SEX_T
sex.label string 性别标签 Total
classif1 string 第一个分类变量 EDU_AGGREGATE_TOTAL
classif1.label string 分类标签 Education (Aggregate levels): Total
classif2 string 第二个分类变量 CBR_BIR_TOTAL
classif2.label string 分类标签 Place of birth: Total
time int64 观测年份 2025
obs_value float64 观测指标值 15606.68
obs_status string 观测状态标志 U
obs_status.label string 状态标签 Unreliable
note_classif string 分类注释代码 C3:2620
note_classif.label string 分类注释 Nonstandard education level: Includin…
note_indicator string 指标注释代码 I11:264
note_indicator.label string 指标注释 Break in series: Methodology revised
note_source string 数据源注释代码 R1:3513
note_source.label string 数据源注释 Repository: ILO-STATISTICS - Micro da…

分类维度

  • sex: 3 个唯一值:SEX_T(总计)、SEX_M(男性)、SEX_F(女性)

数据质量与注意事项

  • 数据为年度频率,不包括月度或季度序列。
  • 当同一国家×年份存在多个数据源时,使用 ILO 选定的“最佳数据源”。
  • 分类列(sex, classif1, classif2)仅在指标发布该细分时非空。

使用示例

python from datasets import load_dataset

ds = load_dataset("electricsheepafrica/africa-ilo-eap-teap-sex-edu-cbr-nb-labour-force-by-sex-education-and-place-of-birth-t") df = ds["train"].to_pandas() print(df.head())

引用

bibtex @misc{africa_ilo_eap_teap_sex_edu_cbr_nb_labour_force_by_sex_education_and_place_of_birth_t_2025, title = {Labour force by sex, education and place of birth (thousands) | Africa (ILOSTAT)}, author = {International Labour Organization (ILO)}, year = {2025}, url = {https://www.ilo.org/shinyapps/bulkexplorer/?id=EAP_TEAP_SEX_EDU_CBR_NB}, publisher = {HuggingFace Datasets, repackaged by Electric Sheep Africa}, howpublished = {url{https://huggingface.co/datasets/electricsheepafrica/africa-ilo-eap-teap-sex-edu-cbr-nb-labour-force-by-sex-education-and-place-of-birth-t}} }

搜集汇总
数据集介绍
africa-ilo-eap-teap-sex-edu-cbr-nb-labour-force-by-sex-education-and-place-of-birth-t 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API直接拉取指标`EAP_TEAP_SEX_EDU_CBR_NB`的原始数据,并依据非洲ISO3国家代码进行过滤筛选。ILOSTAT基于国际劳工统计学家会议(ICLS)的定义,对各国劳动力调查、家庭收支调查及行政记录等微观数据进行了标准化处理与整合,确保数据在不同来源间的可比较性。数据集由Electric Sheep Africa团队进一步封装,以Parquet格式发布,便于机器学习直接调用。
特点
该数据集覆盖34个非洲国家,时间跨度从1991年至2025年,包含5806条观测记录,聚焦于劳动力按性别、教育程度和出生地划分的统计数据。其核心指标为“劳动力数量(千人)”,并提供了性别、教育水平、出生地等多个维度的分类变量,如性别分为总计、男性和女性,教育水平涵盖不同汇总层级。数据还包含详细的来源标签、观测状态标识与注释信息,便于用户追溯数据质量与元数据细节,体现了较高的结构化与透明性。
使用方法
用户可通过HuggingFace的`datasets`库直接加载数据集,使用`load_dataset()`函数即可获取训练数据,并利用`.to_pandas()`方法将其转换为Pandas DataFrame进行深入分析。基于该数据集,研究者能够执行单国数据筛选、时间序列可视化,以及构建国别-年份矩阵等操作,例如通过`pivot_table`透视特定指标。此外,数据集支持分类、回归及时间序列预测等多种任务类型,适合用于劳动力市场的跨国家比较与趋势建模研究。
背景与挑战
背景概述
劳动市场数据的精细化与跨国可比性,是非洲发展经济学与劳动力迁移研究的基石。该数据集由国际劳工组织(ILO)于2025年通过其ILOSTAT统计数据库发布,并由Electric Sheep Africa重新打包为机器学习友好格式,收录了1991至2025年间覆盖34个非洲国家、共计5806条观测值的劳动力年龄人口数据。核心指标为按性别、教育程度及出生地划分的劳动力数量(千人),旨在揭示非洲大陆劳动力结构的异质性特征及其演变规律。通过提供标准化、可交互的微观数据,该数据集为研究者探索教育回报、性别就业差距及移民融入等关键议题提供了权威的数据基础,对推动区域劳动力市场监测与可持续发展目标评估具有重要影响力。
当前挑战
该数据集旨在突破非洲劳动统计领域长期面临的三大挑战。其一,数据稀疏与时间不连续问题;受限于各国调查周期与能力,观测值在时间与空间上分布极不均衡,例如加纳(588条)与安哥拉(403条)的样本量远超埃及(184条),且许多国家存在明显的年份缺口,严重制约了面板分析的有效性。其二,分类标准异构与可比性困境;尽管ILO遵循国际劳动统计学家会议(ICLS)定义进行协调,但原始来源中教育水平与出生地分类的非标准编码(如备注栏所示的非标准教育层级),仍对跨国产出比较构成显著障碍。其三,数据质量标记的复杂性与不确定性;观测状态(如‘不可靠’)及系列断裂(如方法论修订)的标识要求使用者具备深厚的统计专业知识进行甄别与处理,增加了数据清洗与建模的准入门槛。
常用场景
经典使用场景
该数据集汇聚了非洲34个国家1991年至2025年间劳动力人口按性别、教育程度及出生地划分的精确统计,共计5806条观测记录,为研究非洲大陆劳动力市场结构提供了宝贵的时间序列数据。研究者可借助其多维度分类字段,深入剖析不同教育背景和性别群体在劳动力参与中的动态变化,亦可通过纵向比较揭示区域间劳动力流动与迁移的规律。该数据集尤其适用于构建面板数据模型,以量化教育普及与劳动力供给之间的关系,或评估出生地对个体就业机会的长期影响。
解决学术问题
数据集有效填补了非洲地区高分辨率劳动力统计数据的空白,使得学术界能够系统性地探讨性别差异、教育回报率以及移民身份对劳动力市场的交互作用。通过 disaggregation 维度的精细划分,研究者可以突破以往宏观总量分析的局限,更准确定位特定亚群体(如女性高学历移民)的就业困境。此外,数据集提供的多年连续观测值支持因果推断方法(如双重差分法),为验证教育政策干预或移民法规调整的劳工市场效应提供了实证基础,推动了发展经济学与劳动经济学交叉领域的理论深化。
衍生相关工作
基于该数据集,研究者已衍生出多项经典工作,包括构建非洲劳动力流动的预测模型、评估教育扩展对女性劳动参与率的因果效应,以及分析跨国移民与本地出生人口就业质量的差异。部分工作利用时间序列分解方法,揭示了非洲国家劳动力市场周期性波动与结构性转型的深层特征。此外,该数据集与 ILO 其他统计产品(如工资不平等指标、非正规就业数据)的融合,催生了多维劳动力市场分析框架,为泛非劳动力研究范式提供了方法论参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务