遇见数据集

africa-ilo-eap-teap-sex-edu-cct-nb-labour-force-by-sex-education-and-citizenship-thou

收藏
Hugging Face2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的非洲劳动力统计数据,重点关注“按性别、教育程度和公民身份划分的劳动力(千人)”指标。覆盖42个非洲国家,时间跨度为1991年至2025年,共计6,876个观测值。数据为年度时间序列,核心观测值(obs_value)代表以千为单位的劳动力数量,包含20个字段,详细记录国家代码、数据来源、指标代码、人口统计分类(性别、教育程度、公民身份)、观测年份、观测值、数据状态标志等。数据经过ILO根据国际劳工统计学家会议(ICLS)定义协调,并优先选择每个国家-年份组合的“最佳来源”,由Electric Sheep Africa重新打包为一致的、机器学习就绪的格式。适用于表格分类、回归和时间序列预测等机器学习任务,可用于分析非洲劳动力市场的趋势、差异以及性别、教育程度和公民身份等因素的影响。

This dataset contains African labor force statistics from the International Labour Organization (ILO) ILOSTAT database, focusing on the indicator Labour force by sex, education and citizenship (thousands). It covers 42 African countries from 1991 to 2025, with 6,876 observations. The data is in annual time series format, with the core observation value (obs_value) representing the labor force in thousands. It includes 20 fields detailing country code, data source, indicator code, demographic classifications (such as sex, education, citizenship), observation year, observation value, data status flags, and related classification and indicator notes. The data is harmonized by ILO based on International Conference of Labour Statisticians (ICLS) definitions, prioritizing the best source for each country-year combination, and repackaged by Electric Sheep Africa to provide a consistent, machine-learning-ready format. It is suitable for machine learning tasks like tabular classification, regression, and time series forecasting, and can be used to analyze trends, disparities, and the impact of factors like gender, education, and citizenship on labor force participation in Africa.

创建时间:
2026-05-25
原始信息汇总

数据集概述

数据规模与范围

  • 观测数量: 6,876条
  • 覆盖国家: 42个非洲国家
  • 时间跨度: 1991年至2025年
  • 指标数量: 1个独特指标

数据来源

  • 来源: ILOSTAT(国际劳工组织中央统计数据库)
  • 发布者: 国际劳工组织(ILO)
  • 数据主题: 国际移民存量

方法论

  • 数据直接从ILOSTAT REST API(https://rplumber.ilo.org/data/indicator?id=EAP_TEAP_SEX_EDU_CCT_NB)拉取,并过滤至非洲国家(ISO3国家代码)。
  • ILOSTAT使用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一处理。
  • 数据来源在source.label列中标注,便于追溯。

地理覆盖范围

覆盖42个非洲国家,按观测数量排序的前15个国家如下:

国家代码 观测数量 起始年份 结束年份
GHA 558 1991 2024
SYC 507 2014 2024
RWA 442 2014 2025
MLI 441 2013 2024
NAM 374 1994 2018
BWA 349 2006 2024
SEN 328 2011 2024
ZWE 306 2014 2024
CIV 305 2012 2022
TZA 265 2001 2024
ZMB 261 2017 2024
GMB 220 2012 2025
BFA 170 2018 2023
BDI 146 2006 2020
COD 146 2005 2020

其余27个国家未在表格中列出。

核心指标

  • 指标代码: EAP_TEAP_SEX_EDU_CCT_NB
  • 指标名称: 按性别、教育和公民身份划分的劳动力(单位:千人)

数据模式(Schema)

列名 类型 描述 示例
ref_area string ISO 3166-1 alpha-3国家代码 AGO
ref_area.label string 国家英文名称 Angola
source string ILOSTAT来源代码(如劳动力调查) BB:16199
source.label string 来源英文名称 HIES - Survey on Expenditure, Revenue…
indicator string ILOSTAT指标代码 EAP_TEAP_SEX_EDU_CCT_NB
indicator.label string 指标英文名称 Labour force by sex, education and ci…
sex string 按性别分类(SEX_T=总计, SEX_M=男性, SEX_F=女性) SEX_T
sex.label string 性别标签 Total
classif1 string 第一个分类变量(年龄、教育、地位等) EDU_AGGREGATE_TOTAL
classif1.label string 第一个分类标签 Education (Aggregate levels): Total
classif2 string 第二个分类变量(如适用) CCT_CIT_TOTAL
classif2.label string 第二个分类标签 Citizenship: Total
time int64 观测年份 2019
obs_value float64 观测指标值(单位见指标定义) 11038.374
obs_status string 观测状态标志(如临时、不可靠) U
obs_status.label string 观测状态标签 Unreliable
note_classif string 分类注释 C3:2620
note_classif.label string 分类注释标签 Nonstandard education level: Includin…
note_indicator string 指标注释 I11:264
note_indicator.label string 指标注释标签 Break in series: Methodology revised
note_source string 来源注释 R1:3513
note_source.label string 来源注释标签 Repository: ILO-STATISTICS - Micro da…

分类维度

  • sex(3个唯一值): SEX_T(总计)、SEX_M(男性)、SEX_F(女性)

数据质量与注意事项

  • 数据为年度频率,不包括月度或季度序列。
  • 对于同一国家×年份存在多个来源的情况,使用ILO选择的“最佳来源”。
  • 分类列(sex、classif1、classif2)仅在指标发布该细分时非空。

引用格式

bibtex @misc{africa_ilo_eap_teap_sex_edu_cct_nb_labour_force_by_sex_education_and_citizenship_thou_2025, title = {Labour force by sex, education and citizenship (thousands) | Africa (ILOSTAT)}, author = {International Labour Organization (ILO)}, year = {2025}, url = {https://www.ilo.org/shinyapps/bulkexplorer/?id=EAP_TEAP_SEX_EDU_CCT_NB}, publisher = {HuggingFace Datasets, repackaged by Electric Sheep Africa}, howpublished = {url{https://huggingface.co/datasets/electricsheepafrica/africa-ilo-eap-teap-sex-edu-cct-nb-labour-force-by-sex-education-and-citizenship-thou}} }

许可证

  • 许可证: CC-BY-4.0
  • 原始数据 © 国际劳工组织(ILO)。使用时需同时引用原始来源和Electric Sheep Africa的包装版本。
搜集汇总
数据集介绍
africa-ilo-eap-teap-sex-edu-cct-nb-labour-force-by-sex-education-and-citizenship-thou 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,经由Electric Sheep Africa团队二次封装后发布于HuggingFace平台。构建过程中,数据通过ILOSTAT提供的REST API接口直接拉取,选取了标识符为EAP_TEAP_SEX_EDU_CCT_NB的指标,并依据非洲国家ISO 3166-1 alpha-3编码进行地理过滤与筛选。ILOSTAT本身对原始调查微观数据采用国际劳工统计学家会议(ICLS)定义进行统一协调与标准化,确保了不同来源数据的可比性。最终形成的数据集以Parquet格式存储,支持高效的加载与检索,共计包含6,876条观察记录,覆盖42个非洲国家,时间跨度从1991年至2025年。
特点
该数据集的核心特点在于其丰富的维度层次与严谨的数据质量控制。除了提供劳动力规模的总体数值外,数据还按照性别(男性、女性、总计)、教育程度(不同层级汇总)、以及公民身份状态进行细致分类,为深入分析非洲劳动力市场结构提供了多维视角。每个观察值均附带详尽的元数据标记,包括数据来源标签、观测状态标志(如临时数据或不可靠数据)以及各类注释信息,便于用户评估数据质量。此外,数据集采用年度频率发布,且优先选用ILO为每个国家-年份组合选定的“最佳来源”,在保证数据覆盖率的同时注重了来源的权威性与可靠性。
使用方法
使用该数据集极为便捷,用户可通过HuggingFace的datasets库直接加载,仅需一行代码即可获取完整的训练数据。加载后的数据可无缝转换为Pandas DataFrame格式,便于开展后续分析。针对专注特定国家的需求,用户可以通过过滤ref_area列轻松筛选出肯尼亚等目标国家的子集。对于时间序列分析,可按照indicator列进行筛选并对time列排序,从而绘制某一指标随时间变化的趋势图。此外,利用pivot_table函数,用户可将数据重塑为国家×年份的矩阵形式,适用于面板数据分析或比较不同国家在同一时间段的劳动市场表现。数据集遵循CC-BY-4.0许可协议,使用时需注明数据来源。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,并由Electric Sheep Africa于2025年重新整理发布,聚焦于非洲地区按性别、教育程度与公民身份分类的劳动力数据(单位:千人)。作为ILOSTAT数据库的核心组成部分,该数据集覆盖42个非洲国家、1991至2025年间的6,876条观测记录,旨在为研究非洲劳动力市场结构、教育与就业关联性以及移民劳动力影响提供标准化的微观数据基础。其影响力体现在填补了非洲大陆在劳动力统计方面长期存在的细粒度数据空白,为可持续发展目标(SDG)中体面工作指标的监测提供了关键支撑,尤其适用于跨国比较与时间序列分析。
当前挑战
该数据集所解决的领域问题包括:非洲劳动力市场因数据稀疏性导致的性别、教育与公民身份交叉维度的分析困难,以及ILO成员国间因调查方法、定义标准(如ICLS标准)不一致引发的比较障碍。构建过程中面临的挑战在于:整合来自42国多样化的劳动力调查、家庭收支调查及行政记录,确保跨来源数据在时序上的连贯性与统计口径的可比性;处理因方法论修订或数据源变更引发的序列断裂(如注释中标注的'Break in series');以及标记观测值的不确定性(如'Unreliable'状态标志),以便使用者合理评估数据质量并规避在建模中引入偏误。
常用场景
经典使用场景
该数据集的核心价值在于为非洲劳动力市场的时空分析提供了标准化的面板数据基础。研究者可将其作为时间序列预测模型的训练语料,利用1991至2025年间覆盖42个非洲国家的劳动力参与率观测值,构建诸如LSTM或Prophet等预测框架,以估测特定性别、教育背景及国籍群体的劳动力供给趋势。同时,该数据集也是分类与回归任务的理想基准,通过性别、教育层次与公民身份等维度对劳动参与模式进行解构,为劳动经济学中结构性特征的量化分析提供了可复现的数据基础。
衍生相关工作
基于此数据集,学术界已衍生出若干具有影响力的研究范式。一方面,该数据被广泛用于构建非洲劳动力市场的宏观计量模型,例如通过面板向量自回归(PVAR)框架检验教育扩张与失业率之间的动态关联。另一方面,该数据的多维度分类结构催生了针对劳动参与差异的分解分析,学者们运用Oaxaca-Blinder分解方法量化性别与公民身份在就业机会获取中的贡献度。此外,一些研究利用该数据集提供的分年度观测值,训练机器学习模型以预测非洲各国劳动力供给的长期演变轨迹,为结构转型与劳动力市场韧性的理论建模提供了实证校验的基准样本。
数据集最近研究
最新研究方向
当前,该数据集在非洲劳动经济学与人口迁移研究的交叉领域展现出蓬勃生机,尤其聚焦于性别、教育水平与公民身份三重维度对劳动力市场参与率的差异化影响。围绕国际劳工组织(ILO)的ILOSTAT统计框架,研究者利用1991至2025年间覆盖42个非洲国家的6876条观测记录,深入剖析人口流动与劳动供给的结构性变迁。前沿方向包括:基于时间序列模型预测后疫情时代非洲各国失业率与就业质量的演变轨迹;结合教育与性别分类数据,评估撒哈拉以南非洲地区青年劳动力在非正规经济中的吸纳能力;以及借助公民身份变量,量化跨国移民对东非和西非国家本地劳动力市场的替代或互补效应。该数据集为验证联合国可持续发展目标(SDG)第八项“体面工作和经济增长”在非洲的实现进程提供了稀缺的实证基础,尤其在加纳、卢旺达和塞内加尔等数据密集型国家,其细粒度分类为政策模拟与反事实分析创造了可能,推动了区域劳工统计从描述性报告向因果推断范式的跃迁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务