遇见数据集

africa-ilo-eap-teap-sex-age-edu-nb-labour-force-by-sex-age-and-education-thousands

收藏
Hugging Face2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

该数据集包含非洲50个国家从1982年至2025年的劳动力统计数据,共计192,496个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,该数据库是全球劳动力统计的主要来源,整合了来自各国劳动力调查、家庭收入调查、企业调查和行政记录的数据。数据集的核心指标为“按性别、年龄和教育程度划分的劳动力(千人)”(EAP_TEAP_SEX_AGE_EDU_NB)。数据结构包含22个字段,详细记录了国家代码(ISO 3166-1 alpha-3)、国家名称、数据来源、指标代码、指标名称、性别分类(总计、男性、女性)、年龄/教育分类、观测年份、观测值(单位为千人)以及数据状态标志(如临时数据、不可靠数据)和各类注释。数据集适用于表格分类、表格回归和时间序列预测等任务,可用于分析非洲各国劳动力市场的趋势、性别差异、教育水平分布等。数据以年度频率发布,ILOSTAT使用国际劳工统计学家会议(ICLS)的定义对原始调查微观数据进行标准化处理,确保跨国家和时间的数据可比性。

This dataset comprises labor statistics for 50 African countries spanning 1982 to 2025, with a total of 192,496 observations. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), the world's leading repository for labor statistics, which integrates data from national labor force surveys, household income surveys, enterprise surveys and administrative records. The core indicator of the dataset is "Labor Force by Sex, Age and Education Level (Thousand Persons)" (EAP_TEAP_SEX_AGE_EDU_NB). The dataset consists of 22 fields, including detailed records of country code (ISO 3166-1 alpha-3), country name, data source, indicator code, indicator name, sex classification (total, male, female), age/education classification, observation year, observed value (unit: thousand persons), data status flags (e.g., provisional data, unreliable data) and miscellaneous annotations. This dataset is applicable to tasks including table classification, table regression and time series forecasting, and can be utilized to analyze labor market trends, gender disparities, educational distribution patterns and other relevant topics across African countries. The data is released on an annual basis. ILOSTAT standardizes raw survey microdata using definitions established by the International Conference of Labour Statisticians (ICLS), ensuring cross-national and cross-temporal data comparability.

创建时间:
2026-05-25
原始信息汇总

数据集概述:Labour force by sex, age and education (thousands) | Africa (ILOSTAT)

基本信息

  • 数据集名称:Labour force by sex, age and education (thousands) | Africa (ILOSTAT)
  • 发布方:International Labour Organization (ILO),经 Electric Sheep Africa 重新打包
  • 许可协议:CC-BY-4.0
  • 语言:英语
  • 任务类别:表格分类、表格回归、时间序列预测
  • 数据集规模:192,496 条观测数据
  • 地理覆盖:50 个非洲国家
  • 时间范围:1982–2025 年
  • 指标数量:1 个不同指标

数据来源

  • 来源:ILOSTAT(国际劳工组织中央统计数据库)
  • 原始数据接口:通过 ILOSTAT REST API 获取,并过滤至非洲 ISO3 国家代码
  • 数据加工:ILOSTAT 依据 ICLS(国际劳动统计学家会议)定义对原始调查微观数据进行统一处理,数据来源在 source.label 列中标记,以便追溯

数据内容

该数据集包含“按性别、年龄和教育程度划分的劳动力(千人)”一项指标,指标代码为 EAP_TEAP_SEX_AGE_EDU_NB,观测值为劳动力数量(单位:千人)。

数据模式(Schema)

列名 类型 描述 示例
ref_area string 国家 ISO 3166-1 alpha-3 代码 AGO
ref_area.label string 英文国家名称 Angola
source string ILOSTAT 数据来源代码 BA:13951
source.label string 英文来源名称 LFS - Employment Survey
indicator string ILOSTAT 指标代码 EAP_TEAP_SEX_AGE_EDU_NB
indicator.label string 英文指标名称 Labour force by sex, age and educatio…
sex string 按性别拆分(SEX_T=总计,SEX_M=男性,SEX_F=女性) SEX_T
sex.label string 性别标签 Total
classif1 string 第一个分类变量(年龄、教育等) AGE_YTHADULT_YGE15
classif1.label string 分类变量1标签 Age (Youth, adults): 15+
classif2 string 第二个分类变量(如适用) EDU_AGGREGATE_TOTAL
classif2.label string 分类变量2标签 Education (Aggregate levels): Total
time int64 观测年份 2025
obs_value float64 观测指标值 15606.68
obs_status string 观测状态标志(如临时、不可靠) U
obs_status.label string 状态标签 Unreliable
note_classif string 分类注释代码 C3:3710
note_classif.label string 分类注释 Nonstandard education level: Includin…
note_indicator string 指标注释代码 I11:264
note_indicator.label string 指标注释 Break in series: Methodology revised
note_source string 来源注释代码 R1:3513
note_source.label string 来源注释 Repository: ILO-STATISTICS - Micro da…

拆分维度

  • sex:3 个唯一值(SEX_T、SEX_M、SEX_F),分别代表总计、男性和女性

数据质量与注意事项

  • 数据为年度频率,不包含月度和季度序列
  • 当同一国家×年份存在多个数据来源时,使用 ILO 选择的“最佳来源”
  • 拆分列(sex、classif1、classif2)仅在指标发布对应拆分数据时非空

使用方法示例

python from datasets import load_dataset

ds = load_dataset("electricsheepafrica/africa-ilo-eap-teap-sex-age-edu-nb-labour-force-by-sex-age-and-education-thousands") df = ds["train"].to_pandas()

筛选至单个国家

kenya = df[df["ref_area"] == "KEN"]

按指标筛选并排序时间序列

sample = (df[df["indicator"] == "EAP_TEAP_SEX_AGE_EDU_NB"] .sort_values("time")) sample.plot(x="time", y="obs_value", title="EAP_TEAP_SEX_AGE_EDU_NB")

透视为国家×年份矩阵

matrix = (df[df["indicator"] == "EAP_TEAP_SEX_AGE_EDU_NB"] .pivot_table(index="time", columns="ref_area", values="obs_value"))

引用格式

bibtex @misc{africa_ilo_eap_teap_sex_age_edu_nb_labour_force_by_sex_age_and_education_thousands_2025, title = {Labour force by sex, age and education (thousands) | Africa (ILOSTAT)}, author = {International Labour Organization (ILO)}, year = {2025}, url = {https://www.ilo.org/shinyapps/bulkexplorer/?id=EAP_TEAP_SEX_AGE_EDU_NB}, publisher = {HuggingFace Datasets, repackaged by Electric Sheep Africa}, howpublished = {url{https://huggingface.co/datasets/electricsheepafrica/africa-ilo-eap-teap-sex-age-edu-nb-labour-force-by-sex-age-and-education-thousands}} }

搜集汇总
数据集介绍
africa-ilo-eap-teap-sex-age-edu-nb-labour-force-by-sex-age-and-education-thousands 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的核心统计数据库ILOSTAT,经由Electric Sheep Africa团队重新整理和打包。构建过程首先通过ILOSTAT的REST API接口(https://rplumber.ilo.org/data/indicator?id=EAP_TEAP_SEX_AGE_EDU_NB)直接拉取原始数据,随后依据非洲地区的ISO3国家代码进行严格过滤,最终整合为一份聚焦非洲大陆的劳动力统计数据集。ILOSTAT本身采用了国际劳工统计学家会议(ICLS)的定义标准对各国劳动力调查微观数据进行统一协调,并在数据集中通过`source.label`字段标注了每一条数据的具体来源,确保了数据的可追溯性和规范性。
特点
该数据集囊括了192,496条观测记录,覆盖了50个非洲国家,时间跨度从1982年至2025年,展现了丰富的地理与时间维度。其核心指标为“按性别、年龄和教育程度划分的劳动力(千人)”(EAP_TEAP_SEX_AGE_EDU_NB),并提供了详尽的分类维度,包括性别(总、男、女)、年龄分组以及教育程度聚合级别。数据还附带了丰富的元数据字段,如观测状态标志(例如“不可靠”)、来源注解及序列中断等备注信息,便于用户进行数据质量评估与审慎使用。
使用方法
使用者可通过HuggingFace的`datasets`库轻松加载该数据集,仅需一行代码`load_dataset()`即可获取,并便捷地转换为Pandas DataFrame进行后续分析。针对国家级别的分析,可依据`ref_area`字段筛选特定国家,例如`df[df["ref_area"] == "KEN"]`获取肯尼亚数据。对于时间序列分析,可对指标`EAP_TEAP_SEX_AGE_EDU_NB`按年份排序后绘制变化趋势。此外,通过数据透视功能,可以将数据重塑为以年份为行、国家为列的矩阵格式,便于进行跨国的面板数据分析与比较。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计数据库ILOSTAT于2025年整理发布,并经Electric Sheep Africa重新封装至HuggingFace平台,专注于非洲50个国家的劳动力数据,涵盖1982年至2025年间共计192,496条观测值。其核心研究问题在于通过性别、年龄和教育水平三个维度揭示非洲大陆劳动力市场的结构性特征,为劳动力经济学、发展经济学及国际比较研究提供基础数据支撑。作为ILO权威统计体系的重要组成部分,该数据集依托全球200余经济体的劳动力调查与行政记录,经标准化处理后生成,对理解非洲劳动力供给的动态演变、评估教育与就业的关联性以及推动可持续发展目标(SDG)中体面工作的量化分析具有重要影响力,尤其为区域政策制定者和跨学科研究者提供了高分辨率的时间序列数据源。
当前挑战
该数据集面临的挑战首先在于领域问题的复杂性:非洲劳动力市场长期受制于非正规经济占比高、数据采集频率低且统计口径不一等问题,导致传统的失业率或劳动参与率指标难以真实反映实际就业状况,而本数据集通过精细的人口统计分组(如性别、年龄和教育水平)提供了更细致的刻画,但也暴露出多源数据整合中的一致性与可比性难题。构建过程中的挑战包括:ILOSTAT需从各国零散的劳动力调查、家计调查和行政记录中提取并协调数据,使用ICLS定义进行标准化,但不同来源的标识(如source.label)仍存在方法修订(如'Break in series')和不可靠观测值(如obs_status为'U')等质量标记,且部分国家(如前35国以外)的覆盖年份与样本量差异显著,给跨区域、跨时间的纵向比较带来不确定性,同时对年代久远或冲突地区的数据回溯亦受限于原始收集能力。
常用场景
经典使用场景
该数据集汇聚了国际劳工组织ILOSTAT数据库中关于非洲50个国家1982至2025年间劳动力规模的精细划分数据,涵盖性别、年龄和教育程度三个核心维度。研究者可通过时间序列分析、面板数据回归或分类预测等范式,深入探索非洲大陆劳动力结构的演变规律及其与经济社会发展之间的内在关联。基于其丰富的分层属性,该数据集尤为适合用于构建劳动力参与率预测模型、性别平等指标评估以及教育对劳动力市场影响的实证研究,为区域发展政策制定提供坚实的数据支撑。
衍生相关工作
围绕该数据集,研究者已衍生出一系列具有代表性的经典工作。在劳动力供给建模方面,结合面板计量方法,有学者利用该数据探讨了撒哈拉以南非洲女性劳动参与率的时间趋势与结构性决定因素。在人力资本与经济增长研究中,该数据被用作关键输入变量,构建了教育回报率与劳动力结构转型的跨国回归模型。此外,数据可视化领域亦涌现了交互式劳动力展示平台,使得政策制定者能够直观比较不同国家、不同性别与教育背景下劳动力的动态变迁。这些衍生工作进一步拓展了数据集的学术与应用价值。
数据集最近研究
最新研究方向
该数据集聚焦于非洲50个国家1982至2025年间按性别、年龄与教育程度分层统计的劳动力规模(单位:千人),为区域劳动力结构与人力资本变迁研究提供了高粒度时序数据基础。当前前沿研究正围绕非洲各国在后疫情时代的劳动力恢复路径、教育回报率差异以及青年与女性就业参与率的结构性演变展开,数据集精准支持这些议题的跨时段、跨国别比较分析。尤其是结合国际劳工组织(ILO)协调一致的调查口径,该数据在评估非洲大陆自由贸易区(AfCFTA)推进对劳动力流动影响、追踪可持续发展目标(SDG)第八项体面工作指标进展方面具有关键价值。其细至年份、性别与教育组合的观测记录,使研究者得以量化教育扩张如何重塑劳动力供给弹性,并揭示非洲各国在正规与非正规就业转型上的差异化步伐。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务