遇见数据集

africa-ilo-eap-teap-sex-dsb-nb-labour-force-by-sex-and-disability-status-thousand

收藏
Hugging Face2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

本数据集名为“按性别和残疾状况划分的劳动力(千人)| 非洲(ILOSTAT)”,是一个专注于非洲地区劳动力市场的结构化表格数据集。数据来源于国际劳工组织(ILO)的权威统计数据库ILOSTAT,由Electric Sheep Africa重新打包并发布在HuggingFace平台上。数据集的核心内容是衡量非洲各国劳动力规模的指标“EAP_TEAP_SEX_DSB_NB”(按性别和残疾状况划分的劳动力,单位:千人)。数据集规模为1,121个观测值,覆盖41个非洲国家,时间跨度为1998年至2025年。数据模式(Schema)包含19个字段,核心字段包括:国家代码(ref_area)、国家名称(ref_area.label)、数据来源代码与标签(source, source.label)、指标代码与标签(indicator, indicator.label)、性别分类(sex, sex.label)、主要分类变量(classif1, classif1.label)、观测年份(time)、观测值(obs_value)、观测状态标志(obs_status, obs_status.label)以及相关的注释字段。数据按性别(总计、男性、女性)进行细分。数据集为年度频率,ILO在存在多个来源时采用其选定的“最佳来源”。该数据集适用于多种机器学习任务,包括表格分类、回归分析以及劳动力市场相关的时间序列预测,为研究非洲就业趋势、性别平等和残疾人劳动力参与等议题提供了标准化的数据基础。数据集采用CC-BY-4.0许可证。

创建时间:
2026-05-25
原始信息汇总

数据集概述

  • 数据集名称:劳动力按性别和残疾状况统计(千人)| 非洲(ILOSTAT)
  • 数据集大小:1,121 条观测值
  • 地理覆盖:41 个非洲国家
    • 覆盖国家包括卢旺达、加纳、赞比亚、塞内加尔、博茨瓦纳、津巴布韦、科特迪瓦、坦桑尼亚、多哥、塞舌尔、乌干达、布基纳法索、冈比亚、尼日利亚、贝宁等。
  • 时间范围:1998 年至 2025 年
  • 数据指标:1 个独特指标
    • EAP_TEAP_SEX_DSB_NB — 劳动力按性别和残疾状况统计(千人)
  • 许可协议:CC-BY-4.0

数据来源

  • 原始来源:ILOSTAT(国际劳工组织劳动统计数据库)
  • 出版商:国际劳工组织(ILO)
  • 数据获取方式:通过 ILOSTAT REST API 直接拉取,并过滤至非洲 ISO3 国家代码
  • 数据整合方法:ILO 使用 ICLS(国际劳动统计学家会议)定义对原始调查微观数据进行统一处理

数据结构

列名 类型 描述 示例
ref_area string ISO 3166-1 alpha-3 国家代码 AGO
ref_area.label string 英文国家名称 Angola
source string ILOSTAT 来源代码(如劳动力调查) AA:835
source.label string 来源英文名称 PC - Population Census
indicator string ILOSTAT 指标代码 EAP_TEAP_SEX_DSB_NB
indicator.label string 指标英文名称 Labour force by sex and disability st…
sex string 性别分类(SEX_T=总计,SEX_M=男性,SEX_F=女性) SEX_T
sex.label string 性别标签 Total
classif1 string 第一分类变量(年龄、教育、就业状况等) DSB_STATUS_TOTAL
classif1.label string 分类标签 Disability status: Total
time int64 观测年份 2014
obs_value float64 观测指标值(单位取决于指标定义) 5852.957
obs_status string 观测状态标记(如临时、不可靠) B
obs_status.label string 状态标签 Break in series
note_classif float64 分类注释代码
note_classif.label float64 分类注释标签
note_indicator string 指标注释代码 I11:264
note_indicator.label string 指标注释标签 Break in series: Methodology revised
note_source string 来源注释代码 R1:3513
note_source.label string 来源注释标签 Repository: ILO-STATISTICS - Micro da…

分组维度

  • sex:包含 3 个唯一值
    • SEX_T(总计)
    • SEX_M(男性)
    • SEX_F(女性)

数据质量与注意事项

  • 数据为年度频率,不包含月度或季度序列
  • 同一国家×年份存在多个来源时,使用 ILO 选择的“最佳来源”
  • 分组维度列(sexclassif1classif2)仅在指标发布该分组时非空

使用示例

python from datasets import load_dataset

ds = load_dataset("electricsheepafrica/africa-ilo-eap-teap-sex-dsb-nb-labour-force-by-sex-and-disability-status-thousand") df = ds["train"].to_pandas()

  • 按国家筛选: python kenya = df[df["ref_area"] == "KEN"]

  • 单个指标的时间序列: python sample = (df[df["indicator"] == "EAP_TEAP_SEX_DSB_NB"] .sort_values("time"))

  • 透视为国家×年份矩阵: python matrix = (df[df["indicator"] == "EAP_TEAP_SEX_DSB_NB"] .pivot_table(index="time", columns="ref_area", values="obs_value"))

引用信息

bibtex @misc{africa_ilo_eap_teap_sex_dsb_nb_labour_force_by_sex_and_disability_status_thousand_2025, title = {Labour force by sex and disability status (thousands) | Africa (ILOSTAT)}, author = {International Labour Organization (ILO)}, year = {2025}, url = {https://www.ilo.org/shinyapps/bulkexplorer/?id=EAP_TEAP_SEX_DSB_NB}, publisher = {HuggingFace Datasets, repackaged by Electric Sheep Africa}, howpublished = {url{https://huggingface.co/datasets/electricsheepafrica/africa-ilo-eap-teap-sex-dsb-nb-labour-force-by-sex-and-disability-status-thousand}} }

搜集汇总
数据集介绍
africa-ilo-eap-teap-sex-dsb-nb-labour-force-by-sex-and-disability-status-thousand 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,经由Electric Sheep Africa团队重新封装后发布。构建过程首先通过ILOSTAT提供的REST API,以指标代码EAP_TEAP_SEX_DSB_NB为查询参数,直接抽取原始数据。随后,利用非洲ISO 3166-1 alpha-3国家代码进行地理筛选,仅保留覆盖41个非洲国家的观测记录。ILO的统计部门依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查及行政记录等原始微观数据进行协调统一,并在source.label列中标注数据来源以确保可追溯性。最终形成包含1121条观测值、时间跨度为1998年至2025年的结构化表格数据集。
特点
该数据集的核心特色在于其聚焦非洲大陆劳动力市场中的残疾人口维度,提供了按性别与残疾状况细分的劳动力数量估计(单位:千人)。数据涵盖了41个非洲国家,时间序列长达28年,展现出丰富的地理与时间覆盖度。数据集包含sex(性别:总计、男性、女性)和classif1(残疾状况:总计)等关键分类变量,便于进行分组分析。此外,每条观测均附有数据质量标识(如obs_status字段)和来源注释,有助于用户评估数据可靠性与方法变动。作为一个经过ILO统一标准协调的二次数据集,它在保持原始统计权威性的同时,极大地降低了跨国产出对比的复杂度。
使用方法
用户可通过HuggingFace的datasets库便捷加载该数据集,仅需一行代码`load_dataset`即可将数据转化为Pandas DataFrame格式进行探索。典型的使用路径包括:按国家代码筛选特定国家的劳动力时间序列数据;针对单一指标进行时间趋势分析,如绘制劳动力人数随年份变化的折线图;以及利用透视表功能构建以年份为行、国家为列的矩阵,便于开展跨国比较研究。数据集采用CC-BY-4.0许可协议,在使用时需同时引用ILO原始数据源及Electric Sheep Africa的重新封装版本,目前数据已整理为Parquet格式,可在数秒内完成加载并即刻投入统计分析或机器学习建模任务。
背景与挑战
背景概述
在劳动经济学与发展研究的交汇处,残疾人就业参与是衡量社会包容性与可持续发展目标(SDG Decent Work)进展的关键维度。非洲大陆作为全球劳动市场转型最剧烈的地区之一,其残疾人劳动参与数据长期处于碎片化与不可比的状态。为弥合这一鸿沟,国际劳工组织(ILO)依托其核心统计数据库ILOSTAT,通过整合各国劳动力调查与人口普查的微观数据,构建了覆盖1998至2025年间41个非洲国家的劳动力数据集。该数据集由Electric Sheep Africa于2025年重新封装并发布于HuggingFace平台,聚焦于性别与残疾状况维度下的劳动力规模(单位:千人),为研究者提供了首个高质量、时序化、可跨域比较的非洲残疾人劳动参与基线数据,极大地推动了对该区域不平等结构与发展政策效果的实证分析。
当前挑战
该数据集所应对的核心领域挑战在于,全球特别是非洲地区关于残疾人劳动状况的系统性统计极其匮乏,传统数据源多忽略残疾分层的细化指标,致使各国政府与国际组织难以精准评估包容性就业政策的实施效果。跨国的数据可比性亦因调查定义、问卷设计及抽样方法的差异而严重受限。在构建过程中,首要挑战源于ILO所需协调的海量异构源头——包括各国劳动力调查、人口普查及行政记录——这些资料在分类体系(如ICLS定义)与数据质量上参差不齐。其次,时间序列中存在的断点(Break in series)与标识状态的不可靠性(如'B'级状态标记),反映出方法论变更与数据衔接的复杂性。最后,对非洲国家而言,统计基础设施薄弱与数据收集周期不连贯,亦给生成连续而一致的年度面板数据带来了显著困难。
常用场景
经典使用场景
该数据集汇聚了国际劳工组织ILOSTAT数据库中非洲41个国家1998至2025年间按性别与残疾状况划分的劳动力人口数据(单位:千人),共计1121条观测记录。研究者常将其用于构建面板数据模型,分析非洲区域劳动力市场在时间维度上的演变趋势,或结合性别与残疾状态两个细分维度,探讨不同群体在劳动参与率上的异质性。数据经Electric Sheep Africa重新打包为Parquet格式,可通过HuggingFace Datasets库直接加载,极大降低了数据清洗与格式统一的预处理成本,便于快速开展统计建模与时序分析。
衍生相关工作
基于该数据集,研究者已衍生出一系列具有代表性的学术工作。在面板计量领域,学者们利用其构建了固定效应模型与随机效应模型,揭示非洲国家残疾人劳动参与率与经济增长、社会保障支出的动态关联。在时空分析方面,有人将数据与地理空间数据融合,绘制了非洲残疾劳动力分布的热力图,识别出劳动力市场脆弱性聚集区域。此外,若干机器学习的预测工作也以此为训练集,开发了面向非洲国家的劳动力供给预测模型,为劳动力规划的提前预判提供了工具。这些衍生工作共同推动了非洲劳动统计学从描述性分析向预测性与因果推断方向迈进。
数据集最近研究
最新研究方向
该数据集聚焦于非洲地区劳动力市场中的性别与残障交叉分析,为探究包容性就业政策提供了关键数据支撑。结合国际劳工组织近年推动的体面劳动议程及《残疾人权利公约》实施评估,研究者可借此追踪1998至2025年间41个非洲国家按性别与残障状况划分的劳动力参与演变趋势。其价值在于填补了非洲区域残障群体就业信息的高频空缺,尤其为评估可持续发展目标(SDG)第8项体面工作与第10项减少不平等成效提供了可量化的基准。当前的前沿方向包括利用该时序数据构建预测模型以识别残障群体就业脆弱性热点,以及结合劳动力调查元数据剖析制度性障碍对就业弹性的影响,从而助力设计更具韧性的社会保障干预措施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务