遇见数据集

africa-ilo-emp-temp-sex-age-ins-nb-employment-by-sex-age-and-public-private-sector-th

收藏
Hugging Face2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

本数据集是国际劳工组织(ILO)ILOSTAT数据库中关于非洲就业数据的重新打包版本,由Electric Sheep Africa整理并发布。核心指标为按性别、年龄和公共/私营部门划分的就业人数(千),专门针对非洲地区。数据包含41,309条观测记录,覆盖48个非洲国家,时间跨度为1991年至2025年。数据来源于ILO整合的各国劳动力调查、家庭收入调查、企业调查和行政记录等,并依据国际劳工统计学家会议(ICLS)的定义进行了标准化处理。数据集采用表格形式,包含18个字段,详细记录了国家代码与名称、数据来源、指标代码与标签、按性别(总计、男性、女性)和年龄组的分解信息、公共/私营部门分类、观测年份、以千为单位的就业人数观测值,以及标识数据可靠性(如临时、不可靠)的状态标志和系列中断等注释信息。该数据集适用于表格分类、回归分析以及时间序列预测等机器学习任务,可用于研究非洲各国劳动力市场的结构、趋势和差异。数据以CC BY 4.0许可证发布。

This dataset is a repackaged version of African employment data from the International Labour Organization (ILO) ILOSTAT database, organized and published by Electric Sheep Africa. The core indicator is Employment by sex, age and public/private sector (thousands) specifically for the African region. It contains 41,309 observations covering 48 African countries from 1991 to 2025. The data is sourced from ILO-integrated national labour force surveys, household income surveys, establishment surveys, and administrative records, standardized according to International Conference of Labour Statisticians (ICLS) definitions. The dataset is in tabular format with 18 fields, including country codes and names, data sources, indicator codes and labels, breakdowns by sex (total, male, female) and age groups, public/private sector classification, observation year, employment observations in thousands, and status flags (e.g., provisional, unreliable) and series breaks for data reliability notes. It is suitable for machine learning tasks such as tabular classification, regression analysis, and time series forecasting, and can be used to study the structure, trends, and disparities in labour markets across African countries. The data is released under the CC BY 4.0 license.

创建时间:
2026-05-25
原始信息汇总

数据集概述

  • 名称: Employment by sex, age and public/private sector (thousands) | Africa (ILOSTAT)
  • 规模: 41,309 条观测记录
  • 地理覆盖: 48 个非洲国家
  • 时间范围: 1991–2025 年
  • 指标数量: 1 个独特指标
  • 许可证: CC-BY-4.0
  • 语言: 英语
  • 任务类型: 表格分类、表格回归、时间序列预测

数据来源

  • 原始来源: ILOSTAT(国际劳工组织中央统计数据库)
  • 发布者: 国际劳工组织 (ILO)
  • 数据主题: 就业
  • 数据获取方式: 通过 ILOSTAT REST API 获取,并筛选至非洲地区国家

数据字段与模式

列名 类型 描述 示例
ref_area string ISO 3166-1 alpha-3 国家代码 AGO
ref_area.label string 英文国家名称 Angola
source string ILOSTAT 来源代码 BA:13951
source.label string 来源英文名称 LFS - Employment Survey
indicator string ILOSTAT 指标代码 EMP_TEMP_SEX_AGE_INS_NB
indicator.label string 指标英文名称 Employment by sex, age and public/private sector (thousands)
sex string 性别分类 (SEX_T=总计, SEX_M=男性, SEX_F=女性) SEX_T
sex.label string 性别标签 Total
classif1 string 第一分类变量(如年龄) AGE_YTHADULT_YGE15
classif1.label string 第一分类变量标签 Age (Youth, adults): 15+
classif2 string 第二分类变量(如机构部门) INS_SECTOR_TOTAL
classif2.label string 第二分类变量标签 Institutional sector: Total
time int64 观测年份 2025
obs_value float64 指标数值(单位:千) 13984.984
obs_status string 观测状态标志(如临时、不可靠) U
obs_status.label string 状态标签 Unreliable
note_classif float64 分类备注 —
note_classif.label float64 分类备注标签 —
note_indicator string 指标备注 I11:264
note_indicator.label string 指标备注标签 Break in series: Methodology revised
note_source string 来源备注 R1:3513
note_source.label string 来源备注标签 Repository: ILO-STATISTICS - Micro data from national sources

分解维度

  • sex(3 个唯一值):SEX_T(总计)、SEX_M(男性)、SEX_F(女性)

地理覆盖情况(部分)

国家代码 行数 起始年份 结束年份
ZAF 3,600 2000 2024
MUS 3,014 2003 2024
EGY 2,348 2008 2024
TUN 1,998 2005 2021
GHA 1,714 1991 2024
AGO 1,584 2004 2025
MLI 1,548 2013 2024
RWA 1,468 2014 2025
SYC 1,392 2014 2024
ZMB 1,318 2015 2024
TZA 1,272 2001 2024
UGA 1,217 2010 2021
ZWE 1,190 2011 2024
BWA 1,146 2006 2024
SEN 1,138 2011 2024

数据质量说明

  • 数据频率为年度数据,不包含月度或季度序列。
  • 当同一国家×年份存在多个来源时,使用 ILO 选择的“最佳来源”。
  • 分解列(sex, classif1, classif2)仅在指标发布该维度时非空。

指标样本

  • EMP_TEMP_SEX_AGE_INS_NB — 按性别、年龄和公共/私营部门划分的就业人数(千)

使用方式(Python 示例)

python from datasets import load_dataset

ds = load_dataset("electricsheepafrica/africa-ilo-emp-temp-sex-age-ins-nb-employment-by-sex-age-and-public-private-sector-th") df = ds["train"].to_pandas()

引用格式

bibtex @misc{africa_ilo_emp_temp_sex_age_ins_nb_employment_by_sex_age_and_public_private_sector_th_2025, title = {Employment by sex, age and public/private sector (thousands) | Africa (ILOSTAT)}, author = {International Labour Organization (ILO)}, year = {2025}, url = {https://www.ilo.org/shinyapps/bulkexplorer/?id=EMP_TEMP_SEX_AGE_INS_NB}, publisher = {HuggingFace Datasets, repackaged by Electric Sheep Africa}, howpublished = {url{https://huggingface.co/datasets/electricsheepafrica/africa-ilo-emp-temp-sex-age-ins-nb-employment-by-sex-age-and-public-private-sector-th}} }

数据集提供方

  • 重新打包方: Electric Sheep Africa
  • 发布平台: HuggingFace Datasets
  • 许可证: CC-BY-4.0
搜集汇总
数据集介绍
africa-ilo-emp-temp-sex-age-ins-nb-employment-by-sex-age-and-public-private-sector-th 数据集图片
构建方式
该数据集基于国际劳工组织(ILO)的ILOSTAT数据库构建,通过REST API接口从原始数据源中提取了EMP_TEMP_SEX_AGE_INS_NB这一核心指标,并针对非洲地区的ISO3国家代码进行了地域过滤。ILOSTAT本身汇集了来自各国劳动力调查、家庭收入调查、企业调查及行政记录等多源微观数据,并依据国际劳工统计学家会议(ICLS)标准进行统一整合与清洗。数据集中每个观测值均附有来源标签,以确保数据可追溯性。Electric Sheep Africa团队在此基础上进行了二次封装,将原始数据规范化并打包为Parquet格式,最终以HuggingFace数据集的形式发布,便于机器学习研究者直接调用。
特点
该数据集涵盖48个非洲国家、跨越1991年至2025年间的41,309条观测记录,具有显著的地理与时间广度。核心指标为按性别、年龄及公共/私营部门划分的就业人数(单位:千人),并提供多种分类维度,如性别(总、男、女)及制度部门(总、公共、私营、非营利等)。数据字段设计完整,包含国家代码、来源信息、指标标签、观测值、观测状态及多种注解列,便于用户识别数据质量与潜在断点。数据集以年度频率发布,并采用国际劳工组织筛选的单一“最佳来源”以确保一致性,适合进行跨国比较与时间序列分析。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数直接加载该数据集,将其转换为Pandas DataFrame后即可进行探索性分析。例如,可通过筛选ref_area列聚焦特定国家,或按time列排序以观察某一指标的时序变化。数据集亦支持透视表操作,可构建以时间为行、国家为列的矩阵,便于跨区域对比。对于时间序列预测、分类或回归等任务,可直接选用obs_value作为目标变量,并利用sex、classif1等分类特征进行模型输入。需要注意的是,数据年度频率要求在使用前对缺失年份进行判断,并注意观测状态标志(如不可靠)对分析结果的潜在影响。
背景与挑战
背景概述
该数据集是国际劳工组织(ILO)统计数据库ILOSTAT中关于非洲48个国家就业数据的重要子集,由Electric Sheep Africa于2025年重新打包发布,涵盖1991至2025年间的41,309条观测记录。ILOSTAT作为全球劳动力统计的权威来源,基于各国劳动力调查、行政记录等多源数据,采用国际劳动统计学家会议(ICLS)定义进行一致性处理。此数据集聚焦于按性别、年龄及公共/私营部门划分的就业人数(单位:千),为研究非洲劳动力市场结构变迁、性别就业差异及部门间转移提供了横跨34年、覆盖广泛国家的高分辨率面板数据,对发展经济学、劳动经济学及非洲区域研究领域具有重要的基础支撑作用,填补了该地区标准化、机器可读的就业时序数据空白。
当前挑战
本数据集所应对的核心领域挑战在于非洲地区长期缺乏统一、可比且高质量就业统计,许多国家数据采集时程短、频率低,且存在方法论断裂与统计标准不一致问题。构建过程中,ILOSTAT需从多种来源(如劳动力调查、企业调查)中提取并清理数据,面临跨年份、跨国别的分类体系对齐难题,例如年龄分组及部门定义差异;同时,观测值中存在大量因方法论修订(如I11:264标记)或数据不可靠(如obs_status为U)的标注,需要研究人员在使用时审慎处理此类不确定性与缺失值。此外,为了融合不同时间颗粒度与‘最佳来源’选择逻辑,确保面板数据的连续性与代表性亦是一大技术挑战,而这些细节被详细记录在数据集的schema和caveats部分,为后续迭代优化提供了明确方向。
常用场景
经典使用场景
该数据集收录了1991年至2025年间非洲48个国家的就业信息,涵盖性别、年龄以及公共与私营部门的分层统计,共计41,309条观测记录。经典使用场景是作为面板数据,用于构建跨国家、跨时段的劳动经济学计量模型,研究者可借助回归分析、固定效应模型等工具,探究非洲各国就业结构的演变规律与区域差异。
解决学术问题
该数据集解决了非洲劳动市场研究中长期面临的高质量、标准化数据稀缺的难题。它使学者能够系统分析性别就业差距、青年就业困境以及公共与私营部门就业的动态变迁,并为检验制度因素、宏观经济政策对就业结构的影响提供了可靠的实证基础,从而推动了非洲发展经济学与劳动经济学的实证研究进程。
衍生相关工作
该数据集衍生出多项经典工作,包括利用时间序列预测模型对非洲各国就业趋势进行中长期推演,以及结合机器学习方法进行就业影响因素重要性排序。此外,部分研究将其与人口、教育等数据集融合,构建综合性非洲劳动市场分析平台,为自动化政策模拟和可持续目标(SDG)进展评估提供数据驱动的研究范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务