electricsheepafrica/africa-ilo-emp-xtru-sex-age-edu-nb-time-related-underemployment-by-sex-age-and-educat
收藏数据链接:
官方服务:
资源简介:
该数据集包含了非洲34个国家从1991年至2025年期间,按性别、年龄和教育程度分类的时间相关就业不足(以千人为单位)统计数据,共计15,690个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API获取,并经过处理和过滤以覆盖非洲地区。数据集旨在提供关于劳动力市场中就业不足情况的详细、可追溯的年度时间序列数据,适用于表格分类、回归分析和时间序列预测等机器学习任务。
This dataset contains 15,690 observations of time-related underemployment statistics, disaggregated by sex, age, and education (in thousands), across 34 African countries from 1991 to 2025. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via its REST API, and processed to cover African countries. It provides detailed, traceable annual time-series data on labor underutilization, suitable for tabular classification, regression, and time-series forecasting tasks in machine learning.
提供机构:
electricsheepafrica搜集汇总
数据集介绍

构建方式
该数据集源自国际劳工组织统计数据库(ILOSTAT),由Electric Sheep Africa进行标准化元数据整理与重封装,收录了1991年至2025年间34个非洲国家共计15,690条与时间相关就业不足的观测记录,涵盖性别、年龄与教育程度三个维度的交叉分类,以千人为计量单位。数据以Parquet格式存储,在保留原始发布者权利的前提下,通过统一元数据框架增强了数据发现与复用的便利性。
特点
作为面向非洲劳动市场研究的表格型数据集,其显著特征在于跨越三十余年的长时序覆盖和多元人口维度的分层设计。数据集涵盖经济学与金融领域,支持表格分类与回归任务,规模介于一万至十万条之间,同时包含表格与文本模态。标签体系涵盖就业不足、劳动、就业等主题,并以CC BY 4.0许可开放,便于学术研究与政策分析中的横向比较与纵向追踪。
使用方法
研究者可借助Hugging Face datasets库直接加载该数据集,获取数据分片与特征结构,并在需要时转换为Pandas数据框进行深入分析。使用时应从仓库文件与数据查看器出发核实变量定义与单位,明确国家字段的处理方式,对缺失值应保留至确立合理的插补规则后再行处理。建议在建模前检查模式与缺失情况,按地理、时间与子群体变量进行画像,并引用原始来源与Electric Sheep Africa仓库以确保分析的可重复性。
背景与挑战
背景概述
国际劳工组织(ILO)长期致力于全球劳动力市场统计监测,其ILOSTAT数据库是劳动经济领域最具权威性的跨境可比数据来源之一。非洲地区因非正规就业普遍、统计基础设施薄弱,时间相关不充分就业问题尤为突出,却长期缺乏按性别、年龄与教育程度细分的系统化数据。Electric Sheep Africa于2026年将ILOSTAT原始数据重新封装为机器学习就绪的数据集,覆盖34个非洲国家、1991至2025年间15,690条观测记录,以标准化元数据降低非洲数据发现与复用门槛。该数据集为劳动经济学家与政策研究者提供了检视非洲就业质量结构性差异的实证基础,亦为非洲开放数据生态的规范化建设提供了可复用的工程范式。
当前挑战
时间相关不充分就业的度量本身即面临概念操作化的困境,各国对工作时长门槛与就业意愿的界定差异导致跨境比较存在系统性偏差。数据集需在保留ILOSTAT原始口径与实现跨年跨地区可比性之间取得平衡。覆盖层面,34国的样本对非洲54国而言仍存显著地理缺口,非英语区国家的统计能力差异可能引入选择性偏差。元数据中country与upstream_publisher字段的缺失进一步削弱了溯源透明度。构建过程中,异构国家报告格式的标准化、时间序列断裂的协调处理以及缺失值机制的甄别,均对数据质量构成潜在威胁,研究者须在建模前审慎审视变量定义与缺失模式。
常用场景
经典使用场景
在劳动经济学与非洲发展研究的交汇处,该数据集凭借国际劳工组织标准化统计口径,记录了34个非洲国家自1991年至2025年间按性别、年龄组与教育程度分列的时间相关不充分就业人口规模。研究者通常以面板数据框架对其展开分析,将国家、年份与人口子群作为多维标识,借助描述性统计与回归建模刻画不充分就业的时序演变与结构性差异。由于该数据集涵盖逾一万五千条观测记录,其规模足以支撑跨国比较研究与分组趋势推断,成为探讨非洲劳动力市场脆弱性的基础性数据资源。
衍生相关工作
作为Electric Sheep Africa在Hugging Face平台发布的非洲公共数据目录之一,该数据集催生了一系列围绕非洲劳动力市场的数据工程与实证研究。相关衍生工作包括以国别、年份与指标字段为联结键,将其与同一目录下的失业率、劳动参与率及部门就业结构数据集进行横向合并,构建综合性劳动市场观测面板;亦有研究者基于其标准化元数据开发自动化数据卡生成工具与缺失值处理流程,推动开放数据治理方法的迭代。这些工作共同扩展了国际劳工组织统计资料在机器学习与可复现研究中的再利用边界,强化了非洲数据基础设施的学术可见度。
数据集最近研究
最新研究方向
伴随国际劳工组织对体面劳动议程的持续推进,非洲劳动力市场中的时间相关就业不足问题日益成为发展经济学与劳动经济学的交叉研究前沿。该数据集覆盖三十四个非洲国家、跨度逾三十年的万级观测,为解析性别、年龄与教育维度下就业不足的异质性提供了稀缺的跨国面板证据。当前研究热点集中于将此类劳动力未充分利用指标与非正规就业、青年失业及人力资本错配等议题相联结,借助面板计量与机器学习方法识别结构性决定因素。其意义在于弥补非洲劳动统计微观证据的碎片化缺陷,为循证政策设计、可持续发展目标监测及跨国比较研究奠定可复现的数据基础,亦为低收入国家劳动力市场韧性评估提供量化支撑。
以上内容由遇见数据集搜集并总结生成



