遇见数据集

electricsheepafrica/africa-ilo-eip-xplf-sex-age-geo-nb-potential-labour-force-by-sex-age-and-rural-urban

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的“其他劳动力利用不足的衡量指标”数据,具体为按性别、年龄和农村/城市地区划分的潜在劳动力(以千计)。数据集涵盖39个非洲国家,时间跨度为1994年至2025年,共包含11,644个观测值。数据通过ILOSTAT REST API获取,并过滤为非洲国家,涵盖了国家代码、年份、性别、年龄分类、城乡地区分类等多个维度,用于表格分类、回归和时间序列预测等任务。数据以年度频率发布,并包含数据质量注释,如观测状态和来源说明。

This dataset contains data titled "Other Measures of Labour Underutilization" sourced from the ILOSTAT database of the International Labour Organization (ILO). Specifically, it tracks potential labour force figures (in thousands) disaggregated by sex, age group, and rural/urban residence. The dataset covers 39 African countries across the 1994 to 2025 time period, with a total of 11,644 valid observations. All data was obtained through the ILOSTAT REST API, and filtered to exclusively include African nations. It encompasses multiple core dimensions: country code, year, sex, age category, and urban/rural area classification. This dataset is suitable for use cases including tabular classification, regression analysis, and time series forecasting. It is released at an annual frequency, and includes data quality annotations such as observation status and source attribution notes.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-eip-xplf-sex-age-geo-nb-potential-labour-force-by-sex-age-and-rural-urban 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API接口直接提取指标代码为EIP_XPLF_SEX_AGE_GEO_NB的数据,而后依据非洲国家ISO3编码进行地理过滤与筛选。数据经由Electric Sheep Africa重新封装,整合为可供机器学习与统计分析的表格格式,涵盖1994年至2025年间39个非洲国家的观测记录,共计11,644条。ILOSTAT本身采用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一标准化处理,以确保不同来源数据间的可比性,数据集内的source.label字段则忠实记录了各观测值的原始数据来源,增强了数据的可追溯性与可信度。
特点
该数据集的核心特点在于其聚焦于非洲区域劳动力市场的“潜在劳动力”这一特殊指标,即按照性别、年龄及城乡地域三维维度进行细致拆分的劳动力未充分利用度量。每条观测记录均包含性别的三类划分(总计、男性、女性)、年龄分类变量以及地理覆盖范围标识,为研究者提供了高度结构化的多层次分析视角。数据集的年度时间跨度达32年,覆盖39个国家的广泛地理分布,其中南非、卢旺达、安哥拉等国的观测记录最为丰富。此外,数据附带了详尽的状态标识与注释字段,如观测值的可靠性标记及序列中断说明,有助于用户在建模与推断过程中审慎评估数据质量。
使用方法
使用者可通过HuggingFace Datasets库的load_dataset函数便捷加载该数据集,并将其转换为Pandas DataFrame以便进行后续分析与建模。针对特定国家的研究需求,可利用'ref_area'字段进行条件过滤,如筛选肯尼亚的数据子集。对于时间序列分析任务,可依据'indicator'字段锁定目标指标,按'time'字段排序后对'obs_value'进行可视化或预测建模。该数据集还支持通过数据透视表操作将数据结构重排为以年份为行、国家为列的矩阵形式,便于进行跨国的面板数据分析或机器学习特征工程。所有操作均可在Python环境中快速实现,显著降低了非洲劳动力数据获取与预处理的门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年发布,经Electric Sheep Africa重新整理并托管于HuggingFace平台,聚焦非洲39个国家1994至2025年间潜在劳动力人口的性别、年龄及城乡分布状况。作为ILOSTAT数据库的核心衍生资源,其研究问题直指非洲劳动力市场中的隐性就业不足现象——即那些虽未正式失业但因各种原因未能充分参与劳动的潜在劳动力群体。数据集的创建为分析非洲大陆劳动力结构性矛盾、评估可持续就业目标(SDG 8)进展提供了关键定量基础,在劳动经济学、发展研究及政策制定领域具有重要影响力。
当前挑战
该数据集所解决的领域问题核心在于量化劳动力市场中的“隐性失业”与“就业不足”现象。传统失业率指标未能涵盖那些因家庭责任、健康问题或就业前景渺茫而退出市场的人群,而本数据集通过“潜在劳动力”指标为非洲地区非正规经济主导的就业结构提供了更全面的度量。构建过程中面临多重挑战:横跨39国30余年数据,需整合来源不一(家庭调查、雇主调查、行政记录)且定义各异的原始资料;ILO虽依据国际劳动统计学家会议(ICLS)标准进行协调,但仍存在因方法论修订、调查周期不一致导致的数据断点与注记标注等问题,需通过“best source”选择机制与质量标记字段加以应对。
常用场景
经典使用场景
该数据集的核心应用场景在于劳动经济学与人口统计学交叉领域,研究者常利用其按性别、年龄及城乡区域划分的潜在劳动力数据,剖析非洲各国劳动力市场的结构性特征。通过11,644条覆盖39个国家、跨越三十余年(1994-2025)的观测值,可系统追踪劳动力未充分利用的动态变化,识别不同社会群体在劳动力参与中的差异化模式。学者们尤其关注该数据在时间序列分析中的价值,以揭示政策干预、经济波动或人口变迁如何重塑潜在劳动力的规模与构成。
衍生相关工作
该数据集衍生了多项经典工作,包括基于时间序列建模的非洲劳动力迁移预测研究,以及结合机器学习方法的劳动力未充分利用影响因素识别。学者们利用其面板数据结构开发了国家间异质性分析框架,探索了正规与非正规部门劳动力流动的统计关联。此外,该数据常与ILOSTAT中的就业率、工资水平等互补性指标联合使用,构建综合性劳动力市场评估模型,最终形成了多篇发表于发展经济学和国际劳动统计期刊的实证论文。
数据集最近研究
最新研究方向
当前,非洲劳动力市场研究正聚焦于非正规就业与劳动利用不足的精细化测度,该数据集通过提供1994至2025年间39个非洲国家按性别、年龄及城乡划分的潜在劳动力规模,为剖析青年失业、性别鸿沟及城乡结构性失衡提供了关键数据支撑。结合ILOSTAT统一方法论与ICLS定义,研究者得以量化未被充分纳入统计的潜在劳动力群体,识别不同地域与人群的劳动参与壁垒。这一前沿方向不仅呼应了非洲大陆自由贸易区建设对人力资本配置的迫切需求,也为SDG体面劳动目标的监测与政策干预提供了实证基础,尤其在后疫情时代劳动力市场复苏评估中具有重要实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务