遇见数据集

electricsheepafrica/africa-ilo-eip-xplf-sex-edu-nb-potential-labour-force-by-sex-and-education-thousa

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含6,982个观测值,覆盖42个非洲国家,时间跨度为1994年至2025年,聚焦于国际劳工组织(ILO)ILOSTAT数据库中的其他劳动力利用不足指标。核心指标为EIP_XPLF_SEX_EDU_NB,即按性别和教育程度划分的潜在劳动力(千),用于衡量劳动力市场中未充分就业或潜在劳动力的规模。数据以表格形式组织,包含国家代码、指标代码、性别分类(总计、男性、女性)、教育程度分类、观测年份、观测值(单位:千)等列,适用于表格分类、回归和时间序列预测等机器学习任务。数据来源于ILOSTAT的REST API,经过标准化处理,并遵循CC BY 4.0许可证。

This dataset contains 6,982 observations across 42 African countries, spanning from 1994 to 2025, focusing on Other measures of labour underutilization from the International Labour Organization (ILO) ILOSTAT database. The core indicator is EIP_XPLF_SEX_EDU_NB—Potential labour force by sex and education (thousands), which measures the size of underutilized or potential labour force in the market. The data is organized in tabular format, including columns such as country code, indicator code, sex disaggregation (total, male, female), education classification, observation year, observed value (in thousands), and is suitable for machine learning tasks like tabular classification, regression, and time-series forecasting. Data is sourced from the ILOSTAT REST API, normalized, and released under the CC BY 4.0 license.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-eip-xplf-sex-edu-nb-potential-labour-force-by-sex-and-education-thousa 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的旗舰统计数据库ILOSTAT,通过其REST API接口直接抽取指标代码为EIP_XPLF_SEX_EDU_NB的原始数据,并依据非洲ISO3国家代码进行地域过滤。ILOSTAT本身基于各国劳动力调查、家庭收入调查及行政记录等多元来源,并采用国际劳工统计学家会议(ICLS)定义对微观数据进行统一协调,而本次重包装由Electric Sheep Africa完成,进一步将数据整合为机器学习友好的表格格式。
特点
数据集囊括42个非洲国家自1994年至2025年的6,982条观测记录,聚焦于“按性别与教育程度划分的潜在劳动力(千人)”这一单一指标。其独特之处在于提供了性别(总、男、女)与教育分类的细化维度,并附有详细的数据质量标记,如观测状态(可靠、不可靠)和方法论更替注释,便于用户甄别数据可信度。年度频率的时序结构使其适合进行跨国面板分析与时间序列预测。
使用方法
借助HuggingFace Datasets库,用户可通过一行代码`load_dataset()`加载数据,并直接转换为Pandas DataFrame进行后续分析。典型应用包括按国家筛选子集、对特定指标绘制时间序列曲线,或利用透视表构建国家×年份矩阵,以观察劳动力潜力的区域动态变化。数据已按Parquet格式预编译,大幅缩短了数据准备时间,使研究者能快速投入劳动经济学或非洲发展议题的实证建模工作。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计数据库ILOSTAT于2025年发布,经Electric Sheep Africa重新整理后呈现在HuggingFace平台。数据集聚焦非洲大陆42个国家的潜在劳动力规模(按性别与教育程度划分,单位:千人),收录了自1994年至2025年间共计6,982条观测值。其核心研究问题在于揭示非洲劳动力市场中因性别与教育水平差异导致的劳动参与率不足现象,为衡量“非活跃潜在劳动力”这一关键经济指标提供量化基础。该数据集作为ILOSTAT框架下关于劳动力未充分利用的专项指标,对于分析非洲地区就业结构、制定教育政策与劳动力市场干预措施具有重要参考价值,尤其填补了非洲多国长期劳动力数据缺失的空白。
当前挑战
该数据集面对的首要领域挑战在于精准界定并量化“潜在劳动力”——即当前既未被雇佣也未主动求职但仍具备劳动意愿的群体,这一概念在非洲非正规经济占比高的背景下尤为复杂。数据构建过程中面临多重困难:首先,42个国家的调查数据来源各异(如劳动力调查、家庭收入调查等),原始统计口径与ILO国际劳工统计会议(ICLS)标准的对齐需要复杂的协调与验证;其次,时间跨度长达31年且各国数据采集频率不均,部分年度观测值存在不连续或标记为“不可靠”状态;此外,教育分类与性别细分字段存在大量空值,需依赖ILO选择的“最佳来源”进行数据填充,但元数据中如“方法修订”等标志增加了时序分析的扰动风险。
常用场景
经典使用场景
该数据集涵盖了1994至2025年间42个非洲国家按性别和教育程度分层的潜在劳动力规模(单位:千人),共包含6982条观测记录。其最为经典的使用场景在于构建面板数据模型,以解析非洲大陆劳动力储备的动态变化规律。研究人员常利用此数据开展性别差异对潜在劳动力供给影响的纵向研究,或探讨教育水平如何调节不同国家间劳动力未被充分利用的程度。借助时间序列预测任务,该数据集可支持对未来非洲劳动力市场潜在供给量的估计,成为政策模拟与劳动力供需匹配研究不可或缺的基础资料。
衍生相关工作
围绕该数据集,学界与政策研究机构已衍生出多项经典工作。在方法论层面,研究者基于此数据构建了非洲劳动力利用不足的多层次预测模型,将时间序列分解与面板回归结合,为后续算法优化提供了基准。若干工作聚焦于性别不平等的量化映射,利用该数据揭示了教育与就业期望之间的地域性差异,被广泛引用于全球劳动力报告中的非洲专题章节。此外,数据集的标准化格式催生了与ILOSTAT其他指标(如非正式就业率、劳动参与率)的联合分析管线,推动了跨指标劳动力市场生态系统的整合研究,并成为开源科学复现运动的典型范例。
数据集最近研究
最新研究方向
在非洲劳动力市场研究中,该数据集为剖析潜在劳动力人口的教育构成与性别差异提供了关键量化基础。当前前沿方向聚焦于利用时序建模与面板数据分析,揭示教育水平对非充分就业形态的异质性影响,并结合非洲各国青年失业率攀升、非正规经济扩张等热点社会议题,探讨劳动力供给的结构性错配。该数据集的年度覆盖与多国纵向设计,使得研究者能够量化教育投资对潜在劳动参与率的动态效应,为ILO推动体面劳动议程与非洲大陆教育政策改革提供了实证支撑,其意义在于弥合宏观劳动力统计与微观个体特征之间的数据鸿沟。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务