遇见数据集

electricsheepafrica/africa-ilo-eip-teip-sex-edu-dsb-nb-persons-outside-the-labour-force-by-sex-education

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)的ILOSTAT数据库的其他劳动力未充分利用指标数据,具体为按性别、教育程度和残疾状况划分的非劳动力人口(千人)。数据集涵盖40个非洲国家,时间跨度为1998年至2025年,共包含5,824个观测值,涉及1个独特指标。数据通过ILOSTAT REST API获取,并经过标准化处理,以支持表格分类、回归和时间序列预测等任务。

This dataset contains Other measures of labour underutilization data from the ILOSTAT database of the International Labour Organization (ILO), specifically Persons outside the labour force by sex, education and disability status (thousands). It covers 40 Africa countries, spans the years 1998–2025, includes 5,824 observations, and covers 1 distinct indicator. The data is pulled directly from the ILOSTAT REST API and harmonized for tasks such as tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-eip-teip-sex-edu-dsb-nb-persons-outside-the-labour-force-by-sex-education 数据集图片
构建方式
该数据集由Electric Sheep Africa团队从ILOSTAT官方REST API直接提取,原始数据源自国际劳工组织(ILO)基于ICLS定义的劳动力调查微观数据,经严格规范化处理后,筛选出覆盖40个非洲国家的观测样本。构建过程中,仅保留非洲ISO3国家代码对应的记录,并对性别、教育程度及残疾状态等维度进行系统拆解与标准化,最终形成包含5,824条观测值、时间跨度为1998年至2025年的结构化表格数据,以Parquet格式高效存储,便于机器学习场景下的直接调用。
特点
数据集的核心特点在于其多维度的精细拆解能力,涵盖性别(男、女、总计)、教育程度(各层级)及残疾状态三大交叉分类维度,为分析非洲地区劳动力市场边缘化群体提供了罕见的分层视角。所有指标均遵循ILO统一的统计口径与质量标记体系,通过‘obs_status’与‘note_*’系列字段清晰标注数据可靠性及方法论变更等元信息,支持用户根据研究需求灵活筛选高质量子集。此外,数据覆盖40个非洲国家且时间序列长达28年,兼具广域地理代表性与时序纵深。
使用方法
用户可通过Hugging Face的datasets库便捷加载:`load_dataset("electricsheepafrica/africa-ilo-eip-teip-sex-edu-dsb-nb-persons-outside-the-labour-force-by-sex-education")`,随即转换为Pandas DataFrame进行后续分析。针对单一国家或指标的时间序列探索,可基于`ref_area`或`indicator`字段快速过滤;若需构造国家×年份的面板数据,利用`pivot_table`函数即可完成宽表重塑,支撑面板回归或横截面比较。数据集以CC-BY-4.0许可发布,使用时应同时引用原始ILO数据源及Electric Sheep Africa的二次封装版本。
背景与挑战
背景概述
在全球劳动力市场分析中,劳动力利用不足指标是评估经济体结构性就业问题的重要工具。由国际劳工组织(ILO)统计数据部创建并维护的ILOSTAT数据库,长期以来为全球劳动力研究提供权威数据支撑。在此背景下,Electric Sheep Africa团队于2025年基于ILOSTAT官方API,精心提取并二次封装了专注于非洲大陆的数据集——africa-ilo-eip-teip-sex-edu-dsb-nb-persons-outside-the-labour-force-by-sex-education。该数据集收录了自1998年至2025年间涵盖40个非洲国家的5824条观测记录,核心关注“按性别、教育程度和残疾状况划分的劳动力以外的个体数量”这一关键指标,旨在为研究者提供标准化的、面向机器学习的非洲劳动力利用不足分析数据基础。其发布填补了非洲地区精细化劳工统计数据的空白,对推动区域发展经济学、劳动力市场预测及政策评估研究具有重要影响力。
当前挑战
该数据集所解决的领域问题核心在于劳动经济学中的“隐性失业”与“劳动力边缘化”现象。传统失业率统计常忽略因教育、残疾或性别歧视而完全退出劳动力市场的群体,导致经济政策制定者无法全面评估劳动力利用不足的真实规模。因此,数据集必须克服多维度交叉分组的复杂性,即同时按性别、教育水平、残疾状态进行分层,以确保分析能够揭示这些因素如何交织影响个体劳动参与决策。在构建过程中,挑战尤为突出:首先,ILOSTAT原始数据源于各国不同的劳动力调查与行政记录,数据口径、质量及时效性参差不齐,因此整合时需高效识别并优先选用国际劳工组织指定的“最佳来源”,并处理因方法论修订或非标准教育分类带来的序列断裂问题;其次,大量国家仅提供年度数据,缺乏高频观测,导致时序预测模型面临稀疏性与非平稳性难题,且数据标注中的“不可靠”状态标记要求在使用时进行审慎的质量筛选与处理。
常用场景
经典使用场景
该数据集聚焦于非洲地区按性别、教育水平和残疾状况划分的劳动力市场非活跃人口统计,是劳动经济学与人口统计学交叉领域的基础性数据资源。其最经典的应用场景在于构建多维度的劳动力市场分析模型,研究者可借助其丰富的分类维度(性别、教育程度、残疾状态),运用逻辑回归或面板数据计量方法,精确测算不同群体退出劳动力市场的概率与结构性动因。基于跨越1998至2025年的时间序列结构,该数据集亦为预测型研究(如时间序列回归、状态空间建模)提供了纵向样本支撑,使得刻画非洲劳动力非活跃率的长期演变轨迹成为可能。
实际应用
在实际应用层面,该数据集为国别劳动政策制定与国际发展干预提供了迫切的数据驱动工具。国际劳工组织、非洲开发银行等机构可利用其中性别与残疾维度的精细分层,诊断特定国家或地区劳动力参与率低迷的根源,进而设计针对性的技能培训计划或社会保障方案。例如,若数据显示某一国家的残疾女性群体非活跃率异常攀升,政策制定者可据此调整无障碍就业法规或提供远程工作补贴。此外,该数据亦被私营部门整合进行劳动力供给预测,指导跨国企业在非洲的人才招聘策略与投资选址决策。
衍生相关工作
该数据集衍生了一系列具有影响力的研究谱系,尤其在劳动市场分割理论与非标准就业测度领域催生了多项开创性工作。部分学者以此为基础构建了非洲非活跃人口的多状态转移概率模型,揭示了教育投入与就业重返之间的非线性关系;另一些研究则利用数据集的残疾状态分类变量,首次量化了残疾歧视对非洲GDP产出造成的隐性损失,推动了‘包容性增长’核算方法论的革新。此外,该数据与ILOSTAT同系列产品联动,已被用于验证‘劳动力利用不足综合测度’(LU1-LU4)在非洲语境下的适用性,为全球劳动统计标准的本土化调适提供了基线参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务