遇见数据集

electricsheepafrica/africa-ilo-eip-5eet-sex-nb-youth-not-in-employment-education-or-training-neet

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为“按性别划分的未就业、未受教育或未培训青年(NEET)——第19届国际劳工统计学家会议(千计)| 非洲(ILOSTAT)”,包含231个观测值,覆盖24个非洲国家,时间跨度为2016年至2025年,涉及1个核心指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,主题属于“其他劳动力利用不足的衡量指标”。具体指标为“EIP_5EET_SEX_NB”,用于衡量按性别分组的青年未就业、未受教育或未培训(NEET)情况,单位为千计。数据集通过ILOSTAT REST API获取,并经过过滤以仅包含非洲国家,数据经过ILO的统计部门根据第19届国际劳工统计学家会议(ICLS)定义进行标准化处理。数据模式包括国家代码、国家名称、数据来源、指标代码、性别分类、观测年份、观测值、观测状态和相关备注等字段,支持按性别(总计、男性、女性)进行细分。数据质量方面,为年度频率,ILO选择“最佳来源”以避免重复,且细分列仅在有数据时非空。该数据集由Electric Sheep Africa重新打包,旨在为非洲提供统一的、机器学习就绪的数据层,便于研究人员和开发者快速使用。

This dataset is titled "Youth Not in Employment, Education or Training (NEET) by Sex — 19th International Conference of Labour Statisticians (Thousands) | Africa (ILOSTAT)". It contains 231 observations covering 24 African countries, spanning the period from 2016 to 2025, and includes 1 core indicator. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), with its theme categorized as "Other Measures of Labour Underutilization". The specific indicator is "EIP_5EET_SEX_NB", which measures the youth NEET status grouped by sex, with the unit being thousands. The dataset is acquired via the ILOSTAT REST API, and filtered to only include data from African countries. The data has been standardized by the ILO's statistical department in accordance with the definitions set by the 19th International Conference of Labour Statisticians (ICLS). The dataset comprises fields including country code, country name, data source, indicator code, sex classification, observation year, observed value, observation status and relevant notes, and supports segmentation by sex (total, male, female). In terms of data quality, this is an annual-frequency dataset. The ILO selects the "best available source" to avoid duplication, and segmented columns are only non-empty when corresponding data exists. This dataset was repackaged by Electric Sheep Africa, aiming to provide a unified, machine learning-ready data layer for Africa to enable rapid utilization by researchers and developers.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-eip-5eet-sex-nb-youth-not-in-employment-education-or-training-neet 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API接口直接抽取青年未就业、未受教育或未参加培训(NEET)的指标数据,并依据第19届国际劳动统计学家会议(ICLS)定义的分类标准进行整合。数据在获取后,仅筛选出非洲ISO3国家代码对应的观测值,形成覆盖24个非洲国家的231条记录,跨越2016至2025年。为保障数据可追溯性,原始调查微观数据的来源信息在source.label列中明确标注,体现了ILO对统计口径和元数据的严格规范。最终由Electric Sheep Africa团队以HuggingFace数据集格式重新封装,将数据标准化为Parquet文件,便于机器学习场景下的直接调用。
特点
本数据集的核心特点在于其聚焦非洲青年劳动力市场的特殊结构性指标——NEET,区别于传统的失业率统计,该指标更全面地捕捉了青年在教育和就业体系外的脆弱状态。数据经过性别维度(总、男、女)的精细分解,共计3种分类,有助于分析不同性别青年群体的劳动参与障碍。时间序列上采用年度频率,覆盖近十年跨度,且每个观测值均附带观测状态标志(如连续性中断)和注释信息,提醒数据存在方法论修订等潜在偏差。此外,数据仅收录ILO为每个国家-年份组合选定的“最佳来源”,避免了多方数据源的冗余,提高了分析的一致性和可信度。
使用方法
研究者通过HuggingFace的datasets库可一键加载该数据集,代码简洁高效。数据以表格形式呈现,包含ref_area(国家代码)、time(年份)、obs_value(观测值)、sex(性别分类)等核心字段,便于进行分组聚合与可视化分析。典型用法包括筛选特定国家的NEET时间序列以观察趋势变化,或透视生成以国家为列、年份为行的矩阵,进行跨国横向对比。由于数据已结构化并附带清晰的数据模式说明,使用者可直接导入Pandas进行统计建模、回归分析或作为时间序列预测任务的输入,极大降低了非洲劳动统计数据的获取与预处理门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年发布,经Electric Sheep Africa重新整理后托管于HuggingFace平台,聚焦非洲24国青年(15-24岁)未就业、未接受教育或培训(NEET)的性别分列数据,时间跨度为2016至2025年,共包含231条观测。NEET指标作为衡量青年劳动市场边缘化程度的核心工具,对研究非洲地区劳动力结构、性别不平等以及可持续发展目标(SDG)中的体面工作目标具有重要价值。该数据集依托ILOSTAT数据库,该数据库整合了各国劳动力调查、家庭收入调查等官方来源,并通过国际劳工统计学家会议(ICLS)标准进行统一化处理,为跨区域比较分析提供了可靠基础。作为非洲区域劳动统计的首个标准化ML-Ready数据集,它填补了高粒度、长时间序列的NEET数据空白,对政策制定者、发展经济学研究者及AI驱动的社会预测模型具有显著推动作用。
当前挑战
NEET指标的构建面临多重挑战:首先,非洲各国劳动力调查覆盖周期不一(如卢旺达提供9年数据,而科特迪瓦仅4年),且部分观测因方法论修订(如‘Break in series’标记)或数据可靠性存疑(如‘B’状态标记)导致序列不连续,增加了纵向分析的难度。其次,性别分列的缺失值问题突出——仅当指标发布该细分时才纳入‘sex’列,使得部分国家或年份的女性NEET比率无法直接获取,限制了性别差异的全面评估。再者,数据整合过程中需处理多个来源的优选问题(如ILO对同一国家×年份选用‘最佳来源’),可能引入选择偏差。此外,该数据集仅包含年度频率,忽略了月度或季度波动,难以捕捉短期政策干预或经济冲击对青年就业的即时影响。这些挑战共同制约着非洲NEET指标的稳健性与可推广性。
常用场景
经典使用场景
该数据集聚焦于非洲地区青年未就业、未接受教育或培训(NEET)的统计数据,涵盖2016至2025年间24个非洲国家的231条观测记录。最经典的使用场景是进行跨国的青年劳动力闲置状况比较分析,研究者可利用时间序列数据追踪各国NEET指标的演变轨迹,或通过按性别分层的变量探究青年群体在就业市场中的结构性差异。此外,数据集的表格结构便于构建分类与回归模型,预测青年失能风险,或作为时间序列预测任务的输入,预判未来劳动力市场趋势。
解决学术问题
该数据集解决了非洲青年劳动力市场研究中长期存在的数据碎片化问题,提供了经国际劳工组织(ILO)统一标准整合的跨年、跨国微观指标。学术上,它使得量化评估非洲青年在就业、教育与培训体系中的边缘化程度成为可能,助力学者检验诸如教育投入回报、性别歧视与劳动力参与率之间的因果假设。其重要意义在于,为可持续发展目标(SDG)中关于体面工作和经济增长的监测提供了可靠的非洲区域基线数据,推动从描述性统计转向更为严谨的计量经济学分析与政策模拟。
衍生相关工作
该数据集衍生出的相关工作主要围绕非洲劳动力市场的计量建模与政策评估。典型工作包括利用面板数据回归模型分析影响NEET率的关键宏观因素(如GDP增长率、教育支出占比),以及构建贝叶斯时空模型来预测未观测国家的青年失能水平。此外,性别维度的引入催生了一系列聚焦女性青年就业困境的性别发展研究。这些工作不仅深化了对非洲劳动力闲置机制的理解,也为后续构建更复杂的多国多指标劳动力预测框架奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务