遇见数据集

electricsheepafrica/africa-ilo-eip-5eet-sex-rt-share-of-youth-not-in-employment-education-or-trai

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含231个观测值,覆盖24个非洲国家,时间跨度为2016年至2025年,涉及一个指标:劳动力未充分利用的其他衡量指标。具体指标为EIP_5EET_SEX_RT,即按性别分列的未就业、未受教育或未培训青年(NEET)比例,基于第19届国际劳工统计学家会议(ICLS)定义。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过API获取并过滤非洲国家代码,采用标准化方法处理原始调查数据。数据集包含列如国家代码、国家名称、数据来源、指标、性别、时间、观测值等,适用于表格分类、回归和时间序列预测任务。

This dataset contains 231 observations across 24 Africa countries, spanning 2016–2025, covering 1 distinct indicator: Other measures of labour underutilization. The specific indicator is EIP_5EET_SEX_RT, which represents the share of youth not in employment, education or training (NEET) by sex, based on the 19th International Conference of Labour Statisticians (ICLS) definitions. Data is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via API and filtered for Africa ISO3 country codes, with harmonization using ICLS definitions. The dataset includes columns such as country code, country name, source, indicator, sex, time, observed value, etc., and is suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-eip-5eet-sex-rt-share-of-youth-not-in-employment-education-or-trai 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过调用其REST API获取指标EIP_5EET_SEX_RT的数据,并依据非洲ISO3国家代码进行筛选过滤。数据涵盖了2016至2025年间24个非洲国家的231条观测记录,经由Electric Sheep Africa团队重新整合打包,形成适用于机器学习的标准化表格数据集。ILOSTAT本身采用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一处理,数据来源均在source.label列中标注,确保可追溯性。
使用方法
研究者可通过HuggingFace Datasets库的load_dataset函数一键加载该数据集,并转换为Pandas DataFrame进行后续分析。典型应用包括筛选特定国家的NEET时间序列(如按ref_area过滤肯尼亚数据)、对单一指标进行时序可视化(按time排序并绘制obs_value),或将数据透视为国家×年份矩阵以进行跨区域比较。数据集同时适用于表格分类、回归及时间序列预测任务,其标准化模式兼容常见的统计建模与机器学习工作流。
背景与挑战
背景概述
青年失业与未充分就业是全球劳动力市场关注的核心议题,尤其在非洲大陆,结构性转型与人口红利并存,青年群体脱离就业、教育与培训的现象(NEET)成为衡量劳动力资源浪费与社会排斥的关键指标。国际劳工组织(ILO)自2016年起通过ILOSTAT数据库系统收集各国劳动力调查数据,但非洲地区的NEET数据长期分散于不同来源,缺乏统一、机器可读的标准化格式。为此,Electric Sheep Africa于2025年基于ILO的19届国际劳工统计学家会议(ICLS)定义,将覆盖24个非洲国家、2016至2025年间共231条观测的NEET数据重新打包并发布至HuggingFace平台。该数据集以性别分列,聚焦于青年NEET比例这一单一但极具政策意义的指标,为分析非洲劳动力市场中的性别差异、教育机会不均与就业结构转型提供了高质量、可复用的时序数据基础,有力地推动了区域劳动力研究的可重复性与模型驱动的政策评估。
当前挑战
构建该数据集面临多重挑战。在领域问题层面,青年NEET比例虽然直观反映劳动力闲置,但其定义依赖于复杂的国际统计分类(如19届ICLS标准),不同国家调查问卷的设计差异导致指标可比性较低,同时性别分列的样本量有限,使深度挖掘群体异质性变得困难。在构建过程中,原始ILO数据来自各国劳动力调查、家庭收入调查等多源异构的行政记录,数据质量参差不齐,存在缺失值、序列中断(如观测状态标记为'Break in series')与来源不一致等问题。此外,部分国家观测年份稀疏(如塞舌尔仅覆盖2023-2024年),时间序列不完整,限制了面板数据分析与因果推断的稳健性。数据标准化还需处理多语言标签、非统一编码的元数据,以及将API拉取的原始JSON转化为结构化表格,这一清洗与对齐过程对自动化管线的容错能力提出了较高要求。
常用场景
经典使用场景
该数据集源自国际劳工组织ILOSTAT数据库,聚焦于非洲24个国家2016至2025年间青年不在职、不在学、不在训(NEET)比例的性别分异状况。其经典使用场景在于构建面板数据模型,评估非洲国家青年劳动力市场参与度的时序演变与区域性差异,借助性别维度的细分特征,研究者能够剖析女性青年在就业、教育与培训体系中边缘化的结构性成因。数据集的年度频次与跨国家覆盖,使其成为描绘撒哈拉以南非洲青年发展困境与政策干预效果的基准数据集。
解决学术问题
该数据集精准回应了发展经济学中关于青年劳动力闲置与人力资本积累的经典议题,尤其填补了非洲地区NEET指标长期缺乏系统化、标准化微观数据的学术空白。通过提供经由国际劳动统计学家会议定义统一的度量标准,研究者得以突破以往依赖单一国别调查或零星估测的局限,在跨国比较框架内检验青年失业与教育排斥之间的联动机制、性别不平等在劳动力市场中的代际传递路径,以及经济增长对青年社会融入的非线性影响,为非洲大陆青年发展政策评估奠定了可信的数据基石。
实际应用
在实际政策干预层面,该数据集为国际发展组织、非洲各国劳动部门及研究智库提供了监测青年劳动力闲置动态的可操作工具。基于数据,决策者能够识别各国青年NEET比例的高发年份与群体特征,制定精准的职业培训计划、就业促进政策或教育支持方案。社会企业与非政府组织亦可借此数据评估社区层面干预项目的有效性,推动资金与资源向最弱势的青年群体倾斜。数据集与HuggingFace生态的无缝对接,更大幅降低了机器学习在劳动力市场预测、社会风险画像等实务场景中的应用门槛。
数据集最近研究
最新研究方向
当前国际社会对青年NEET(不在就业、教育或培训状态)问题的关注持续升温,尤其是在非洲这一青年人口激增但结构性就业矛盾突出的区域。该数据集聚焦于19届国际劳工统计学家会议(ICLS)定义的NEET指标,覆盖24个非洲国家2016至2025年的年度观测数据,为循证政策制定提供了关键基础。研究前沿方向已从简单的失业率统计转向对青年边缘化状态的精细化追踪,尤其关注性别维度的差异化表现(如SEX_T/M/F三类性别标识),以揭示隐性劳动利用不足的深层结构。结合国际劳工组织(ILOSTAT)的最新数据框架,该数据集支持时间序列预测、区域比较分析及多源数据融合,助力研究者深入剖析非洲劳动力市场的脆弱性及其与教育、社会保护体系的断裂。在非洲大陆自贸区推进与数字化转型加速的背景下,此类数据对于评估青年友好型就业政策的实际效能、推动2030年可持续发展目标(SDG 8.6)中青年NEET比例下降的监测具有不可替代的学术与应用价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务