遇见数据集

electricsheepasia/asia-ilo-eip-neet-sex-dsb-rt-share-of-youth-not-in-employment-education-or-trai

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个表格数据集,包含亚洲20个国家从1996年到2024年期间,按性别和残疾状况划分的未就业、未受教育或未培训青年(NEET)比例的观测数据。数据集源自国际劳工组织(ILO)的ILOSTAT数据库,涵盖1,139个观测值,涉及1个核心指标:EIP_NEET_SEX_DSB_RT,该指标表示未就业、未受教育或未培训青年(NEET)的百分比。数据已由Electric Sheep Asia重新打包,以便于机器学习使用,并包含国家代码、年份、性别分类、残疾状况分类、观测值及其状态等字段。数据集适用于表格分类、回归和时间序列预测等任务。

This dataset is a tabular dataset containing observations on the share of youth not in employment, education or training (NEET) by sex and disability status across 20 Asia countries from 1996 to 2024. It is sourced from the International Labour Organization (ILO) ILOSTAT database, comprising 1,139 observations and covering one core indicator: EIP_NEET_SEX_DSB_RT, which represents the percentage of youth not in employment, education or training. The data has been repackaged by Electric Sheep Asia for machine learning readiness, including fields such as country codes, years, sex disaggregation, disability status classification, observed values, and their status flags. The dataset is suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-eip-neet-sex-dsb-rt-share-of-youth-not-in-employment-education-or-trai 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT数据库,聚焦于亚洲地区青年未接受教育、就业或培训(NEET)的比例,并按性别与残疾状况进行细分。数据通过ILOSTAT REST API直接抽取,特定指标代码为EIP_NEET_SEX_DSB_RT,随后依据亚洲ISO3国家代码进行过滤。ILO依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,并在source.label字段中标注数据来源,确保可追溯性。该数据集共包含1,139条观测记录,覆盖20个亚洲国家,时间跨度从1996年至2024年。
特点
该数据集的核心特点在于其聚焦于劳动力利用不足的其他衡量指标,即NEET比率,并提供了按性别(总计、男性、女性、其他)和残疾状况的细致分类。数据以年频率呈现,每次观测均附有观测状态标志及详细的说明注释,如序列中断、方法论修订等,有助于评估数据质量。数据集还包含了元数据列,如来源、指标标签及各类分类变量,便于用户进行多维度的分析与解读。其地域覆盖虽限于亚洲,但国家样本多样,从蒙古到阿富汗,时间跨度近三十年,为区域比较研究提供了宝贵素材。
使用方法
用户可通过HuggingFace Datasets库便捷加载此数据集,仅需调用load_dataset函数即可将数据以Pandas DataFrame形式读取。例如,使用`ds = load_dataset("electricsheepasia/asia-ilo-eip-neet-sex-dsb-rt-share-of-youth-not-in-employment-education-or-trai")`,然后通过`ds["train"].to_pandas()`转换为DataFrame。在此基础上,用户可轻松进行数据筛选,如按国家过滤(如印度尼西亚),或按时间序列对单一指标进行分析与可视化。此外,该数据集还支持通过透视表操作将数据重塑为国家×年份的矩阵,便于进行面板数据分析或构建机器学习模型。
背景与挑战
背景概述
在全球劳动力市场分析中,青年失学失业问题(NEET)已成为衡量劳动力利用不足与社会排斥的关键指标,尤其受到国际劳工组织(ILO)等权威机构的密切关注。该数据集由Electric Sheep Asia于2024年重新整理并发布,数据源来自ILO的ILOSTAT数据库,覆盖1996年至2024年间亚洲20个国家的1,139条观测记录,核心研究问题是探讨不同性别与残疾状况下青年NEET比例的分布特征。作为首个面向亚洲地区的标准化NEET时间序列数据集,它填补了区域级细粒度青年劳动力利用不足数据的空白,为政策制定者、发展经济学研究者以及社会分层分析提供了宝贵的基础资料,推动了亚太区域可持续发展目标(SDGs)中体面劳动与经济增长相关指标的实证研究。
当前挑战
该数据集所应对的领域问题聚焦于青年群体在就业、教育与培训系统中的边缘化状态,尤其是当性别与残疾状态作为交叉维度时,传统劳动统计往往缺乏足够精细的分解数据,导致对脆弱青年群体的识别与分析存在显著盲区。在构建过程中,数据集面临多重挑战:其一,ILOSTAT原始数据源整合了来自各国劳动力调查、家庭收入调查及行政记录等多源异构数据,指标定义与调查方法历经多次修订,导致时间序列中存在断点与观测状态标记(如B表示序列中断);其二,残疾状况的界定标准在各国间存在非统一性,部分观测附有注释说明采用了非标准定义,这为跨国比较带来了方法论上的困难;其三,数据虽涵盖20个国家,但各国观测年份与频次极不均等,如蒙古与塞浦路斯各有超过160条记录,而阿富汗、塔吉克斯坦等国仅有27条,稀疏性与不完整性对时间序列建模与因果推断构成了显著制约。
常用场景
经典使用场景
在劳动经济学与社会发展研究领域,该数据集作为衡量青年劳动力市场边缘化程度的权威指标,最经典的使用场景是进行跨国别的NEET率(未就业、未受教育或培训的青年比例)动态比较分析。研究者可利用其中包含的20个亚洲国家从1996年至2024年的1,139条观测记录,结合性别与残疾状态的分层维度,系统性地追踪不同亚群体在劳动力市场中的结构性困境。该数据集的时序属性使其成为评估宏观政策改革与劳动市场冲击对青年群体影响的理想工具,尤其适用于检验经济增长与社会包容性之间的非线性关系。
衍生相关工作
围绕该数据集已衍生出一系列具有学术影响力的研究工作,其中最典型的是运用该NEET序列构建亚洲青年劳动力市场脆弱性指数,进而通过面板分位数回归描绘不同发展层级国家中性别与残疾状态对就业排斥的差异化边际效应。另一类经典工作聚焦于时间序列分解方法,利用该数据的年际波动特征分离出周期性与结构性NEET成分,从而预测经济衰退期青年技能错配的弹性系数。这些衍生研究不仅拓宽了ILOSTAT数据库在区域劳动经济学中的应用边界,更推动了针对残疾群体就业排斥这一长期被忽视议题的量化建模方法创新。
数据集最近研究
最新研究方向
在当前全球关注青年就业与包容性发展的背景下,该数据集聚焦于亚洲20个国家1996至2024年间按性别和残疾状况划分的青年NEET率(未就业、未受教育或未培训的比例),为研究劳动力市场边缘化群体提供了宝贵的时间序列基础。前沿研究方向包括利用该数据构建预测模型,以识别影响NEET率的关键社会经济因素,并评估不同国家政策干预的效果。此外,数据集的细粒度分类(如性别与残疾状态交叉分析)使研究者能深入探讨青年群体内部的异质性,为联合国可持续发展目标(SDG 8.6“大幅减少青年NEET比例”)的监测与评估提供实证支撑。这一数据资源对于理解亚洲地区劳动力资源错配、推动包容性就业政策制定具有重要的学术与实践价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务