遇见数据集

electricsheepasia/asia-ilo-eip-neet-sex-edu-rt-share-of-youth-not-in-employment-education-or-trai

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个关于亚洲地区青年未就业、未受教育或未培训(NEET)比例的统计数据集,由国际劳工组织(ILO)的ILOSTAT数据库提供。数据集包含5,845个观测值,覆盖37个亚洲国家,时间跨度为1970年至2025年。核心指标为EIP_NEET_SEX_EDU_RT,即按性别和教育程度细分的青年NEET比例(百分比)。数据通过ILOSTAT REST API获取,并经过处理以仅包含亚洲国家。数据集采用表格格式,包含多个列,如国家代码(ref_area)、年份(time)、观测值(obs_value)、性别(sex)、教育分类(classif1)等,并提供了数据来源、质量说明和示例代码。该数据集适用于表格分类、回归和时间序列预测等机器学习任务,旨在支持劳动力市场分析和政策研究。

This dataset contains statistical data on the share of youth not in employment, education or training (NEET) in Asia, provided by the International Labour Organization (ILO) ILOSTAT database. It includes 5,845 observations across 37 Asian countries, spanning from 1970 to 2025. The core indicator is EIP_NEET_SEX_EDU_RT, which measures the percentage of youth NEET disaggregated by sex and education level. Data is sourced via the ILOSTAT REST API and processed to include only Asian countries. The dataset is in tabular format with columns such as country code (ref_area), year (time), observed value (obs_value), sex, education classification (classif1), and includes source information, quality notes, and usage examples. It is suitable for machine learning tasks like tabular classification, regression, and time-series forecasting, supporting labor market analysis and policy research.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-eip-neet-sex-edu-rt-share-of-youth-not-in-employment-education-or-trai 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,聚焦于亚洲地区青年在就业、教育与培训领域之外的占比(NEET指标)。数据通过ILOSTAT的REST API直接拉取,获取了识别码为EIP_NEET_SEX_EDU_RT的指标,并根据亚洲国家ISO 3166-1 alpha-3国别代码进行过滤筛选。ILO依据国际劳工统计学家会议(ICLS)的定义,对原始调查微观数据进行标准化处理,并在数据集的source.label列中标注了数据来源,确保了从各国劳动力调查、家庭收支调查等多源渠道采集的数据具有高度可比性和可追溯性。
特点
该数据集囊括了1970年至2025年间亚洲37个国家的5845条观测记录,时间跨度极为宽广。其核心指标为按性别与教育程度分层的青年NEET比例,提供了SEX_T(总计)、SEX_M(男性)、SEX_F(女性)及SEX_O(其他)四种性别细分维度,以及丰富的教育分类(classif1)。数据集中还包含了观测值状态标记(obs_status)和详细的注释列(如note_classif、note_indicator),用以标识数据可靠性、统计方法变更及非标准教育层级等关键信息,极大便利了研究者对数据质量的评估与筛选。
使用方法
该数据集以HuggingFace Datasets库的标准格式发布,用户可通过`load_dataset()`函数一键加载为pandas DataFrame,极大简化了数据获取流程。基于其表格结构与时间序列特性,研究者可采用多种数据分析范式:既可针对特定国家(如印度尼西亚,代码IDN)进行子集筛选,进行国别纵向趋势分析;亦可对指标列进行透视操作,构建以年份为行、国家为列的矩阵,便于进行跨国比较研究。此外,其清晰的分类变量设计,使得按性别或教育程度进行分组统计、可视化及回归建模均十分便捷。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,经Electric Sheep Asia于2025年重新整理并发布在HuggingFace平台上。其核心研究问题聚焦于亚洲地区青年中既未就业也未接受教育或培训(NEET)的比例,并按性别和教育水平进行细分。数据集收录了1970年至2025年间37个亚洲国家的5,845条观测记录,旨在为劳动经济学、教育政策及可持续发展目标(SDGs)中的体面劳动指标提供量化支撑。依托ILOSTAT这一全球领先的劳动统计数据库,该资源为跨区域比较、时间序列分析及政策评估提供了高度协调且可复现的数据基础,对理解亚洲青年劳动力市场的结构性特征具有重要价值。
当前挑战
该数据集需应对的核心挑战在于,NEET比率作为衡量劳动力利用不足的关键指标,其构建面临多重障碍。首先,不同国家的数据来源(如劳动力调查、行政记录)在定义、调查周期和统计口径上存在差异,尤其是在非正规就业普遍的亚洲地区,数据可比性难以保障。其次,时间序列中的方法论变更与样本设计调整导致序列断裂,需要细致的标识与协调处理。此外,数据集的构建过程中面临跨37个国家、横跨55年历史数据的整合难题,包括对原始调查微观数据的标准化处理、缺失值填补以及多源数据的择优选择。这些挑战要求研究者在使用时审慎考量数据质量的标记与跨时间一致性。
常用场景
经典使用场景
该数据集的核心经典用途在于构建面向亚洲37国的青年NEET率(即未参与就业、教育或培训的青年人口比例)的多维度分析模型。研究者可借助性别、教育程度等分类变量,通过时间序列回归或面板数据分析,揭示不同国家和地区青年劳动力市场脆弱性的演变规律。由于数据覆盖1970至2025年,它为纵向比较提供了难得的历史纵深,特别适用于评估经济周期、教育政策或劳动法规对青年就业形态的长期影响。分类与回归任务可直接应用于预测性模型的训练,而非结构化数据整合后的机器学习流程也得以平顺实现。
衍生相关工作
该数据集衍生出了一系列具有影响力的学术与政策分析工作。在计量经济学领域,多位学者利用其面板结构开展空间收敛性分析,探究NEET率在国家间的扩散与收敛路径;同时,与世界经济论坛的人力资本指数、联合国开发计划署的教育指标等外部数据源的融合,催生了关于青年就业韧性预测的多变量模型。在政策实践方面,国际劳工组织(ILO)本身即基于此数据发布年度区域就业趋势报告,而亚洲多家智库则进一步将其与家庭调查微观数据结合,深入剖析“啃老”现象的职业结构性成因,推动了“青年就业保障”领域从描述性统计向因果推断的研究转型。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区青年尼特族(NEET)的性别与教育维度分布,为劳动经济学与教育政策研究提供了关键数据支撑。当前的前沿方向包括:结合性别平等与教育分层视角,揭示亚洲各国青年劳动力市场边缘化的结构性差异;利用1970-2025年长时序数据,量化评估后疫情时代青年就业韧性及政策干预效果;以及通过ILOSTAT标准化指标,推动跨国比较分析,助力联合国可持续发展目标(SDG 8)中体面工作与经济增长的监测。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务