遇见数据集

electricsheepasia/asia-ilo-eip-neet-sex-mts-nb-youth-not-in-employment-education-or-training-neet

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个关于亚洲青年未就业、未受教育或未培训(NEET)的统计数据集,按性别和婚姻状况进行细分,单位为千。数据集包含7,905个观察值,覆盖34个亚洲国家,时间跨度为1970年至2025年,涉及1个核心指标:EIP_NEET_SEX_MTS_NB,即按性别和婚姻状况分类的青年NEET人数(千)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,该数据库是全球劳动力统计的主要来源,通过国家劳动力调查、家庭收入调查等收集数据。数据集包括国家代码、国家名称、数据来源、指标代码、性别分类、婚姻状况分类、观察年份、观测值、数据状态标志等列,并提供数据质量说明,如年度频率、最佳来源选择等。数据集旨在为研究人员和开发者提供机器学习就绪的亚洲劳动力数据,支持表格分类、回归和时间序列预测等任务。

This dataset contains statistical data on Youth not in employment, education or training (NEET) in Asia, disaggregated by sex and marital status, in thousands. It includes 7,905 observations across 34 Asian countries, spanning the years 1970 to 2025, with one key indicator: EIP_NEET_SEX_MTS_NB, representing NEET youth by sex and marital status (thousands). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), a leading global source for labour statistics, compiled from national labour force surveys, household income surveys, and other sources. The dataset features columns such as country code, country name, source code, indicator code, sex disaggregation, marital status classification, observation year, observed value, and data status flags, along with data quality notes like annual frequency and best-source selection. It is designed as a machine-learning-ready resource for Asian labour data, supporting tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-eip-neet-sex-mts-nb-youth-not-in-employment-education-or-training-neet 数据集图片
构建方式
该数据集由国际劳工组织(ILO)的ILOSTAT数据库经REST API直接抓取后,过滤出亚洲ISO3国家代码对应的子集而构建。原始数据来自各国劳动力调查、住户收入调查等官方统计资料,并依据国际劳工统计学家会议(ICLS)定义进行统一协调。数据集共包含7,905条观测记录,覆盖34个亚洲国家,时间跨度从1970年至2025年,聚焦于“未就业、未受教育或未接受培训的青年(NEET)”这一劳动力利用不足指标。每条记录均涵盖性别、婚姻状况等细分维度,并附带数据来源、观测状态及序列中断等注释信息,确保数据溯源清晰。
特点
该数据集的核心特点在于其精细的结构化设计与多维度可分析性。数据以年为单位,提供了按性别(总、男、女、其他)和婚姻状况聚合的NEET指标数值,支持时间序列分析、国别对比及分类预测任务。数据集包含17个字段,如国家代码、来源标签、指标编码、观测值及质量标志等,便于进行过滤、透视和建模。数据质量方面,仅采用ILO筛选的“最佳来源”以避免重复,但需注意数据为年度频率,且部分细分维度在特定指标下可能为空。整体上,该数据集为研究亚洲青年劳动力市场状态提供了标准化、高覆盖度的量化基础。
使用方法
该数据集可通过HuggingFace的datasets库直接加载使用,命令为`load_dataset("electricsheepasia/asia-ilo-eip-neet-sex-mts-nb-youth-not-in-employment-education-or-training-neet")`,返回的Dataset对象可转换为Pandas DataFrame进行后续操作。典型用法包括:按国家过滤数据(如`df[df["ref_area"] == "IDN"]`),对同一指标进行时间序列排序与可视化(如按`time`和`obs_value`绘图),以及将数据透视成国家×年份矩阵以便进行面板数据分析。由于数据为表格格式,同样适用于分类、回归或时间序列预测等机器学习任务,用户可根据`indicator`和`sex`等列灵活切片。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)下属的ILOSTAT数据库于2025年整理发布,经Electric Sheep Asia团队二次封装后供研究使用。其核心研究问题聚焦于亚洲34个经济体(1970至2025年间)15至24岁青年在未就业、未接受教育或培训(NEET)状态下的分布情况,并按性别与婚姻状况进行细粒度分层。作为全球劳动力统计领域的权威数据源,ILOSTAT基于国际劳动统计学家会议(ICLS)标准对各国调查微观数据进行协调处理,使得该数据集能够为劳动经济学、青年发展政策以及可持续发展目标(SDG)中的体面工作指标提供可靠的数据支撑。该数据集在劳动市场边缘群体量化分析方面具有开创性价值,尤其为亚洲地区青年失业与教育脱节问题的跨时空比较研究奠定了基础。
当前挑战
该数据集在解决青年劳动力边缘化问题方面面临多重挑战。首先,NEET指标本身难以全面反映青年发展的动态过程,其静态测度方式可能忽视隐性失业、非正规就业及教育和培训质量差异等复杂维度,导致政策干预缺乏粒度。其次,构建过程中数据质量参差不齐,部分国家(如阿富汗、巴基斯坦)受制于基础设施薄弱,年度观测频率下仅有零星记录,而国际劳工组织虽采用最优数据源筛选机制,但不同来源的统计口径与调查方法(如劳动力调查与入户调查)差异仍可能造成序列断裂,数据集中明确标注的“方法修订导致系列中断”字段正是这一难题的体现。此外,跨国家、跨年度数据在性别与婚姻状态分类上的标准化程度不一,使得精细化的层级比较面临可比性挑战。
常用场景
经典使用场景
在劳动经济学与社会政策研究领域,该数据集为分析亚洲青年未就业、未接受教育或培训(NEET)的时空格局提供了标准化数据基础。研究者可借助其按性别与婚姻状况细分的观测值,揭示不同群体在劳动力市场中的脆弱性差异。典型应用包括构建跨国面板回归模型,评估经济发展水平、教育投资与社会保障政策对NEET率的影响;或利用时间序列分解技术,识别亚洲各国青年就业危机的结构性拐点与周期性波动,从而为精准制定青年就业促进策略提供实证依据。
实际应用
在公共政策制定与社会治理层面,该数据集可为亚洲各国劳动部门及国际组织提供实时监测工具。借助年度观测数据,政策制定者可识别出NEET比例异常升高的特定性别或婚姻群体,并评估现行职业培训项目、青年就业补贴及婚育支持政策的干预效果。此外,该数据集可嵌入劳动力市场预警系统,通过机器学习算法预测未来青年失业风险的地区热点,为资源调配与危机干预争取时间窗口,尤其对经济转型期的人口大国具有显著应用价值。
衍生相关工作
基于该数据集的标准化特性,研究者已衍生出多项重要学术工作。例如,有学者利用其构建亚洲青年就业脆弱性指数,并结合地理信息系统绘制区域风险图谱;另有工作将其与教育完成率、产业升级指标融合,形成包含多维度劳动力素质的复合面板数据。这些衍生数据产品支持了关于青年就业代际传递与技能错配的因果推断研究,并推动了以ILOSTAT为核心数据的劳动力市场预测模型的开发,为后续深入探究全球化与技术进步对亚洲劳动力格局的重塑作用奠定了方法论基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务