遇见数据集

electricsheepasia/asia-ilo-eip-2eet-sex-nb-youth-not-in-employment-education-or-training-neet

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为“Youth not in employment, education or training (NEET) by sex -- ILO modelled estimates, No | Asia (ILOSTAT)”,是一个关于亚洲青年非就业、非教育或非培训(NEET)的统计数据集。它包含3,354个观测值,覆盖49个亚洲国家,时间跨度为2005年至2027年,并包含1个独立指标,即“Youth not in employment, education or training (NEET) by sex -- ILO modelled estimates, Nov. 2025 (thousands)”。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,这是一个全球劳动力统计的权威来源,涵盖了就业、失业、工资、工作时间、童工、非正规经济、社会保护、职业伤害和可持续发展目标体面工作指标等多个方面。数据集通过ILOSTAT REST API获取,并过滤为亚洲国家代码,数据经过ILO的统计部门根据国际劳工统计学家会议(ICLS)定义进行标准化处理。数据集模式包括国家代码、国家名称、来源代码、来源标签、指标代码、指标标签、性别分解、年份、观测值、观测状态等列,并支持按性别(总计、男性、女性)进行分解。数据质量方面,数据为年度频率,ILO会选择“最佳来源”处理多来源情况,分解列仅在指标发布时非空。数据集可用于表格分类、回归和时间序列预测等任务,并提供了Python代码示例进行加载、过滤和可视化。数据集采用CC BY 4.0许可证发布,原始数据归国际劳工组织所有,使用时需引用原始来源和Electric Sheep Asia的重新打包。

This dataset is titled Youth not in employment, education or training (NEET) by sex -- ILO modelled estimates, No | Asia (ILOSTAT) and is a statistical dataset focusing on youth not in employment, education, or training (NEET) in Asia. It contains 3,354 observations across 49 Asian countries, spanning the years 2005 to 2027, and includes 1 distinct indicator: Youth not in employment, education or training (NEET) by sex -- ILO modelled estimates, Nov. 2025 (thousands). The data is sourced from the International Labour Organizations (ILO) ILOSTAT database, a leading global source for labor statistics covering employment, unemployment, wages, working time, child labor, the informal economy, social protection, occupational injuries, and SDG decent work targets. The dataset was retrieved directly from the ILOSTAT REST API and filtered to Asia ISO3 country codes, with data harmonized by ILOs Department of Statistics using International Conference of Labour Statisticians (ICLS) definitions. The schema includes columns such as country code, country name, source code, source label, indicator code, indicator label, sex disaggregation, year, observed value, and observation status, with disaggregation by sex (total, male, female). Data quality notes indicate annual frequency, the use of ILO-selected best source for multiple sources, and non-null disaggregation columns only when published. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, and provides Python usage examples for loading, filtering, and pivoting data. It is released under the CC BY 4.0 license, with original data copyright belonging to the ILO, requiring citation of both the original source and the Electric Sheep Asia repackaging.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-eip-2eet-sex-nb-youth-not-in-employment-education-or-training-neet 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过其REST API接口直接拉取原始指标数据(ID: EIP_2EET_SEX_NB),并依据ISO 3166-1 alpha-3国家代码筛选出覆盖亚洲49个国家的观测值。数据集由Electric Sheep Asia团队进行清洗、标准化与再封装,所有原始微数据均经ILO依据国际劳工统计学家会议(ICLS)定义进行统一处理与来源标记,确保了跨国家与跨年份数据的可比性与可追溯性。最终形成包含3,354条观测记录的表格型数据集,涵盖2005年至2027年的年度时间序列。
特点
数据集聚焦于亚洲地区青年未就业、未接受教育或培训(NEET)的规模估算(单位:千人),并按性别(总、男、女)进行细致分组,提供了三个唯一的性别维度。每条记录包含国家代码、来源标签、指标定义、观测值、状态标记及时间戳等12个字段,结构清晰且语义完备。作为ILO的模型估算数据,该集覆盖了49个亚洲经济体的长周期趋势,且数据经过调整与统一,具有高权威性、跨区域一致性和时间连续性的显著优势。
使用方法
用户可通过HuggingFace的`datasets`库一键加载数据集,使用`load_dataset("electricsheepasia/asia-ilo-eip-2eet-sex-nb-youth-not-in-employment-education-or-training-neet")`命令即可获取训练集并转换为Pandas DataFrame。支持按国家代码(如“IDN”)筛选特定国家的记录,或按指标排序后绘制时间序列折线图。亦可利用`pivot_table`函数将数据重塑为国家×年份的矩阵形式,便于进行面板数据分析与跨国比较。数据集以CC-BY-4.0许可证发布,使用时须注明原始来源及再封装方。
背景与挑战
背景概述
该数据集聚焦于亚太地区青年失业与失学、失训状况(NEET)的追踪,由国际劳工组织(ILO)通过ILOSTAT数据库整合发布,并由Electric Sheep Asia于2025年重新封装以适配机器学习场景。涵盖49个亚洲国家从2005年至2027年的年度面板数据,包含3,354条观测记录,核心指标为按性别分层的NEET人数估计值。作为劳动力利用不足测量的重要补充,该数据集弥补了传统失业率在反映青年边缘化状态上的不足,为政策制定者和研究者提供了评估劳动力市场结构性缺陷的关键工具,尤其对亚洲这一人口结构复杂且发展不平衡的区域具有显著参考价值。
当前挑战
首要挑战在于解决NEET指标在跨国比较中的统计口径差异,各国劳动力调查所采用的定义、抽样框架和问卷设计不尽相同,ILO虽依据国际劳工统计学家会议标准进行了协调,但数据质量仍受原始来源可靠性影响。构建过程中需应对多个亚洲国家历史数据稀疏甚至缺失的问题,ILO不得不依赖模型估计来填补时间序列缺口,这引入了额外的预测不确定性。此外,数据集仅包含年度频率,无法捕捉季节性波动对青年就业状态的影响;同时,数据标注中观测状态(如“调整值”)的解释模糊性可能误导对模型估计精度的判断,需用户结合原始文献审慎解读。
常用场景
经典使用场景
在劳动经济学与青年发展研究的交叉领域,该数据集为分析亚洲青年脱离就业、教育与培训(NEET)的性别差异提供了标准化的时间序列数据。研究者常利用其覆盖49个亚洲国家2005至2027年的面板结构,构建固定效应或随机效应模型,系统考察经济发展阶段、劳动力市场制度与性别角色分工对青年NEET率的异质性影响。数据集中按性别(总、男、女)细分的观测值,使得分解性别差距的时序演变路径成为可能,为描绘亚洲青年劳动力边缘化的宏观图景奠定了坚实的数据基石。
实际应用
在实际应用层面,该数据集是国际组织、国家统计局及政策智囊团进行劳动力市场预警与干预效果评估的关键工具。例如,亚洲开发银行可据此识别特定国家或性别群体中NEET率的异常攀升,从而定向投放职业技能培训或青年创业扶持计划。各国劳工部门亦能利用逐年更新的数据追踪教育系统与就业市场之间的衔接效率,优化职业教育投资组合。在私营部门,人力资源咨询公司可结合该数据集与宏观就业指标,预判新兴经济体的青年消费潜力与技能供需缺口。
衍生相关工作
围绕该数据集已衍生出一系列具有标杆意义的学术工作,推动了青年劳动贫困测度的方法革新。最为经典的是利用其长面板特性构建的NEET状态转换矩阵,量化了青年在就业、教育与失业三类状态间的流动概率,揭示了亚洲国家普遍存在的性别粘滞现象。另有研究将其与ILO的其他劳动力利用不足指标(如潜在劳动力、时间相关就业不足)结合,构建复合的劳动力边缘化程度指数,拓展了经典失业理论的解释边界。此外,基于该数据开发的机器学习预测模型,已被用于模拟教育投资回报率在不同性别群体中的长期分异轨迹。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务