遇见数据集

electricsheepasia/asia-ilo-eip-neet-sex-age-nb-youth-not-in-employment-education-or-training-neet

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个关于亚洲青年未就业、未受教育或未接受培训(NEET)的统计数据集,按性别和年龄(以千计)分类。它包含3,458个观测值,覆盖35个亚洲国家,时间跨度为1970年至2025年,主要指标为EIP_NEET_SEX_AGE_NB(青年NEET数据)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲国家代码,使用国际劳工统计学家会议(ICLS)定义进行标准化处理。数据集包括国家代码、国家名称、数据来源、指标代码、性别分类、年龄分类、观测年份、观测值等字段,并提供数据质量说明,如年度频率、最佳来源选择等。该数据集适用于表格分类、表格回归和时间序列预测等任务,可用于分析亚洲青年劳动力未充分利用的趋势和模式。

This dataset is a statistical dataset on youth not in employment, education or training (NEET) in Asia, disaggregated by sex and age (in thousands). It contains 3,458 observations covering 35 Asian countries from 1970 to 2025, with the main indicator being EIP_NEET_SEX_AGE_NB (youth NEET data). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered to Asian country codes, and harmonized using International Conference of Labour Statisticians (ICLS) definitions. The dataset includes fields such as country code, country name, data source, indicator code, sex classification, age classification, observation year, observed value, and provides data quality caveats like annual frequency and best source selection. It is suitable for tasks like tabular classification, tabular regression, and time-series forecasting, and can be used to analyze trends and patterns in youth labour underutilization in Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-eip-neet-sex-age-nb-youth-not-in-employment-education-or-training-neet 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,聚焦于亚洲地区青年未就业、未受教育或培训(NEET)的状况。数据通过ILOSTAT REST API直接抽取,并依据亚洲ISO3国家代码进行过滤,最终形成了包含3,458条观测记录、覆盖35个亚洲国家、时间跨度从1970年至2025年的时序性面板数据。ILOSTAT采用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行标准化处理,并在数据集中以“source.label”列标注数据来源以保障可追溯性。数据以Parquet格式封装,经Electric Sheep Asia团队重新打包,便于机器学习与统计分析场景下的直接调用。
特点
该数据集的核心特点在于其精细的多维度分列设计。数据包含“sex”(性别)与“classif1”(年龄分组)等标准化分类变量,可支持按性别(总、男、女、其他)及年龄区间进行细致子群分析。唯一的核心指标“EIP_NEET_SEX_AGE_NB”直接量化了千人为单位的NEET青年数量,便于跨国家与跨年度的横向与纵向比较。数据集还提供了详尽的元数据字段,包括观测状态标志(如“序列中断”“方法修订”)和数据源说明,使得用户能够评估数据质量与一致性,确保研究的严谨性与可复现性。
使用方法
该数据集的使用极为便捷,可通过HuggingFace Datasets库的load_dataset()函数直接加载为pandas DataFrame对象,一行代码即可完成数据读取。加载后,用户可利用列如'ref_area'(国家代码)进行子集筛选,聚焦特定国家进行分析;亦可通过'indicator'字段过滤出唯一指标,并按'time'排序构建时序序列,便于可视化与趋势分析。此外,利用pandas的pivot_table函数,可快速将长格式数据转换为以时间为行、国家为列的宽格式矩阵,为面板数据建模或聚类分析提供直接输入。数据集遵循CC-BY-4.0许可协议,用户在使用时需正确引用原始数据来源及打包方信息。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)的ILOSTAT数据库整理发布,并由Electric Sheep Asia于2025年重新打包,聚焦于亚洲地区青年不在就业、教育或培训(NEET)状态的统计。核心研究问题围绕劳动力利用不足这一全球性议题,特别是青年群体的就业脆弱性,涵盖1970年至2025年间35个亚洲国家的3458条观测数据。作为ILO权威统计体系的一部分,该数据集为分析亚洲青年劳动力市场动态、评估可持续发展目标(SDG)中体面工作的进展提供了关键基准,对劳动经济学、公共政策及区域比较研究具有重要推动作用。
当前挑战
该数据集旨在解决青年NEET率这一劳动力市场关键指标的测量与跨国比较难题,尤其关注亚洲地区因经济结构转型、教育体系差异及性别不平等导致的青年就业脆弱性。在构建过程中,面临多重挑战:原始数据源自各国劳动力调查、行政记录等异构来源,需通过ILO统计部门按国际劳工统计学家会议(ICLS)定义进行标准化处理;数据质量受年度频率、源数据断裂(如方法论修订导致‘Break in series’标记)及分类维度(如性别与年龄组)不一致的制约;此外,部分国家数据稀疏(如仅覆盖1994年后的印度)或存在缺失,需依赖ILO的‘最佳来源’选择策略加以平衡。
常用场景
经典使用场景
在劳动经济学与教育政策研究领域,该数据集被广泛用于分析亚洲青年群体中未参与就业、教育或培训(NEET)现象的时空演变规律。研究者可借助其涵盖35个亚洲国家、跨度逾半个世纪的时间序列数据,揭示性别、年龄分层下NEET率的长期趋势与结构性差异。通过面板数据模型或贝叶斯层级回归,学者能够量化宏观经济波动、教育扩张政策及劳动力市场制度变革对青年边缘化风险的异质性影响,从而为跨区域比较研究提供坚实的实证基础。
解决学术问题
该数据集有效回应了发展经济学中关于青年人力资本闲置的量化困境。传统研究常受限于零散的国家统计数据,而本数据集通过ILOSTAT统一框架整合多源调查数据,解决了跨国可比性缺失的核心难题。它使学者得以系统考察NEET指标与贫困代际传递、社会不稳定风险之间的关联,并实证检验‘技能错配’假说——即教育系统产出与劳动市场需求之间的鸿沟如何加剧青年结构性失业。其精细的性别维度更支撑了关于女性青年‘隐形失业’的机理探索,对完善联合国可持续发展目标8(体面工作)的监测体系具有方法论贡献。
衍生相关工作
该数据集催生了多项具有影响力的衍生研究。例如,基于其时间序列与多维分类特征,学者构建了预测亚洲各国NEET率波动的机器学习和时间序列模型,实现了对未来5年青年劳动参与态势的滚动推演。此外,研究者通过融合该数据与世界银行的教育支出或GDP增长率指标,创立了评估教育投资回报率与青年就业弹性的计量经济学框架。另有工作利用其细颗粒度的国家-年份面板数据,揭示出NEET率与政治骚乱指数在部分新兴经济体中的非线性关联,为‘失意青年’假说提供了亚洲区域的经验证据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务