遇见数据集

electricsheepasia/asia-ilo-eip-neet-sex-geo-nb-youth-not-in-employment-education-or-training-neet

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的统计数据,主题为其他劳动力未充分利用指标,具体聚焦于按性别和城乡区域划分的未就业、未受教育或未培训青年(NEET)。数据覆盖30个亚洲国家,时间跨度为1970年至2025年,共包含2,968个观测值。核心指标为EIP_NEET_SEX_GEO_NB,以千为单位测量NEET青年人数。数据集提供了多维度的细分信息,包括国家(通过ISO代码和名称标识)、年份、性别(总计、男性、女性等)、区域类型(如全国范围),以及数据来源和质量标志(如观测状态、备注)。数据经过ILO harmonisation处理,源自劳动力调查等国家统计源,并由Electric Sheep Asia重新打包为机器学习就绪格式,便于通过HuggingFace Datasets库直接加载和使用。

This dataset contains statistical data from the International Labour Organization (ILO) ILOSTAT database on the topic of Other measures of labour underutilization, specifically focusing on Youth not in employment, education or training (NEET) by sex and rural/urban areas. It covers 30 Asian countries from 1970 to 2025, with 2,968 observations. The core indicator is EIP_NEET_SEX_GEO_NB, measuring NEET youth in thousands. The dataset provides multi-dimensional disaggregation including country (via ISO codes and names), year, sex (total, male, female, etc.), area type (e.g., national), as well as data source and quality flags (e.g., observation status, notes). The data is harmonized by ILO using International Conference of Labour Statisticians definitions, sourced from national statistics like labour force surveys, and repackaged by Electric Sheep Asia into a machine-learning-ready format for easy loading and usage via the HuggingFace Datasets library.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-eip-neet-sex-geo-nb-youth-not-in-employment-education-or-training-neet 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下权威劳动统计数据库ILOSTAT,专注于亚洲区域青年既不就业也不接受教育或培训(NEET)的测量指标。数据通过ILOSTAT的REST API直接获取,原始指标代码为EIP_NEET_SEX_GEO_NB,并依据ISO 3166-1 alpha-3标准筛选出30个亚洲国家。ILOSTAT采用国际劳工统计学家会议(ICLS)的定义对各国劳动力调查、家庭收入调查等微观数据进行统一协调处理,数据来源在source.label列中予以标注,确保可追溯性。Electric Sheep Asia团队负责对原始数据进行了重新封装与标准化处理,最终以Parquet格式发布,涵盖1970年至2025年间共2,968条观测记录。
特点
该数据集具有鲜明的多维度分层特征,核心指标为按性别和城乡地域细分的青年NEET人数(以千计)。性别维度包含总人口、男性、女性及性别不详四类,地理维度则覆盖国家、城市、农村及国家范围以外区域。数据以年为时间粒度,提供了obs_status与note_indicator等字段,详细标注了观测状态、序列中断及方法论修订等质量信息,有助于研究者评估数据可靠性。此外,数据集来源广泛,涵盖了劳动力调查、行政记录等多种渠道,为深入理解亚洲各国青年劳动参与状况提供了丰富的比较基础。
使用方法
研究者可通过HuggingFace Datasets库便捷加载数据,使用load_dataset函数后即获得pandas DataFrame格式的完整数据集。典型分析场景包括:按国家代码过滤以聚焦单一国家的时间序列趋势,或利用indicator字段筛选特定指标后进行时间序列可视化。数据集还支持将观测值重塑为国家×年份的矩阵形式,便于进行跨国比较分析。值得注意的是,数据仅包含年度频率,且当同一国家同年份存在多个数据源时,采用ILO选定的‘最佳来源’作为标准值,保证了一致性。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)通过ILOSTAT统计数据库整理发布,经Electric Sheep Asia于2025年重新打包至HuggingFace平台。核心研究问题聚焦于亚洲地区青年未就业、未受教育及未接受培训(NEET)状况的性别与城乡差异,数据涵盖30个亚洲国家,时间跨度从1970年至2025年,包含2968条观测记录。该数据集为劳动经济学、性别平等及青年发展政策研究提供了关键数据支撑,通过标准化处理ILOSTAT的微观调查数据,助力学者与政策制定者深入分析亚洲青年劳动力闲置的结构性特征,对联合国可持续发展目标中体面工作与经济增长的监测具有重要参考价值。
当前挑战
数据集面临的核心领域挑战在于准确量化亚洲青年NEET指标的多维复杂性——不同国家的劳动力调查方法、年龄划分标准及城乡定义存在显著差异,导致跨国可比性受限。构建过程中,ILO需协调30国数据源,处理因调查方法修订导致的序列断裂(如'Break in series'标记),并应对部分国家年度数据缺失或来源不一致的问题。此外,数据仅涵盖年度频率,而月度或季度序列的缺失削弱了对短期劳动力市场波动的捕捉能力,性别与区域分类维度(如SEX_O)的稀疏性亦增加了细粒度分析的不确定性。这些挑战要求后续研究在应用时需审慎处理数据质量标志与分类变量的完整性约束。
常用场景
经典使用场景
该数据集聚焦于亚洲地区青年既未就业也未接受教育或培训(NEET)的宏观指标,按性别与城乡地域进行精细划分,涵盖1970至2025年间的2968条观测记录,覆盖30个亚洲国家。研究者通常将其作为面板数据进行跨国或跨时段的比较分析,利用时间序列预测模型如ARIMA或Prophet来揭示青年劳动力闲置的动态演变规律,同时结合分类或回归任务探索社会经济因素与NEET率之间的关联机制。
实际应用
在实际政策制定中,该数据集支持国际劳工组织及其成员国基于证据开展青年就业促进项目的效果监测。例如,政府与社会组织可借助NEET指标识别高失业风险地区,针对女性或农村青年群体设计定向技能培训计划,并评估经济发展战略对劳动力市场容纳能力的实际改善程度。
衍生相关工作
该数据集衍生出多项经典学术工作,包括利用多元回归模型检验教育普惠政策与青年NEET率下降之间的因果效应,以及采用空间计量方法揭示邻国之间的青年劳动力流动性溢出模式。此外,部分研究将其与全球经济数据库(如世界银行WDI)衔接,构造复合指数以预测区域社会稳定性与代际贫困陷阱风险。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务