遇见数据集

electricsheepasia/asia-ilo-une-3une-sex-age-edu-nb-youth-unemployment-by-sex-age-and-education-thousa

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的亚洲青年失业统计数据,涵盖37个亚洲国家从1970年至2025年的20,265个观测值。核心指标为UNE_3UNE_SEX_AGE_EDU_NB,即按性别、年龄和教育程度分组的青年失业人数(单位:千)。数据集以表格形式组织,包括国家代码、国家名称、数据来源、指标代码、性别分类(总计、男性、女性)、年龄和教育分类、观测年份、观测值及数据状态等列。数据来源于国家劳动力调查、家庭收入调查、行政记录等,并经过ILO基于国际劳工统计学家会议(ICLS)定义进行标准化处理。数据集适用于表格分类、回归和时间序列预测等机器学习任务,由Electric Sheep Asia重新打包发布,采用CC-BY-4.0许可。

This dataset contains youth unemployment statistics for Asia from the International Labour Organization (ILO) ILOSTAT database, with 20,265 observations across 37 Asian countries spanning 1970–2025. The core indicator is UNE_3UNE_SEX_AGE_EDU_NB, representing youth unemployment by sex, age, and education (in thousands). The data is organized in tabular format with columns including country codes, country names, data sources, indicator codes, sex disaggregation (total, male, female), age and education classifications, observation year, observed values, and data status flags. Data is sourced from national labour force surveys, household income surveys, administrative records, and harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, repackaged by Electric Sheep Asia and released under the CC-BY-4.0 license.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-une-3une-sex-age-edu-nb-youth-unemployment-by-sex-age-and-education-thousa 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的旗舰统计数据库ILOSTAT,通过其REST API直接获取指标代码为UNE_3UNE_SEX_AGE_EDU_NB的青年失业数据,并依据亚洲ISO3国家代码进行地理筛选。原始数据来自各国的劳动力调查、家庭收入调查及行政记录,经ILO依据国际劳工统计学家会议(ICLS)定义进行标准化处理。Electric Sheep Asia团队负责将原始数据重新打包为Parquet格式,提供20,265条观测记录,覆盖37个亚洲国家在1970至2025年间的时间序列数据,并以统一的数据集卡片形式发布在HuggingFace平台上。
特点
该数据集最显著的特征在于其精细的多维度分层结构,涵盖性别(男性、女性、总计)、年龄(如15-29岁青年组)以及教育程度(如总教育水平)等分类变量,为深入分析不同群体间的失业差异提供了可能。数据质量层面,ILO为每个国家-年份组合指定了最佳来源,并通过备注列(如数据中断、方法论修订等)标记了观测状态和质量标识,便于用户进行严谨的因果推断。此外,数据集包含丰富的元数据列,如来源标签、指标描述和分类注释,增强了数据的可追溯性和解释性。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数一键加载数据,并利用to_pandas方法转换为DataFrame进行分析。针对特定国家,可基于ref_area列进行筛选;对于时间序列趋势分析,可对obs_value按time列排序后绘制曲线图。数据集的宽表转换支持通过pivot_table构建国家-年份矩阵,便于比较不同地区的失业动态。研究者可结合sex、classif1、classif2等分类维度进行分组统计或回归建模,以探究人力资本特征与青年失业率之间的关联。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)通过其ILOSTAT数据库编制,并由Electric Sheep Asia于2025年重新打包发布,聚焦于亚洲37个国家1970年至2025年间按性别、年龄和教育程度划分的青年失业人数(单位:千人),共计20,265条观测记录。青年失业率是衡量劳动力市场健康与社会稳定的关键指标,尤其在亚洲这一人口结构复杂、经济发展不平衡的地区,精细化失业数据对制定针对性就业政策至关重要。该数据集依托ILO统合的国际劳工统计学家会议(ICLS)定义,整合了各国劳动力调查、家户收入调查及行政记录,为研究者提供了跨国家、长时序、多维度的标准化数据资源,显著推动了劳动经济学、区域发展研究及联合国可持续发展目标(SDG)中体面工作指标的实证分析。
当前挑战
该数据集所解决的领域核心问题在于,传统失业数据多缺乏对性別、年龄与教育层次的联合拆解,难以精准描摹青年群体内部的结构性差异,而亚洲地区因数据采集标准不一、统计体系各异,更面临跨国比较的障碍。构建过程中遭遇的挑战包括:多元来源数据的一致化(如各国劳动力调查的问卷设计与季节调整方法不同)、历史缺失值的插补与标志(如某些国家早期年份数据稀疏)、以及按性别和教育分类时样本量的缩减引发的统计可靠性问题,数据集通过引入来源标志列和可靠性标记(如obs_status字段)来应对这些复杂性,但数据使用者仍需审慎对待跨年代与跨国家的可比性边界。
常用场景
经典使用场景
该数据集收录了1970年至2025年间亚洲37个国家的青年失业统计数据,按性别、年龄组别与教育层次进行细粒度分层。经典使用场景包括构建面板数据回归模型,以解析亚洲各国青年劳动力市场的结构性特征;或运用时间序列分析方法,追踪不同教育水平青年群体失业率的长期演变轨迹。研究者可借此对比东南亚、南亚与西亚等区域间的异质性,揭示经济发展阶段、教育扩张政策与青年就业之间的动态关联。
衍生相关工作
该数据集衍生出一系列具有影响力的学术工作,包括利用机器学习方法预测亚洲国家青年失业率的短期波动,以及构建结构性向量自回归模型评估教育扩张与技术进步对就业结构的交互影响。部分研究以此为基准,开发了结合性别与教育维度的不平等指数,丰富了全球青年发展指标的测度体系。另有一些工作聚焦于数据集中标注的断点与来源标记,评估ILO统计标准调整对国际比较研究结果稳健性的影响,推动了劳动统计方法论的精进。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲37国青年失业率的性别、年龄与教育维度交叉分析,为劳动经济学与可持续发展目标(SDG)研究提供了高粒度时序数据。当前前沿方向包括:利用机器学习模型预测区域青年劳动力市场波动,结合ILOSTAT方法论中的ICLS定义解析教育层级对就业弹性的异质性影响,以及通过性别与年龄分层揭示后疫情时代亚洲新兴经济体(如印度尼西亚、土耳其)的‘尼特族’(NEET)演变规律。数据覆盖1970–2025年,其长时序特性支持构建劳动力供需冲击的因果推断框架,且来源权威性(ILO官方数据)为跨区域比较研究奠定了可靠基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务