遇见数据集

electricsheepeurope/europe-ilo-une-3une-sex-age-stu-nb-youth-unemployment-by-sex-age-and-school-attendanc

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲39个国家1983年至2025年期间按性别、年龄和就学状态分组的青年失业统计数据,共计37,276个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API获取并经过欧洲国家代码过滤处理。核心指标为UNE_3UNE_SEX_AGE_STU_NB,表示按性别、年龄和就学状态统计的青年失业人数(以千为单位)。数据包含国家代码、数据来源、指标代码、性别分类(总计、男性、女性)、年龄分组(15-29岁青年段)、就学状态、观测年份、观测数值及数据质量标志等字段。数据集采用国际劳工统计学家会议(ICLS)的定义进行标准化,适用于表格分类、回归和时间序列预测等机器学习任务。

This dataset contains 37,276 observations of youth unemployment statistics disaggregated by sex, age, and school attendance status for 39 European countries from 1983 to 2025. The data is sourced from the International Labour Organizations ILOSTAT database, retrieved via its REST API and filtered by European country codes. The core indicator is UNE_3UNE_SEX_AGE_STU_NB, representing youth unemployment by sex, age, and school attendance status (in thousands). The dataset includes fields such as country codes, data sources, indicator codes, sex disaggregation (total, male, female), age groups (15-29 youth band), school attendance status, observation year, observed values, and data quality flags. The data is harmonized using International Conference of Labour Statisticians (ICLS) definitions and is suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-une-3une-sex-age-stu-nb-youth-unemployment-by-sex-age-and-school-attendanc 数据集图片
构建方式
该数据集以国际劳工组织(ILO)旗下的ILOSTAT数据库为根基,通过其REST API精准提取指标代码为UNE_3UNE_SEX_AGE_STU_NB的原始观测数据。随后,依据欧洲ISO3国家代码进行地理范围过滤,仅保留覆盖39个欧洲国家的样本。为确保数据质量,ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对各国劳动力调查、家庭收入普查及行政记录等微观数据进行标准化与调和,并在source.label字段中清晰标注数据来源,以增强可追溯性。最终,经Electric Sheep Europe团队重新封装为机器学习就绪的Parquet格式,形成包含37,276条观测的时序面板数据集。
特点
该数据集跨越1983年至2025年的漫长周期,聚焦于按性别、年龄组及在校状态分层的青年失业人数(单位:千),属于细粒度分组的劳动统计指标。其结构包含丰富的维度列,如sex(总、男性、女性)与classif1(年龄段,如15-29岁)、classif2(教育出勤状态),支持多维度交叉分析。数据以年频发布,并注明了观测状态(如临时、不可靠)及序列中断等元信息,为用户评估数据质量提供了透明依据。此外,数据来源多样,涵盖劳动力调查、企业调查等,且采用ILO选定的“最佳来源”处理同一国家与年份的多源冲突,确保了核心指标的权威性。
使用方法
研究人员可通过Hugging Face的datasets库调用load_dataset()函数一键加载数据,并转换为Pandas DataFrame进行灵活操作。针对具体分析需求,可基于ref_area字段按国家筛选子集,例如提取德国的时间序列;亦可利用obs_value与time字段绘制单个指标的趋势图。若需构建国家间对比的面板数据,推荐对indicator筛选后使用pivot_table方法生成年份对国家的矩阵表。该数据集天然适用于时序预测、分类回归等任务,其标准化的Schema设计使得从探索到建模的流程无缝衔接,极大降低了劳动经济学与社会科学研究的工程成本。
背景与挑战
背景概述
青年失业问题一直是欧洲社会经济政策的核心议题,尤其是在全球金融危机、新冠疫情以及数字化浪潮等多重冲击下,青年群体面临的就业困境愈发凸显。由国际劳工组织(ILO)统计部门维护的ILOSTAT数据库,作为全球劳动统计的权威来源,系统性地收集并整合了各国劳动力调查、家庭收入调查及行政记录等多源数据。在此背景下,Electric Sheep Europe于2025年基于ILOSTAT官方API,针对39个欧洲国家重新整理并发布了该数据集,收录了1983年至2025年间共计37,276条观测记录,聚焦于按性别、年龄及在校状态划分的青年失业人数(单位:千人)。该数据集严格遵循ILO第19届国际劳工统计学家会议(ICLS)定义标准,通过一致化的分类体系(如性别、年龄组与教育参与度)实现了跨国比较的可能性,为政策制定者、经济学家及社会科学研究者提供了理解欧洲青年劳动力市场演变与结构性特征的高质量数据基础。
当前挑战
该数据集所面向的核心领域挑战在于,青年失业问题本身具有高度的异质性与动态性,不同国家在劳动力市场制度、教育体系衔接及社会福利政策等方面的差异,使得对失业现象的归因与预测变得极为复杂。具体而言,首先,数据构建过程中面临的最大挑战是源数据的跨国产出一致性问题——各国劳动力调查的采样方法、问卷设计及统计口径存在历史性差异,ILO虽然通过ICLS标准进行统一,但部分观测值仍标注为“不可靠”(U)或存在“序列断裂”(Break in series),研究者需审慎处理这些质量标注。其次,数据所反映的失业统计仅涵盖“积极寻找工作”且“可立即上岗”的青年,未能捕捉到“隐性失业”(如因绝望而退出劳动力市场者)或非正规就业形态,这限制了模型对真实就业困境的刻画能力。此外,时间跨度长达42年且包含39个国家的非平衡面板结构,导致数据稀疏性问题——早期年份和较小经济体的观测密度显著低于近年与大国,使得时间序列分析与跨域推理面临显著的样本选择偏误风险,要求建模时嵌入稳健的缺失值处理与异方差控制策略。
常用场景
经典使用场景
该数据集收录了1983年至2025年间39个欧洲国家关于青年失业状况的详尽时序观测数据,共计37,276条记录,按性别、年龄段及在校状态进行精细分层。在劳动经济学与教育经济学交叉领域中,研究者常借助该数据构建面板回归模型或时间序列预测模型,系统考察青年劳动力市场的结构特征与演变趋势。数据集中包含的ILOSTAT标准化指标,使得跨国比较与长期动态分析成为可能,为定量揭示欧洲各国青年就业政策的异质性效果奠定了坚实基础。
解决学术问题
该数据集有效解决了欧洲青年失业研究中长期存在的跨国产出可比性不足与时间跨度碎片化的核心难题。通过提供统一口径的序列化失业指标及其多维分解信息(性别、年龄、教育参与状态),研究者得以更精准地评估宏观经济冲击、教育扩张、劳动力市场制度变革等变量对青年就业结果的影响。其应用显著推动了关于NEET群体(未就业、未受教育、未培训)成因的国际比较研究,并对理解结构性失业随生命周期的演化路径提供了宝贵的数据支撑。
衍生相关工作
立足于该数据集的丰富时空结构,学术界派生了一系列具有影响力的研究范式与分析工具。围绕其面板数据特征,衍生出关于欧洲青年失业聚合指标的构建与分解方法,推动了动态因子模型与贝叶斯结构时间序列模型在劳动统计领域的应用。此外,还催生了对数据源中涉及的调查方法差异与序列断点衔接问题的系统探讨,促进了ILO统计标准在国际比较研究中的更广泛采用,成为连接微观调查微观数据与宏观政策评估的重要桥梁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务