遇见数据集

electricsheepeurope/europe-ilo-une-3une-sex-age-cat-nb-youth-unemployment-by-sex-age-and-categories-of-un

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲38个国家从1983年至2025年的青年失业统计数据,具体指标为按性别、年龄和失业者类别划分的青年失业人数(千)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤欧洲国家代码,使用国际劳工统计学家会议(ICLS)定义进行协调处理。数据集包含40,908个观测值,涵盖国家代码、国家名称、数据来源、指标代码、指标标签、性别分类、年龄分类、失业类别、观测年份、观测值、观测状态等字段。数据为年度频率,适用于表格分类、表格回归和时间序列预测等机器学习任务。

This dataset contains youth unemployment statistics for 38 European countries from 1983 to 2025, with the indicator Youth unemployment by sex, age and categories of unemployed persons (thousands). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered for European country codes, harmonized using International Conference of Labour Statisticians (ICLS) definitions. It includes 40,908 observations with fields such as country code, country name, data source, indicator code, indicator label, sex classification, age classification, unemployment category, observation year, observed value, and observation status. The data is annual frequency and suitable for machine learning tasks like tabular classification, tabular regression, and time-series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-une-3une-sex-age-cat-nb-youth-unemployment-by-sex-age-and-categories-of-un 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过REST API直接抽取标识符为`UNE_3UNE_SEX_AGE_CAT_NB`的原始指标数据,并依据欧洲ISO3国家代码进行地理过滤。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义标准,对各国劳动力调查的微观数据进行系统化协调与归一化处理,从而保障跨国数据的可比性。数据集中每一观测均附有`source.label`字段,用于标注原始数据来源(如劳动力调查),以增强数据溯源的可追溯性。
特点
本数据集囊括了38个欧洲国家从1983年至2025年间共计40,908条观测记录,聚焦于青年失业率这一核心劳动经济指标,并按照性别、年龄组及失业者类型进行了多维度细分。数据涵盖`sex`(总、男、女)等分类维度,且提供了观测值的状态标注(如临时性、不可靠性)及系列断裂注释,有助于研究者审慎评估数据质量。数据集以年度频率发布,并优先采用ILO指定的“最佳来源”以减少多源冲突。
使用方法
用户可通过HuggingFace的`datasets`库便捷载入数据集,调用`load_dataset`后即可将训练集转换为Pandas DataFrame以开展后续分析。支持对单一国家(如德国`DEU`)进行切片过滤,或针对特定指标绘制时间序列折线图。研究者还可利用透视表功能将数据重塑为国家×年份的矩阵形式,便于进行面板数据分析或跨时期、跨区域的比较研究,从而深入探索欧洲青年失业现象的演变规律。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其核心统计数据库ILOSTAT创建,并由Electric Sheep Europe重新封装,聚焦于欧洲38个国家1983至2025年间按性别、年龄和失业类型划分的青年失业人数(单位:千人)。作为全球劳动统计的权威来源,ILOSTAT的数据经国际劳工统计学家会议定义统一整合,涵盖40,908条观测记录,为研究欧洲劳动力市场动态、评估青年就业政策以及跨国比较提供了关键基准。该数据集在社会科学、政策分析和计量经济学领域具有重大学术价值,支持时间序列分析和多维分类研究,推动了劳动经济学中关于青年失业结构性特征的深入探讨。
当前挑战
该领域面临的首要挑战在于劳动统计数据的标准化与可比性问题,不同来源的劳动力调查在抽样方法、定义偏差和时序断裂上存在差异,可能影响跨国跨期分析的稳健性。构建过程中,数据整合遇到多重障碍,包括从ILOSTAT REST API提取时需过滤欧洲国家代码、处理年度频率数据与月度序列的融合,以及应对指标源标识的异质性和观测状态标记(如临时或不可靠数据)的精准判读。此外,按性别、年龄和失业类别的细分维度导致非空字段条件复杂,需确保机器学习模型在训练和预测时避免偏差,并解决高维分类下的数据稀疏性挑战。
常用场景
经典使用场景
在劳动经济学与公共政策研究领域,该数据集最经典的用途在于构建欧洲青年失业率的时空演化模型。凭借其跨越1983至2025年、覆盖38个欧洲国家的面板数据结构,研究者能够精准剖析性别、年龄层次与失业类型对青年就业状况的差异化影响。通过将观测值按国家与年份进行矩阵化处理,可开展固定效应回归或动态面板分析,从而揭示经济周期、劳动力市场制度变迁与青年失业率之间的深层关联。
实际应用
在实际应用层面,该数据集为欧洲各国的劳动力市场监测与预警系统提供了不可或缺的输入源。政策制定者可通过分性别与年龄组的失业率时序数据,即时识别出结构性失业的高风险群体,并据此调整职业培训资源的配置方向。国际组织如欧盟委员会可借助其年度频率的面板数据,评估《欧洲青年保障计划》等干预措施的实施效果,从而优化针对青年群体的就业促进方案。此外,金融机构与社会保障部门亦能利用其预测劳动力供给趋势。
衍生相关工作
围绕该数据集已衍生出一系列具有影响力的工作。一方面,基于其时间序列特性,研究者开发了融合性别与失业类型分层信息的贝叶斯结构时间序列模型,用于预测欧洲区域性劳动力市场的波动拐点。另一方面,有学者将其与欧洲晴雨表或欧盟统计局的其他社会经济指标进行联合分析,构建了多维度劳动力脆弱性指数。此外,该数据集作为ILOSTAT经典指标序列的代表,常被用作检验新提出的面板数据插补方法或异常值检测算法的基准用例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务