遇见数据集

electricsheepeurope/europe-ilo-une-3wap-sex-age-stu-rt-youth-unemployment-to-population-ratio-by-sex-age

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲39个国家从1983年至2025年的37,276条失业数据观测值,涵盖1个核心指标:UNE_3WAP_SEX_AGE_STU_RT,即按性别、年龄和上学出勤状态划分的青年失业人口比率(百分比)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤至欧洲国家。数据集包括结构化列,如国家代码、年份、性别分类、年龄组、教育出勤状态、观测值及数据质量标志。它适用于表格分类、回归和时间序列预测任务,支持劳动力市场分析和政策研究。数据以年度频率发布,经过ILO的标准化处理,确保与国际劳工统计定义一致。

This dataset contains 37,276 observations of unemployment data across 39 European countries, spanning from 1983 to 2025, and covers 1 distinct indicator: UNE_3WAP_SEX_AGE_STU_RT, which represents the youth unemployment-to-population ratio by sex, age, and school attendance status (%). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via REST API and filtered to European ISO3 country codes. It includes structured columns such as country code, year, sex disaggregation, age bands, educational attendance status, observed values, and data quality flags. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, supporting labor market analysis and policy research. Data is published at annual frequency, harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions for consistency.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-une-3wap-sex-age-stu-rt-youth-unemployment-to-population-ratio-by-sex-age 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)的ILOSTAT统计数据库,聚焦欧洲39个国家的青年失业与人口比率指标。数据通过ILOSTAT REST API直接提取,并依据欧洲ISO3国家代码进行地理筛选。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,数据来源在source.label列中清晰标注以保障可追溯性。数据集涵盖1983年至2025年间的观测值,共包含37,276条记录,以Parquet格式打包发布,由Electric Sheep Europe进行标准化封装,旨在为机器学习和时间序列分析提供可直接调用的高质量数据。
特点
数据集的核心特色在于其多维度的细粒度拆分设计,涵盖了性别(sex)、年龄组(classif1)和在校状况(classif2)三个分类维度,允许研究者深入探索不同亚群体间的差异。每个观测值均附有观测状态标志(如不可靠值)及来源注释,便于数据质量评估。数据采用年度频率,避免了月度或季度序列的波动,适合长期趋势分析。此外,数据集提供了统一的模式(schema),包括国家代码、指标标签等元数据,且所有分类列仅在指标发布对应拆分时非空,确保了结构的严谨性。
使用方法
数据集可通过HuggingFace Datasets库便捷加载,用户只需调用load_dataset函数即可将数据转换为Pandas DataFrame进行后续分析。典型使用场景包括按国家筛选(如filt对德国数据)、按单一指标进行时间序列可视化,或通过透视表生成国家×年份矩阵以观察跨国比较。由于数据以Parquet格式存储,支持高效的内存和磁盘I/O操作,适合大规模计算。用户应遵循CC-BY-4.0许可协议,并在使用时同时引用原始ILO数据源及Electric Sheep Europe的再封装版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过ILOSTAT数据库发布,经Electric Sheep Europe重新整理并托管于HuggingFace平台。其核心研究问题聚焦于欧洲39个国家1983至2025年间青年失业人口比率(按性别、年龄及在校状态分列)的跨时空演变规律。作为全球劳动统计领域的权威来源,ILOSTAT通过统一采用国际劳工统计学家会议(ICLS)的标准化定义,系统整合了各国劳动力调查与行政记录数据,为揭示青年就业结构性矛盾、评估公共政策效果提供了关键数据支撑。该数据集涵盖37,276条观测值,时间跨度逾四十年,已成为研究欧洲青年劳动力市场异质性、推动联合国可持续发展目标中体面工作议程的重要基石。
当前挑战
该数据集所解决的核心领域挑战是青年失业率统计中的精准细分与跨国可比性问题。传统指标往往仅提供单一失业率数字,无法反映性别、年龄、教育参与状态等关键维度对青年就业脆弱性的差异化影响,且各国调查口径的不一致严重阻碍了跨区域比较。数据集在构建过程中面临多重挑战:其一,需从ILOSTAT原始API中提取并过滤欧洲39国数据,面对异构来源(如劳动力调查、行政记录)的非标准化格式;其二,必须协调各国发布频率(年度为主,但部分国家数据存在季节性缺口)及修订标志(如方法论变更导致序列断裂);其三,需维护多级分类一致性,确保性别、教育状态等维度在逾四万条记录中的完整性与可追溯性,最终通过公开的许可证与标准化架构实现可复现的跨国家时态分析。
常用场景
经典使用场景
在劳动经济学与公共政策研究领域,该数据集凭借其覆盖39个欧洲国家、跨越1983至2025年的长时序观测记录,成为分析青年失业人口比率演变轨迹的经典资源。研究者常利用其按性别、年龄及在校状态细分的分层结构,构建面板数据模型或时间序列回归,以揭示不同群体在劳动力市场中的结构性差异。该数据集的年度频率特性尤其适合评估经济周期、教育扩张或制度变革对青年就业状态的长期影响,是跨国比较研究与纵向追踪分析的基石。
衍生相关工作
该数据集衍生出了一系列专注于青年劳动力市场时空建模的经典工作,如基于长短期记忆网络或Transformer架构的跨国失业率预测模型,利用其历史序列特征捕捉经济衰退后的就业韧性。在因果推断方面,有学者结合ILOSTAT的就业保护立法指数,在此数据基础上检验了就业保护严格程度对青年失业持续时间的调节效应。此外,该数据还被整合进多源社会指标数据库,用于训练可解释的机器学习模型,以识别驱动青年失业的关键经济与人口因素,推动了计算社会科学与劳动经济学的交叉发展。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲青年失业与人口比率的多维细分研究,涵盖性别、年龄及在校状态等交叉分类变量,为劳动经济学中的结构性失业、青年就业政策评估及社会公平性量化提供了高颗粒度的时序数据支撑。当前前沿方向包括利用该数据训练时序预测模型以捕捉就业市场动态波动,并结合欧盟“青年保障计划”等政策热点,分析不同教育参与状态下青年群体的劳动力市场融入路径。此外,数据集的年度跨度与39国覆盖使其在比较政治经济学中成为检验劳动力市场化改革与福利体制差异的关键实证资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务