遇见数据集

electricsheepeurope/europe-ilo-une-2eap-sex-age-rt-unemployment-rate-by-sex-and-age-ilo-modelled-esti

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)模型估计的欧洲39个国家从1991年至2027年的失业率数据,按性别和年龄分类。数据集共有12,933个观测值,核心指标为“UNE_2EAP_SEX_AGE_RT”,表示失业率(百分比)。数据来源为ILOSTAT数据库,经过标准化处理,涵盖国家代码、年份、观测值、性别分类(总计、男性、女性)和年龄组等信息。数据集适用于表格分类、回归和时间序列预测等任务,并遵循CC-BY-4.0许可。

This dataset comprises unemployment rate data spanning 1991 to 2027 for 39 European countries, estimated using models from the International Labour Organization (ILO), with categorizations by gender and age group. It contains a total of 12,933 observations, with the core indicator being "UNE_2EAP_SEX_AGE_RT", which denotes the unemployment rate in percentage terms. The data is sourced from the ILOSTAT database and has undergone standardization, covering information such as country codes, years, individual observations, gender classifications (total, male, female) and age groups. This dataset is suitable for tasks including tabular classification, regression and time series forecasting, and is licensed under CC-BY-4.0.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-une-2eap-sex-age-rt-unemployment-rate-by-sex-and-age-ilo-modelled-esti 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,覆盖39个欧洲国家,时间跨度从1991年至2027年,总计12933条观测记录。数据通过ILOSTAT REST API直接拉取,并依据欧洲ISO3国家代码进行过滤。ILO利用国际劳工统计学家会议(ICLS)定义的标准,对各国原始调查微观数据进行协调统一,形成模型估算的失业率指标。数据集由Electric Sheep Europe团队重新打包,以Parquet格式发布在HuggingFace平台上,便于机器学习和时间序列分析任务的直接使用。
特点
数据集包含单一核心指标——按性别和年龄划分的失业率(ILO模型估算值),并提供丰富的分类维度,如性别(总、男、女)和年龄组。每条记录都附有来源标签和观测状态标记,确保数据可追溯。时间维度覆盖过去、现在及未来展望,支持长期趋势分析和预测建模。数据集结构规范,包含国家代码、指标标签、分类变量和观测值等字段,易于进行多维度交叉分析和时间序列可视化。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数一键加载数据,并转换为Pandas DataFrame进行后续分析。典型操作包括按国家代码筛选特定国家的失业率数据,按时间排序生成单个指标的时间序列,或通过数据透视将宽表转换为国家×年份矩阵。数据集支持分类与回归任务,也可用于时间序列预测。建议在使用时引用原始ILO数据源及Electric Sheep Europe的重新打包版本,以遵守CC-BY-4.0许可协议。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部于2024年基于ILOSTAT数据库构建,经Electric Sheep Europe团队重新打包整合后发布至HuggingFace平台。其核心研究问题聚焦于欧洲39个国家在1991至2027年间按性别与年龄划分的失业率动态变化,旨在为劳动经济学、社会政策分析与时间序列预测提供标准化的基础数据资源。该数据集涵盖了12,933条观测记录,统一采用国际劳工统计学家会议(ICLS)定义进行数据协调,成为区域劳动市场研究与跨国比较的重要支撑,对理解欧洲就业结构演变及评估政策干预效果具有显著影响力。
当前挑战
当前数据集面临的核心挑战包括多源异构数据的标准化整合,即从各国劳动力调查、家庭收入调查及行政记录中提取的原始数据需统一对齐至ILO模型估计标准,这要求处理分类体系差异、时间序列不连续及异常值标记等复杂问题。构建过程中还需应对部分国家早期数据缺失造成的样本失衡,以及跨时(1991–2027年)预测中模型估计与真实观测值之间的偏差风险。此外,数据在离散性别(三值)与年龄组(如15岁以上)维度上的细粒度分解限制了高分辨率分析,且标注状态(如“临时值”)的引入增加了模型训练时的不确定性控制难度。
常用场景
经典使用场景
该数据集的核心应用在于开展欧洲劳动力市场的时空动态分析。凭借其覆盖1991至2027年39个欧洲国家的长时序面板数据,研究者可系统考察失业率在时间维度上的演变轨迹与空间维度上的异质性分布。尤其值得关注的是,数据中包含了按性别与年龄组别进行细分的观测值,使得从代际更替与性别平等的双重视角解读劳动力市场的结构性变迁成为可能。因此,这一数据集为实证经济学与劳动力社会学领域提供了不可多得的计量素材。
解决学术问题
该数据集有效回应了欧洲劳动力研究中长期悬而未决的若干核心问题。首先,它不仅揭示了各国失业率在重大经济危机(如欧元区债务危机与新冠疫情冲击)中呈现的非对称响应模式,更通过其跨度为三十余年的观测窗口,为评估周期性波动与结构性趋势的交互效应奠定了数据基础。其次,基于性别与年龄分层的失业率数据,使学者得以量化分析劳动力市场中特定群体(如青年与女性)所面临的就业脆弱性,从而推动了包容性增长与劳动力政策评估等前沿议题的深入探讨。
衍生相关工作
围绕此数据集,学术界已涌现出多类衍生性的经典研究。一类工作聚焦于构建时序预测模型,如利用Prophet、LSTM或Transformer架构对欧洲各国的失业率进行中期预测,以支撑早期预警系统的搭建。另一类则结合空间计量方法,探究跨国劳动力市场中失业率的溢出效应与集聚模式。此外,该数据也常被用作公平性机器学习研究的基准数据集,以检验预测模型在不同性别与年龄段间是否偏差过大,从而推动负责任人工智能在劳动力领域的实践落地。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务