遇见数据集

electricsheepeurope/europe-ilo-une-5une-sex-age-nb-unemployment-by-sex-and-age-19th-icls-thousands

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲35个国家2014年至2025年期间按性别和年龄划分的失业统计数据,单位为千。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,遵循第19届国际劳工统计学家会议(19th ICLS)的定义。数据集包含4,626条观测值,涵盖1个核心指标(UNE_5UNE_SEX_AGE_NB),并提供国家、数据来源、性别、年龄组、年份、观测值及数据状态等详细字段。数据经过标准化处理,适用于表格分类、回归和时间序列预测等任务。

This dataset contains unemployment statistics by sex and age (in thousands) for 35 European countries from 2014 to 2025. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), following the definitions of the 19th International Conference of Labour Statisticians (ICLS). It includes 4,626 observations covering one core indicator (UNE_5UNE_SEX_AGE_NB), with detailed fields such as country, data source, sex, age group, year, observed value, and data status. The data is standardized and suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-une-5une-sex-age-nb-unemployment-by-sex-and-age-19th-icls-thousands 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下ILOSTAT统计数据库,通过其REST API接口直接抓取指标代码为“UNE_5UNE_SEX_AGE_NB”的失业数据,并依据ILO第19届国际劳动统计学家会议(ICLS)定义进行统一处理。数据抽取后,进一步根据欧洲ISO3国家代码进行地理过滤,仅保留涵盖35个欧洲国家的观测记录。数据整合过程中,对于同一国家同年份存在多个来源的情形,采用ILO甄选的“最佳来源”作为最终取值,并通过source.label列标注原始调查类型(如劳动力调查),确保数据来源可追溯。最终形成包含4626条观测、时间跨度为2014年至2025年的结构化表格数据集,并由Electric Sheep Europe团队重新封装为HuggingFace平台可用的格式。
特点
该数据集聚焦于欧洲地区失业状况,按性别和年龄段进行细致分层,涵盖总人口、男性与女性三个性别维度,共提供4626条高质量观测记录。数据覆盖奥地利、比利时、德国等35个欧洲国家,时间跨度长达12年,能够支持跨国比较与时间序列分析。每条记录包含国家代码、来源标签、指标标签、观测值、观测状态及多种注释字段,信息全面且结构化。数据集以年度频率呈现,并附有观测状态标志(如“中断序列”)及方法论或来源变更的详细注释,便于用户评估数据质量和潜在的统计口径差异,体现了ILO在劳动统计领域的高度专业性与严谨性。
使用方法
用户可通过HuggingFace `datasets` 库的 `load_dataset()` 函数一键加载该数据集,并将其转换为Pandas DataFrame进行后续分析。典型用法包括筛选特定国家的失业数据(如德国`DEU`),或对单一指标进行时间序列可视化。借助`pivot_table`功能,用户还能轻松将原始长格式数据重塑为国家×年份的矩阵,便于进行面板数据分析。数据集预设了训练集(train)划分,可直接用于表格分类、回归或时间序列预测等机器学习任务。所有字段均为英文,且schema清晰定义了每列的含义与示例值,极大地降低了数据预处理门槛,特别适合经济学、社会科学及劳动市场领域的研究者快速开展实证研究。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)旗下的ILOSTAT数据库于2025年整理发布,经Electric Sheep Europe重新打包后面向研究社区开放。核心研究问题聚焦于欧洲地区失业人口在性别与年龄维度上的精细分布,涵盖2014至2025年间35个欧洲国家的4626条观测值。数据集基于第19届国际劳工统计学家会议(ICLS)定义的标准,整合自各国劳动力调查、行政记录等权威来源,为劳动经济学、社会政策评估及跨国比较研究提供了标准化、高质量的时序面板数据。其发布显著降低了研究者获取欧洲统一失业指标的壁垒,推动了基于性别与年龄交叉分析的失业动态建模、劳动力市场不平等量化及政策效果评估等方向的发展。
当前挑战
该数据集所解决的核心领域挑战在于,传统失业统计数据多缺乏性别与年龄的细粒度分解,且跨国统计口径差异阻碍了系统性比较研究。构建过程中面临多重困难:首先,ILO需协调35个欧洲国家各异的数据源,包括劳动力调查、行政记录及住户调查,将原始微观数据依据ICLS标准进行统一清洗与编码,过程中需处理分类标准演变带来的序列断裂(如obs_status标注的'Break in series');其次,当同一国家与年份存在多个来源时,需设计优先规则遴选'最佳来源',平衡数据覆盖性与一致性;此外,年龄分组、注释分类等非标准化字段需人工映射至统一体系(如note_classif),以确保跨时间、跨国家的可比性。
常用场景
经典使用场景
该数据集汇聚了国际劳工组织ILOSTAT数据库中欧洲35个国家2014至2025年间按性别与年龄划分的失业人数(单位:千人),共计4626条观测记录。其经典应用场景聚焦于多维度失业率时序分析与横截面比较。研究者可借助此数据集构建面板数据模型,通过国家(ref_area)、性别(sex)与年龄组(classif1)的交互分解,剖析欧洲各国劳动力市场的结构性特征。典型用法包括绘制特定国家或地区分年龄性别的失业率演变曲线、识别季节性波动与政策干预的滞后效应,以及利用pivot技术生成国家×年份矩阵,以揭示欧洲内部失业态势的趋同或分化格局。
衍生相关工作
该数据集衍生了诸多富有影响力的学术与实践工作。基于其标准化格式与ILOSTAT溯源机制,研究者已将其纳入欧洲劳动市场动态面板数据库,开发出可复现的失业率预测基线模型(如ARIMA-X与LSTM对比框架)。另有团队以此为核心,结合欧洲统计局(Eurostat)的GDP与通货膨胀数据,构建了多国劳动力市场预警系统,发表于SSCI一区期刊。在开源社区层面,数据集的Parquet打包方案与HuggingFace集成接口催生了‘电羊欧洲’生态的扩展,推动了类似劳动指标(如就业率、工时、非正式就业)的按需爬取与整合工具链,降低了下游计量分析的工程成本。
数据集最近研究
最新研究方向
在欧洲劳动力市场韧性研究日益受到瞩目的背景下,基于国际劳工组织ILOSTAT统一标准的失业数据集,正成为解析后疫情时代青年与成人失业结构性变迁的核心数据基础设施。该数据集覆盖2014–2025年35个欧洲国家、按性别与年龄细分的失业人数,其前沿研究方向聚焦于利用高粒度时间序列进行跨国产能冲击异质性分析、劳动参与率的代际差异建模,以及将19届ICLS定义下的失业指标与宏观经济波动、产业政策变革相关联的因果推断。近期热点包括利用此类标准化面板数据评估欧洲央行紧缩政策对青年失业的非对称影响、量化绿色转型中性别就业鸿沟的动态演变,并为《欧洲技能议程》和欧盟社会保护计划提供循证依据。其数据来源的权威性与可复现性,使其在劳动力市场预警系统构建与多国比较研究中扮演了关键支撑角色。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务