遇见数据集

electricsheepeurope/europe-ilo-eap-3wap-sex-age-geo-rt-youth-labour-force-participation-rate-by-sex-age-a

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲38个国家从1987年至2025年的青年劳动力参与率数据,共有31,219个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,由Electric Sheep Europe重新打包。数据集的核心指标为“按性别、年龄和城乡地区划分的青年劳动力参与率(%)”,涵盖性别(总计、男性、女性)、年龄组(15-29岁)和地区类型(国家层面)等分类维度。数据结构包括国家代码、国家名称、数据来源、指标代码、指标名称、性别分类、年龄分类、地区分类、观测年份、观测值、观测状态及相关注释等字段。数据集适用于表格分类、回归和时间序列预测等任务,主要用于劳动力市场分析和政策研究。

This dataset contains youth labour force participation rate data for 38 European countries from 1987 to 2025, with 31,219 observations. The data is sourced from the International Labour Organization (ILO) ILOSTAT database and repackaged by Electric Sheep Europe. The core indicator is Youth labour force participation rate by sex, age and rural/urban areas (%), covering disaggregation dimensions such as sex (total, male, female), age group (15-29 years), and area type (national level). The dataset schema includes fields like country code, country name, data source, indicator code, indicator name, sex classification, age classification, area classification, observation year, observed value, observation status, and related notes. It is suitable for tasks such as tabular classification, regression, and time-series forecasting, primarily used for labour market analysis and policy research.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eap-3wap-sex-age-geo-rt-youth-labour-force-participation-rate-by-sex-age-a 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API直接抽取指标代码为EAP_3WAP_SEX_AGE_GEO_RT的原始数据,并依据欧洲ISO3国家代码进行地理范围过滤。数据经过ILO统计部门的标准化处理,依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行协调,并在source.label列中标注数据来源,确保每一条观测值的可追溯性。最终由Electric Sheep Europe重新打包为HuggingFace数据集,以Parquet格式发布,便于机器学习工作流直接调用。
特点
该数据集涵盖1987年至2025年间的31,219条观测记录,覆盖38个欧洲国家,聚焦于按性别、年龄及城乡地域划分的青年劳动力参与率这一核心指标。数据具备多维分类特征,包括性别(总、男、女)、年龄分组(如15-29岁青年段)以及地理覆盖类型(国家、城乡区域)。此外,数据集还提供了观测状态标记(如序列中断、临时数据)及相关注释信息,有助于用户评估数据质量与连续性,适用于时间序列分析、分类与回归建模等多种任务。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数直接加载该数据集,并将其转换为Pandas DataFrame进行后续分析。常见操作包括按国家代码过滤特定国家的子集、按时间排序绘制单个指标的时间序列图,以及利用pivot_table构建国家×年份的矩阵视图。数据集同时适用于表格分类、回归与时序预测等机器学习任务,用户可依据sex、classif1、classif2等分类维度进行分组聚合或特征工程,灵活适配多样化的研究需求。
背景与挑战
背景概述
青年劳动力参与率是衡量一国劳动力市场活力与代际公平的关键指标,尤其在性别与城乡维度上的分化,深刻影响着区域发展政策的制定。该数据集由国际劳工组织(ILO)依托其核心统计数据库ILOSTAT构建,经Electric Sheep Europe于2025年重新打包并发布于HuggingFace平台,涵盖1987至2025年间38个欧洲国家的31,219条观测记录。研究聚焦于按性别、年龄及城乡地域划分的青年劳动力参与率,旨在揭示欧洲地区青年就业的结构性差异与演变趋势。作为ILO劳动统计体系的标准化输出,该数据集不仅为时间序列预测与面板数据分析提供坚实基础,更服务于联合国可持续发展目标(SDGs)中体面劳动议题的量化评估,对劳工经济学、区域政策研究及国际比较分析具有重要支撑价值。
当前挑战
在领域问题层面,该数据集需应对青年劳动力参与率在性别与城乡维度上的高度异质性,例如女性参与率在传统保守文化区域与已实现性别平等区域间的显著差异,以及农村劳动力市场基础数据缺失所导致的模型泛化困难。构建过程中面临的核心挑战包括:多源调查数据(如劳动力调查与家庭收支调查)在方法论与定义上的不一致,需依赖ILOSTAT的ICLS定义进行跨国家、跨年份的标准化对齐;部分观测因调查方法修订或样本断裂被标记为“序列间断”状态,需谨慎处理时序分析中的数据连续性;此外,稀疏年份的观测值、缺失的城乡分类标签,以及国家间报告周期的非同步性,均增加了数据清洗与插补的复杂性。
常用场景
经典使用场景
在欧洲劳动力市场研究中,该数据集最经典的应用场景聚焦于分析青年群体(15-29岁)劳动参与率的动态变化。学者们常利用涵盖1987至2025年、横跨38个欧洲国家的面板数据,构建时间序列模型或面板回归模型,以揭示青年就业行为在不同性别和城乡维度的演进规律。这一数据体系因其丰富的时间跨度和细致的分类标识,成为追踪青年劳动力市场融入趋势、评估结构性就业政策效果的基石工具。
衍生相关工作
围绕这一数据集,衍生出一系列具有深远影响的经典研究工作。在方法论层面,研究者构建了基于该面板数据的欧洲青年劳动力市场景气指数,开发了融合多重分类变量的贝叶斯结构时间序列模型,以预测区域就业趋势。在实证分析方面,涌现出多篇探讨经济周期与青年劳动参与率非对称关系的论文,以及利用伪面板方法识别城镇化和教育扩张对女性青年就业因果效应的研究。此外,基于该数据的跨国不平等分解工作,系统量化了国家间和性别内差异对总差异的贡献,为制定分层政策的优先序提供了扎实证据。
数据集最近研究
最新研究方向
该数据集聚焦欧洲青年劳动力参与率的性别、年龄与城乡维度异质性,为劳动经济学与时间序列预测提供了权威且细粒度的面板数据基础。前沿研究领域正围绕青年就业脆弱性与绿色转型、人工智能冲击下的劳动力再配置展开,大量工作借助此类结构化的ILOSTAT整合数据构建因果推断模型与多区域预测框架,以剖析城镇化进程中青年群体的参与率分化、性别差异收敛趋势,并评估气候变化与数字技术对区域劳动力市场的非对称冲击。该数据集跨越近40年、涵盖38个欧洲国家,使其成为连接宏观统计与微观行为建模的核心桥梁,对推动包容性就业政策设计与欧盟层面人力资本监测具有不可替代的支撑作用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务