遇见数据集

electricsheepeurope/europe-ilo-eap-3eap-sex-age-dsb-nb-youth-labour-force-by-sex-age-and-disability-statu

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的欧洲青年劳动力统计数据,具体指标为“按性别、年龄和残疾状况划分的青年劳动力(千人)”。数据集涵盖35个欧洲国家,时间跨度为2002年至2025年,共包含17,566个观测值。数据通过ILOSTAT REST API获取,并经过过滤仅包含欧洲国家代码。数据集提供了详细的细分维度,包括性别(总计、男性、女性)、年龄组(青年年龄段:15-29岁)和残疾状况(总计)。数据以年度频率呈现,并包含原始数据来源、观测状态标志(如临时数据、不可靠数据)以及系列中断和方法修订等相关注释。数据集适用于表格分类、回归和时间序列预测等任务,旨在为研究欧洲劳动力市场、青年就业和残疾包容性提供机器学习就绪的数据支持。

This dataset contains youth labour force statistics for Europe from the International Labour Organization (ILO) ILOSTAT database, specifically the indicator Youth labour force by sex, age and disability status (thousands). It covers 35 European countries from 2002 to 2025, with 17,566 observations. Data is sourced via the ILOSTAT REST API and filtered to European country codes. The dataset provides detailed disaggregation dimensions, including sex (total, male, female), age groups (youth bands: 15-29), and disability status (total). Data is presented at annual frequency and includes source information, observation status flags (e.g., provisional, unreliable), and notes on breaks in series or methodological revisions. It is suitable for tabular classification, regression, and time-series forecasting tasks, aiming to provide machine learning-ready data for studying European labour markets, youth employment, and disability inclusion.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eap-3eap-sex-age-dsb-nb-youth-labour-force-by-sex-age-and-disability-statu 数据集图片
构建方式
本数据集通过ILOSTAT官方REST API直接获取原始指标数据,而后依据欧洲ISO3国家代码进行地理范围筛选,仅保留涵盖35个欧洲国家的观测记录。ILO统计部门依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查微观数据进行协调统一,并在source.label字段中详细标注每一条数据的原始来源,便于研究者追溯数据质量与采集方法。最终由Electric Sheep Europe将清洗与标准化后的数据打包为Parquet格式,结构化地呈现于HuggingFace平台上。
特点
该数据集聚焦于2002年至2025年间欧洲35个国家的青年劳动力参与情况,共包含17,566条观测记录,并按照性别(总、男、女)、年龄组别(如15—29岁青年区间)以及残疾状态三个维度进行细致分解。每个观测均附有观测状态标记(如临时性或不可靠标识)与方法论注释,提示序列中断或定义变更等潜在异质性,从而为时间序列分析与面板数据研究提供透明的质量评估依据。
使用方法
研究者可通过HuggingFace Datasets库中的load_dataset函数直接加载该数据集,并利用to_pandas方法将其转为熟悉的DataFrame格式进行后续操作。支持按国家代码(如DEU)进行子集筛选,亦可针对特定指标按年份排序后绘制折线图,或利用pivot_table构建以时间为行、国家代码为列的面板矩阵,从而灵活适配描述性统计、回归建模及时序预测等多种分析需求。
背景与挑战
背景概述
在全球劳动力市场日益多元化的背景下,青年群体及其与残疾状态交叉的就业参与已成为社会包容性研究的核心议题。该数据集由国际劳工组织(ILO)统计司基于ILOSTAT系统创建,经Electric Sheep Europe于2025年重新整合发布,涵盖2002至2025年间35个欧洲国家的17,566条观测记录。其核心研究问题聚焦于按性别、年龄及残疾状况细分的青年劳动力规模,旨在为劳动经济学、残疾研究及社会保障政策提供精细化的数据支撑。作为ILO全球劳动力统计体系的重要组成部分,该数据集通过标准化方法统一了各国调查数据,为跨国家、跨时段的比较分析奠定了坚实基础,对推动联合国可持续发展目标中体面工作的监测具有显著影响力。
当前挑战
该数据集所应对的核心领域挑战在于,传统劳动力指标往往忽略残疾状态这一关键维度,导致青少年就业政策难以精准触达弱势群体。构建过程中面临多重技术困难:首先,各国对‘残疾’的定义与调查方法迥异,需依赖ILO的非标准定义标识(note_classif字段)进行追溯与调和;其次,来自不同来源(如劳动力调查、家庭收支调查)的数据在采集频率、样本代表性上存在差异,ILO虽已选取‘最佳来源’但仍有数据质量注释(如‘不可靠’标记)需要研究者审慎处理;此外,由于部分国家在特定年份的方法论变更(note_indicator字段标识的序列断裂),时间序列分析的连续性受到挑战,需借助元数据层进行合理的分段建模。
常用场景
经典使用场景
该数据集在劳动力经济学与社会政策研究中被广泛用于分析欧洲青年劳动力参与率的时空演变规律。研究者常借助其按性别、年龄和残疾状态细分的分层结构,构建面板数据模型,探讨不同社会群体在劳动力市场中的结构性差异。例如,通过时间序列分解技术,可揭示2002至2025年间青年就业趋势的周期波动与长期走向。
解决学术问题
该数据集有效回应了残疾青年群体在劳动力市场中被边缘化的学术关切。传统统计资料往往因样本量不足而难以对该群体进行细致刻画,而本数据集提供了跨国可比的标准指标,使研究者得以量化残疾与非残疾青年在劳动参与率上的差距,并分析性别与年龄在此差距中的交互作用,从而为国际劳工组织倡导的包容性就业政策提供实证基础。
衍生相关工作
该数据集已衍生出一系列围绕青年就业影响因素的计量经济学研究,其中最具代表性的是利用双重差分法评估《欧洲残疾战略》对青年就业率的政策效应。此外,部分工作引入机器学习中的随机森林与梯度提升模型,基于历史数据预测未来劳动力供给缺口,为劳动力市场的提前规划提供了前瞻性工具。这些工作进一步推动了跨学科方法论在劳动经济学中的应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务