遇见数据集

electricsheepeurope/europe-ilo-eip-3eip-sex-age-geo-nb-youth-outside-the-labour-force-by-sex-age-and-rura

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含关于欧洲38个国家在1987年至2025年期间的“其他劳动力未充分利用指标”数据,共有31,159个观测值,覆盖1个具体指标:按性别、年龄和城乡区域划分的未参与劳动力青年人数(千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,该数据库是全球劳动力统计的主要来源,整合了就业、失业、工资、工作时间等多个领域的指标。数据集通过ILOSTAT REST API获取,并过滤为欧洲国家代码,使用国际劳工统计学家会议(ICLS)定义进行标准化。数据结构包括国家代码、国家名称、来源代码、指标代码、性别分类(总计、男性、女性)、年龄分类、区域类型、观测年份、观测值、观测状态等列。数据以年度频率发布,并提供了数据质量注意事项,如某些指标可能有多源数据,ILO会选择“最佳来源”。数据集旨在支持表格分类、回归和时间序列预测等任务,适用于研究欧洲劳动力市场趋势。

This dataset contains 31,159 observations of Other measures of labour underutilization data across 38 Europe countries, spanning from 1987 to 2025, covering 1 distinct indicator: Youth outside the labour force by sex, age and rural / urban areas (thousands). The data is sourced from ILOSTAT, the International Labour Organizations central statistics database, which is a leading global source for labour statistics, harmonizing indicators across employment, unemployment, wages, and other areas. Data is pulled directly from the ILOSTAT REST API and filtered to Europe ISO3 country codes, using International Conference of Labour Statisticians (ICLS) definitions for standardization. The schema includes columns such as country code, country name, source code, indicator code, sex disaggregation (total, male, female), age classification, area type, observation year, observed value, and observation status. The data is annual frequency, with caveats on data quality, such as the use of ILO-selected best source when multiple sources exist. It is designed for tabular classification, regression, and time-series forecasting tasks, supporting research on European labour market trends.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-3eip-sex-age-geo-nb-youth-outside-the-labour-force-by-sex-age-and-rura 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,聚焦于欧洲地区青年(15-29岁)因性别、年龄及城乡区域差异而游离于劳动力市场之外的人数统计(单位:千人)。数据通过ILOSTAT官方REST API直接采集,经筛选仅保留欧洲38个国家的ISO3代码对应的观测记录。ILOSTAT依据国际劳工统计学家会议(ICLS)标准对原始调查微观数据进行统一协调处理,所有原始数据来源均在`source.label`字段中予以标注,以确保数据的可追溯性与透明度。最终数据集整合为包含31,159条观测值的表格形式,覆盖1987年至2025年的年度时间跨度。
特点
该数据集具备鲜明的多维分层特征,围绕“性别”(`sex`:总、男、女)、“年龄组”(`classif1`:如15-29岁青年区间)以及“地域类型”(`classif2`:如全国、城乡区域)三大维度对指标进行细致拆解,为分析青年失业与劳动参与不足问题提供了结构化视角。数据涵盖38个欧洲国家,时间序列长达近四十年,其中部分国家观测记录超过千条,保证了跨国家、跨时段比较分析的统计效力。每个观测值均带有观测状态标记(如序列中断、数据暂定等)及附注说明,便于用户评估数据质量与潜在断点。
使用方法
研究者可通过HuggingFace Datasets库便捷加载该数据:使用`load_dataset("electricsheepeurope/europe-ilo-eip-3eip-sex-age-geo-nb-youth-outside-the-labour-force-by-sex-age-and-rura")`即可获取训练集,并可将其转化为Pandas DataFrame进行后续操作。典型应用包括:基于`ref_area`字段筛选特定国家数据进行国别分析;利用`indicator`代码提取单一指标后按年份排序,绘制时间序列趋势图;还可通过`pivot_table`方法按年份与国家构建观测值矩阵,以支持跨国面板数据的回归建模或机器学习预测任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,经Electric Sheep Europe重新封装后于2025年发布,聚焦于欧洲38个国家1987至2025年间15-29岁青年因性别、年龄及城乡差异而游离于劳动力市场之外的状况。作为ILOSTAT数据库的重要子集,它提供了31,159条观测记录,以千人计的青年未参与劳动力人数为核心指标,旨在揭示劳动力利用不足这一全球性社会经济问题的区域特征。数据广泛源自国家劳动力调查、家庭收支调查及行政记录,经ILO依据国际劳工统计学家会议标准进行统一协调,为劳动经济学、人口社会学及区域发展研究提供了跨时空的定量基础,有力推动了关于青年就业与劳动力市场包容性的实证分析。
当前挑战
该数据集面临的挑战是多维度的。在领域问题层面,它致力于量化青年劳动力市场边缘化这一复杂的结构性难题,需区分因求学、家庭责任、残疾或就业信心缺失等不同原因导致的劳动参与缺失,而单一指标难以刻画其多元动因。在构建过程中,挑战体现于跨来源数据的标准化:ILO需从多国异构的调查与行政记录中提取一致定义,但各国调查方法、时序断裂与统计口径差异(如数据质量标记中的“序列断裂”与“方法论修订”)难以完全消除,且部分年份缺少月度或季度高频数据,限制了高精度时间序列建模的可能性。此外,同时兼顾国别、性别、年龄与城乡的交叉分类维度,使得稀疏数据与样本不均衡成为建模中的现实障碍。
常用场景
经典使用场景
该数据集收录了1987年至2025年间欧洲38个国家的31159条观测记录,聚焦于按性别、年龄及城乡区域划分的未进入劳动力市场的青年人口数量(单位:千人)。其经典应用场景在于时间序列分析与面板数据建模,研究者可借助该数据集追踪青年劳动力闲置现象的长期演变趋势,或通过性别与城乡维度交叉对比,揭示结构性就业障碍的地域与群体差异。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经标准化处理后可直接用于Python环境中的pandas或scikit-learn等工具,极大降低了劳动经济学入门门槛。
实际应用
在实际应用层面,该数据集对欧盟及各国劳动政策制定具有直接指导价值。政策分析师可借助不同国家与年份的对比,识别哪些性别或年龄组在特定地理区域面临最高的闲置风险,从而精准设计职业培训计划或青年就业补贴。国际组织与智库亦可将其纳入劳动力市场预警系统,结合宏观指标进行动态监测与干预效果评估。此外,这一结构化数据也适合作为机器学习回归或分类任务的训练素材,用于预测劳动力参与率的变化趋势。
衍生相关工作
该数据集衍生出的相关工作主要集中在劳动经济学与社会政策交叉领域。已有多项研究基于ILOSTAT系列数据,构建了欧洲青年就业脆弱性指数,并分析全球化、自动化对青年就业结构的冲击。此外,有学者利用类似数据开发了时空贝叶斯预测模型,用以估计未观测到的地区级失业率。在ML社区中,该数据集也被用于时间序列预测竞赛中的基线测试,推动了长序列劳动统计数据的插值方法与多源数据融合算法的改进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务