遇见数据集

electricsheepeurope/europe-ilo-emp-3emp-sex-age-geo-nb-youth-employment-by-sex-age-and-rural-urban-areas

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲38个国家从1987年至2025年的青年就业数据,共31,175个观测值,涵盖1个指标(EMP_3EMP_SEX_AGE_GEO_NB),按性别、年龄和城乡地区进行细分。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,经过处理和过滤,适用于机器学习任务,如表格分类、回归和时间序列预测。数据集以表格形式组织,包括国家代码、年份、观测值、数据来源等列,并提供了数据质量说明和使用示例。

This dataset contains 31,175 observations of youth employment data across 38 Europe countries, spanning 1987–2025, covering 1 distinct indicator (EMP_3EMP_SEX_AGE_GEO_NB), disaggregated by sex, age, and rural/urban areas. The data is sourced from ILOSTAT, the ILOs central statistics database, and has been processed and filtered for machine learning readiness, with a focus on tabular classification, regression, and time-series forecasting tasks. It includes columns for country codes, years, observed values, data sources, and disaggregation dimensions, along with data quality notes and usage examples.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-3emp-sex-age-geo-nb-youth-employment-by-sex-age-and-rural-urban-areas 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API抓取指标EMP_3EMP_SEX_AGE_GEO_NB的原始数据,并依据欧洲ISO3国家代码进行地理范围过滤。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对各国劳动力调查、收支调查等微观数据进行协调与标准化,数据来源在source.label字段中清晰标注,确保每条记录的可追溯性与统计口径的一致性。Electric Sheep Europe团队完成数据抽取、模式统一及Parquet格式封装,最终以HuggingFace数据集形式发布。
特点
数据集涵盖1987年至2025年间38个欧洲国家的青年就业数据,总计31,175条观测记录。核心指标聚焦于按性别、年龄组及城乡地域划分的青年就业人数(单位为千人)。数据结构包含丰富的分类维度,如性别(总、男、女)、年龄区间(如15-29岁青年组)及地域覆盖类型(全国或城乡)。此外,数据附有观测状态标志(如不可靠值)与来源注释,便于用户评估数据质量与序列连续性。
使用方法
用户可通过HuggingFace的datasets库直接加载数据集,调用load_dataset()函数即得训练集,并可无缝转换为Pandas DataFrame进行分析。典型应用包括按国家筛选子集、针对特定指标绘制时间序列图,或者以年份为索引、国家为列进行透视操作,构建国家×年的面板数据矩阵。数据以Parquet格式存储,兼顾存储效率与读取速度,适合机器学习与时间序列预测等下游任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年整理发布,并由Electric Sheep Europe在HuggingFace平台上重新封装,旨在提供欧洲38个国家1987年至2025年间青少年就业情况的细粒度统计数据。数据集涵盖性别、年龄以及城乡地域等维度,共计31,175条观测记录,反映了ILOSTAT数据库在劳动统计领域的权威性与标准化数据采集方法。作为ILO中央统计数据库的核心组成部分,该数据集为研究欧洲青少年劳动力市场动态、城乡就业差异以及性别平等议题提供了坚实的数据基础,推动了发展经济学、劳动经济学及政策评估领域的实证研究进展。
当前挑战
研究青少年就业问题面临多维挑战:首先,该领域需要精准分解性别、年龄组与城乡地域的交互效应,以揭示结构性就业不平等现象,但原始调查数据常因样本量不足或分类标准不一而产生偏差。其次,数据集构建过程中需处理多来源数据(如劳动力调查、家庭收支调查)的整合问题,ILO虽采用ICS定义进行协调,但各国统计方法、数据质量及时间序列连续性差异显著,导致部分观测值被标记为不可靠(如U状态)。此外,近四十年的长跨度数据面临方法修订(如I11:264标识)带来的断点挑战,需通过标记注记确保时间序列分析的合理性,这对数据清洗与建模提出了额外要求。
常用场景
经典使用场景
在欧洲劳动力市场研究中,该数据集被广泛用于分析青年就业的时空演变格局。研究者可借助其涵盖38个国家、近四十年(1987-2025年)的年度观测值,按性别、年龄组及城乡地域维度进行精细拆解。经典应用包括构建面板数据模型以量化城镇化进程对青年就业的异质性影响,或利用时间序列方法探测经济周期与青年劳动参与率之间的动态关联。此外,结合ILOSTAT统一的统计口径,该数据为跨国比较青年就业结构的长期趋势提供了可靠依据。
实际应用
在实际应用中,该数据为国际组织、国家统计部门及社会研究机构提供了标准化决策支持。欧洲各国劳工部门可据此识别城乡青年就业差距的演变热点,从而定向调整职业教育与技能培训资源的配置。非政府组织在评估青年发展项目成效时,能够借助按性别与地域剖面的就业指标进行基准对比。同时,该数据集所采用的ILO定义与分类框架也便于跨数据库联动,辅助构建欧洲劳动力市场监测仪表盘。
衍生相关工作
该数据集催生了一系列衍生研究工作。在方法论层面,学者基于其多维度结构开发了针对稀疏面板数据的插补算法与稳健聚类估计量,以提高分类变量(如城乡划分)缺失时的推断精度。在应用层面,已有工作将之与教育成就数据或宏观财政数据融合,运用双重差分与合成控制法评估青年保障计划或最低工资政策在欧洲不同区域的效果。此外,它还被用作基准数据集测试时间序列预测模型在劳动力统计中的迁移学习能力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务