遇见数据集

electricsheepeurope/europe-ilo-emp-3emp-sex-age-stu-nb-youth-employment-by-sex-age-and-school-attendance

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含关于欧洲青年就业的统计信息,具体涉及按性别、年龄和上学出勤状态分类的青年就业人数(以千计)。数据集由国际劳工组织(ILO)的ILOSTAT数据库提供,覆盖39个欧洲国家,时间跨度为1983年至2025年,共包含39,064个观测值。数据通过ILOSTAT REST API获取,并经过欧洲国家代码过滤,涵盖了唯一的指标EMP_3EMP_SEX_AGE_STU_NB。数据集结构包括国家代码、国家名称、数据来源、指标代码、性别分类、年龄分类、上学出勤状态分类、观测年份、观测值、观测状态标志以及相关注释等列,适用于表格分类、回归和时间序列预测等任务。

This dataset contains statistical information on youth employment in Europe, specifically focusing on youth employment by sex, age, and school attendance status (in thousands). Sourced from the ILOSTAT database of the International Labour Organization (ILO), it covers 39 European countries from 1983 to 2025, with 39,064 observations. Data is retrieved via the ILOSTAT REST API and filtered for European ISO3 country codes, featuring the single indicator EMP_3EMP_SEX_AGE_STU_NB. The schema includes columns such as country codes, country names, data sources, indicator codes, sex disaggregation, age classification, school attendance status classification, observation year, observed values, observation status flags, and related notes, making it suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-3emp-sex-age-stu-nb-youth-employment-by-sex-age-and-school-attendance 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过REST API直接提取指标代码为EMP_3EMP_SEX_AGE_STU_NB的原始数据,并依据欧洲ISO3国家代码进行地理筛选。ILOSTAT采用国际劳工统计学家会议(ICLS)定义的标准,对各国劳动力调查、家庭收入调查及行政记录等微观数据进行统一协调与整合,确保跨国家、跨时期的数据可比性。Electric Sheep Europe团队负责将清洗后的数据重新打包为Parquet格式,并附上标准化的数据卡片,以支持机器学习场景下的快速加载与使用。
特点
该数据集收录了1983年至2025年间39个欧洲国家的39,064条观测记录,聚焦于按性别、年龄及就学状态细分的青年就业人数(单位:千)。数据具有丰富的维度拆解能力,涵盖性别(总、男、女)、年龄段(如15-29岁青年波段)以及教育出勤状态等多个分类变量,能够支持多粒度的交叉分析。每个观测值均附带来源标签、观测状态标识及系列中断等注释信息,便于用户评估数据质量与潜在偏差,是研究欧洲青年劳动力市场长期趋势的权威来源。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数直接加载该数据集,并将其转换为Pandas DataFrame进行进一步操作。常见的使用模式包括:通过ref_area列筛选特定国家的子集(如德国DEU),利用indicator列聚焦单一指标并沿time列排序以绘制时间序列图,或通过透视表将数据重塑为国家×年份的矩阵形式,便于进行面板数据分析或构建预测模型。数据集结构清晰,列名遵循ILOSTAT命名规范,适合作为表格分类、回归及时序预测任务的训练数据源。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)发布,经Electric Sheep Europe于2025年重新整理并托管于HuggingFace平台,聚焦欧洲39个国家1983至2025年间青年就业的性别、年龄与在校状况差异。青年就业问题长期是劳动经济学与社会政策研究的核心议题,尤其在数字经济转型与后疫情时代面临严峻考验。该数据集基于ILOSTAT统一指标EMP_3EMP_SEX_AGE_STU_NB,整合了国家劳动力调查等多源数据,为跨时期、跨国别的青年劳动力市场分析提供了标准化、细颗粒度的时序观测值,成为欧洲社会政策评估与劳动力模型构建的重要基础资源。
当前挑战
该数据集当前面临的核心挑战在于多源数据的异质性整合与质量控制。不同国家的劳动力调查在抽样框架、问卷设计与统计口径上存在显著差异,尽管ILO通过ICLS定义进行协调,但同一国家不同年代的数据因方法论修订而出现序列断裂,在数据中以断裂标记形式体现。此外,年度频率限制了月度或季度波动性的捕捉,部分国家观测值因样本量不足而标记为不可靠。构建过程中还需处理指标分类维度的稀疏性问题,部分细分维度的缺失值增加了模型训练的偏倚风险,影响了多层次分析的可迁移性与统计学效力。
常用场景
经典使用场景
在劳动经济学与社会政策研究领域,该数据集最经典的应用场景是基于性别、年龄与在校状态的多维拆解维度,对欧洲青年就业模式进行时序分析与跨国比较。研究者可借助其横跨1983至2025年的长周期年度观测值,构建面板数据模型,探究不同国家间青年劳动参与率的演化轨迹,以及教育参与对就业结构变迁的调节效应。性别维度的引入使得分析能够揭示青年劳动力市场中性别不平等的动态演变,为理解代际传递与人力资本积累提供坚实的数据基础。
实际应用
在实际应用中,该数据集广泛服务于国际组织与国家级就业政策制定机构的基准分析需求。国际劳工组织成员国可利用其欧盟39国的可比指标开展青年就业目标的监测与评估,尤其适用于追踪可持续发展目标8.6(减少未就业、未受教育或培训的年轻人比例)的进展。欧洲国家劳动部门可据此识别高失业风险群体,设计性别敏感的积极劳动力市场计划,例如针对不在校女性的职业技能培训项目。此外,智库与咨询机构常以此数据构建就业弹性预测模型,模拟经济增长、数字化冲击或疫情后复苏对青年群体就业产生的异质性冲击,为政策模拟与资源分配提供实证支撑。
衍生相关工作
围绕该数据集已衍生出多项具有影响力的经典研究工作。在方法论层面,有学者基于其性别与在校状态的多维分类,开发了用于拆解就业率变动的结构分解模型,揭示了1980年代以来欧洲青年就业下行趋势中‘在校时间延长’与‘劳动力市场萎缩’的相对贡献。在实证领域,多项劳动经济学论文利用该数据分析了欧洲国家教育扩招后青年就业延迟现象,并探讨了‘过度教育’风险在不同性别组之间的分布差异。同时,该数据还被用于训练多国时序预测模型,通过长短期记忆网络等深度学习框架,提前1至3年预警青年失业率的转折点,开辟了机器学习辅助劳动政策评估的新范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务