遇见数据集

electricsheepeurope/europe-ilo-pop-3wap-sex-age-lms-nb-youth-working-age-population-by-sex-age-and-labour

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含55,161个观测值,涉及39个欧洲国家的人口数据,时间跨度为1983年至2025年,覆盖1个独特指标。具体来说,数据集聚焦于青年工作年龄人口(以千计),按性别、年龄和劳动力市场状态进行细分。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取,并经过欧洲ISO3国家代码过滤。数据集包括多个维度,如国家代码、国家名称、数据来源、指标代码、性别分类、年龄分类、劳动力市场状态分类、观测年份、观测值、观测状态标志等。数据以年度频率发布,并经过ILO的标准化处理,以确保一致性和可追溯性。该数据集适用于表格分类、表格回归和时间序列预测等任务,旨在为研究者和开发者提供机器学习就绪的欧洲数据层。

This dataset contains 55,161 observations of Population data across 39 Europe countries, spanning 1983–2025, covering 1 distinct indicators. Specifically, it focuses on youth working-age population (in thousands) disaggregated by sex, age and labour market status. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via REST API and filtered to Europe ISO3 country codes. It includes dimensions such as country code, country name, data source, indicator code, sex classification, age classification, labour market status classification, observation year, observed value, observation status flags, and more. The data is published at annual frequency and harmonized by ILO for consistency and traceability. This dataset is suitable for tasks like tabular classification, tabular regression, and time-series forecasting, and is part of a unified, ML-ready data layer for Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-pop-3wap-sex-age-lms-nb-youth-working-age-population-by-sex-age-and-labour 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过REST API直接抽取指标`POP_3WAP_SEX_AGE_LMS_NB`的原始数据,并依据欧洲ISO3国家代码进行地理过滤。数据经ILO统计部门依照国际劳工统计学家会议(ICLS)定义进行统一协调与标准化处理,确保跨国比较的可靠性。Electric Sheep Europe团队进一步将原始数据重新打包为Parquet格式,并标注来源信息以增强可追溯性,最终形成包含55,161条观测值、覆盖39个欧洲国家、时间跨度从1983年至2025年的结构化表格数据集。
特点
该数据集聚焦于欧洲青年劳动年龄人口(15-29岁)按性别、年龄组和劳动力市场状态划分的详细分布,以千人为单位呈现。其特色在于内含丰富的分类维度,包括性别(总、男、女)、年龄组及劳动力市场状态,便于研究人员进行多层次交叉分析。数据质量方面,ILO采用年度频率数据,并优先选用同一国家与年份下的“最佳来源”,同时提供观测状态标志(如不可靠)及系列中断等注释信息,确保用户能够审慎评估数据可靠性。数据集规模介于10K至100K之间,适用于表格分类、回归及时间序列预测等任务。
使用方法
用户可通过HuggingFace Datasets库便捷地加载该数据集,仅需一行代码`load_dataset("electricsheepeurope/europe-ilo-pop-3wap-sex-age-lms-nb-youth-working-age-population-by-sex-age-and-labour")`即可获取训练集,并利用`to_pandas()`方法转换为DataFrame进行后续分析。典型用法包括按国家代码过滤单个国家数据(如`df[df["ref_area"] == "DEU"]`)、按指示符排序并绘制时间序列图,或通过透视表构建国家×年份的矩阵。数据集提供清晰的模式定义,涵盖地区代码、来源、指示符、性别、分类变量及观测值等18个字段,便于灵活开展定制化计算与可视化。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,依托其核心数据库ILOSTAT,于2025年经Electric Sheep Europe重新打包发布至HuggingFace平台。研究聚焦于欧洲39个国家1983至2025年间青年劳动年龄人口按性别、年龄及劳动力市场状态划分的分布情况,涵盖55,161条观测记录。作为全球劳动统计的权威来源,ILOSTAT的数据经国际劳工统计学家会议(ICLS)定义统一化处理,为劳动经济学、社会政策与人口学研究提供了标准化的跨国时序数据。该数据集的发布显著降低了研究者获取高质量欧洲劳动力市场面板数据的门槛,推动了基于证据的政策评估与跨国比较分析的深化。
当前挑战
数据集所解决的领域核心问题在于精准刻画青年群体在劳动力市场中的结构性参与状况,以应对欧洲多国面临的青年失业、就业质量波动及劳动参与率分化等社会现实。然而,构建过程中面临多重挑战:首先,各国原始调查数据在采集频率、抽样方法及统计口径上存在显著差异,需依赖ILO的统一化模型进行跨国家与跨时间的一致性校准;其次,部分年份与国家的观测值标记为“不可靠”(如obs_status字段中的U标志),且少数序列存在因方法论修订导致的断裂(如note_indicator中的记录),这要求用户在使用时需审慎处理数据质量标签;此外,数据以年频发布,无法捕捉月度或季度的短期波动,限制了在动态预测模型中的应用深度。
常用场景
经典使用场景
在欧洲劳动力市场研究的浩瀚图景中,该数据集因其对青年劳动年龄人口按性别、年龄及劳动力市场状态进行精细分层的特点,成为标准化的基准资源。经典使用场景聚焦于多维度的人口结构与就业关联分析,研究者常利用其构建时间序列模型,追踪1983至2025年间39个欧洲国家青年人口的劳动力参与、就业与失业趋势。通过结合性别划分与年龄分段(如15-29岁),该数据集支持开展跨国家、跨时期的纵向比较研究,为探索欧洲青年劳动力市场的结构性变迁提供了可靠的数据基石。
衍生相关工作
围绕该数据集衍生了一系列富有影响力的研究工作,构成了欧洲青年劳动力议题的知识图谱。经典工作包括基于面板回归模型探讨教育扩张与青年失业率之间非线性关系的跨国实证,以及运用聚类分析方法划分欧洲国家劳动力市场制度类型。近期前沿工作借助机器学习技术,利用该数据集的时间序列特征预测青年就业率拐点,并与宏观经济指标(如GDP增长率)建立关联机制。此外,该数据集常与ILOSTAT中其他指标(如工资水平、工作时长)联合使用,构建综合性劳动力市场健康指数,推动了欧洲劳动经济学研究的交叉创新与政策导向的定量建模发展。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲青年劳动年龄人口按性别、年龄及劳动力市场状态划分的细分时序数据,为劳动经济学与人口学研究提供了高颗粒度的面板数据支撑。当前前沿研究方向包括利用该数据构建动态贝叶斯结构时间序列模型,以捕捉欧洲各国青年就业率的周期性与结构性变化;结合性别平等指数,分析青年女性在劳动力市场中的参与度演变趋势;以及通过机器学习方法预测后疫情时代欧洲青年失业率的区域异质性。该数据集的发布恰逢欧盟《青年保障强化计划》与ILO全球青年就业趋势报告的热点周期,其跨年覆盖与ILO标准化方法论确保了跨国可比性,对评估各国劳动政策效力及推动SDG第八项体面工作目标的量化监测具有重要实证意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务