遇见数据集

electricsheepeurope/europe-ilo-pop-3wap-sex-age-tra-nb-youth-working-age-population-by-sex-age-and-forms

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲38个国家从1991年到2025年的青年工作年龄人口数据,共计89,895条观测值。数据以千人为单位,按性别、年龄和过渡形式(如就业、教育、培训状态)进行细分。数据集来源于国际劳工组织(ILO)的ILOSTAT数据库,通过ILO的统计方法对原始调查数据进行标准化处理。数据模式包括国家代码、年份、指标值、性别分类、年龄带、过渡形式分类等列,适用于表格分类、回归分析和时间序列预测等任务。数据质量方面,为年度频率,ILO选择“最佳来源”处理多源数据,细分列仅在指标发布时非空。数据集旨在为研究欧洲劳动力市场、人口趋势和青年过渡问题提供机器学习就绪的数据支持。

This dataset contains 89,895 observations of youth working-age population data across 38 European countries, spanning from 1991 to 2025. The data is measured in thousands and disaggregated by sex, age, and forms of transition (e.g., employment, education, training status). Sourced from the International Labour Organization (ILO) ILOSTAT database, it is harmonized using ILO statistical methods. The schema includes columns such as country code, year, indicator value, sex classification, age bands, and transition forms classification, making it suitable for tabular classification, regression, and time-series forecasting tasks. Data quality notes: annual frequency, ILO-selected best source for multiple sources, and disaggregation columns are non-null only when published. It is designed to support machine learning-ready analysis of European labor markets, demographic trends, and youth transitions.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-pop-3wap-sex-age-tra-nb-youth-working-age-population-by-sex-age-and-forms 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API直接获取原生指标数据,并严格筛选至欧洲38个国家的ISO3编码范围。ILOSTAT本身对各国劳动力调查、家庭收入调查及行政记录等微观数据,依据国际劳工统计学家会议(ICLS)定义进行标准化统合,所有数据来源均在source.label列中明确标注,确保可追溯性。随后由Electric Sheep Europe团队进行重新封装与Schema规范化处理,最终以Parquet格式发布至HuggingFace平台,形成可供机器学习任务直接调用的高效数据集。
特点
本数据集收录了自1991年至2025年间,欧洲38个国家的青年劳动适龄人口统计数据,共计89,895条观测记录。其核心特点在于精细的维度拆解:指标按性别(总、男、女)、年龄组别(如15-29岁)及转型形式进行多层级划分,用户可依据classif1与classif2列获取高度结构化的分类信息。数据集还包含了观测值状态标记(如临时性、不可靠)、来源注释及序列中断等元数据,为严谨的时间序列分析与数据质量评估提供了坚实支撑。
使用方法
用户可通过HuggingFace的datasets库,使用load_dataset函数一键加载数据,并利用to_pandas方法将数据集转化为Pandas DataFrame格式,便于进行后续分析。典型操作包括:按ref_area列筛选特定国家的数据子集,按indicator、time及obs_value列构建单变量时间序列并可视化,或利用pivot_table方法将数据重塑为国家×年份的矩阵形式,以支持跨国家的面板数据分析。数据集以cc-by-4.0许可协议发布,使用时需同时引用原始ILO数据及Electric Sheep Europe的封装版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司于2025年依托ILOSTAT数据库创建,经Electric Sheep Europe重新打包后发布于HuggingFace平台,聚焦于欧洲38个国家1991至2025年间青年劳动适龄人口基于性别、年龄及转型形式的统计观测。作为全球劳动统计的权威来源,ILOSTAT整合了劳动力调查、家庭收支调查等多源行政数据,为就业、工时、非正规经济及体面工作等可持续发展目标提供关键量化支撑。该数据集收录近9万条观测记录,通过统一的分类维度(如性别、年龄分组)和标准化标识(如来源标签、数据状态标志),显著提升了微观数据在国际比较中的可操作性与复用效率。其在人口经济学、劳动市场动态及欧洲社会政策研究中具有基础性作用,尤其为分析青年群体在不同就业状态间的转型模式提供了时空粒度精细的长序列证据。
当前挑战
该数据集面临的挑战首先体现在领域问题层面:青年劳动适龄人口的界定标准(如15-29岁年龄区间)在不同国家间可能存在文化或制度差异,而转型形式分类(如受教育、就业、失业或非经济活动)的跨国一致性依赖于ILO统计会议定义的统一应用,实际数据中仍留有方法修订或来源更替导致的序列断裂(如`note_indicator`字段标注的断裂标记)。构建过程中的挑战则包括:原始数据涉及多国异构调查体系,ILO通过“最佳来源”筛选策略保障指标连续性,但这可能掩盖不同来源间的系统性偏离;观测值中频繁出现的“不可靠”状态标记表明部分国家在小区域或细分人群上的抽样误差较大;此外,数据集虽涵盖38国,但各国首次与末次观测年份参差不齐,部分国家(如瑞士条目最多)的观测密度显著高于其他区域,这种不均衡性对面板数据分析的平稳性与比较效度构成考验。
常用场景
经典使用场景
该数据集涵盖了38个欧洲国家1991年至2025年间按性别、年龄及过渡形式划分的青年劳动适龄人口数据,共包含89,895条观测记录。其经典使用场景聚焦于劳动经济学与人口统计学交叉领域的研究,研究人员可借此深入剖析欧洲青年群体在进入劳动力市场过程中的结构变迁与趋势演化。数据集以年度频率提供了统一规范的指标观测值,并附有国际劳工组织严格调和后的方法论注释与数据质量标记,为构建面板数据模型、开展跨国比较分析以及探究青年就业形态的时间序列动态提供了坚实的数据基础。
解决学术问题
该数据集有效解决了劳动经济学领域中长期存在的跨国青年人口数据碎片化与标准不统一的核心难题。在学术研究层面,它赋能学者精确刻画不同欧洲国家青年按性别与年龄细分的工作年龄人口规模,并支持探索劳动过渡形式(如从教育到就业的转换)的多元特征。基于这些高质量、经国际标准规范的数据,研究者得以构建严谨的计量模型,分析人口结构变迁对劳动力供给的深层影响,评估各国青年就业政策的实际效果,并揭示性别差异在劳动参与中的演变规律,从而为劳动力市场理论的发展与政策评估框架的完善做出贡献。
衍生相关工作
以此为基石,学术界与政策研究界已衍生出多项具有深远影响的经典工作。众多研究利用该数据集构建了欧洲青年劳动力供给的长期面板数据库,进而围绕青年NEET(Not in Employment, Education or Training)人口的成因与后果展开了跨国比较研究。另有一部分工作专注于分析性别、年龄与过渡形式之间的交互效应,揭示了在去工业化与服务业转型背景下青年就业形态的异质性变化。此外,基于该数据集所揭示的人口趋势,学者们开发了长期劳动参与率的预测模型,这些模型直接服务于各国养老金制度改革方案的设计与评估,凸显了数据驱动研究对社会治理的现实影响力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务