遇见数据集

electricsheepeurope/europe-ilo-eip-2eip-sex-age-nb-persons-outside-the-labour-force-by-sex-and-age-il

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲地区按性别和年龄划分的非劳动力人口的ILO建模估计数据,覆盖39个欧洲国家,时间跨度为1990年至2027年。数据集包含39,852个观测值,涉及一个核心指标(EIP_2EIP_SEX_AGE_NB),该指标表示按性别和年龄划分的非劳动力人口数量(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过统一处理,并包含国家、性别、年龄分类、年份和观测值等字段。数据集适用于表格分类、回归和时间序列预测等任务,旨在为欧洲劳动力市场研究提供机器学习就绪的数据支持。

This dataset contains ILO modelled estimates of persons outside the labour force by sex and age for Europe, covering 39 European countries from 1990 to 2027. It includes 39,852 observations with one key indicator (EIP_2EIP_SEX_AGE_NB), representing the number of persons outside the labour force by sex and age in thousands. The data is sourced from the International Labour Organizations ILOSTAT database, harmonized and includes fields such as country, sex, age classification, year, and observed value. It is suitable for tabular classification, regression, and time-series forecasting tasks, providing ML-ready data for European labour market research.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-2eip-sex-age-nb-persons-outside-the-labour-force-by-sex-and-age-il 数据集图片
构建方式
该数据集基于国际劳工组织(ILO)的ILOSTAT统计数据库构建,通过REST API从ILOSTAT服务器直接抓取原始指标数据,并筛选至欧洲39个国家的ISO3国别代码范围。数据来源涵盖劳动力调查、家庭收入调查、企业调查及行政记录等多元渠道,经ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行统一协调与建模估计,最终以年度频率呈现1990至2027年间劳动力市场之外的按性别与年龄分列的人口规模观测值,共计39,852条记录。
特点
数据集的核心特点在于其细粒度的维度拆解能力,提供性别(总、男、女)与年龄组的交叉分类,并包含观测值状态标识(如调整值),确保数据可追溯性与透明度。数据集覆盖39个欧洲国家长达38年的历史与预测时间序列,单一指标专注于劳动力市场之外人口的计量,为研究劳动力未充分利用、人口结构变化及跨国家比较提供了标准化、一致性高的基础数据。
使用方法
用户可通过Hugging Face Datasets库以load_dataset函数一键加载数据,并转换为Pandas DataFrame进行后续分析。典型操作包括按国别代码筛选单国数据、按指标排序生成时间序列并可视化、以及利用透视表构建国家×年份的矩阵,便于进行面板数据分析或跨区域对比。数据集以Parquet格式打包,兼容主流机器学习与数据科学工作流,降低了劳动力统计数据的获取与预处理门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年11月发布,经Electric Sheep Europe于2026年重新整理并托管于HuggingFace平台。数据集聚焦于欧洲39个国家1990至2027年间因性别和年龄划分的劳动力市场之外人口数量,旨在为劳动经济学、社会政策与人口统计学研究提供标准化的建模估计数据。作为ILOSTAT数据库的核心子集,它依托国际劳工统计学家会议(ICLS)统一定义,整合了各国劳动力调查、家庭收入调查等多源数据,为分析劳动参与率变化、就业结构性失衡及性别差异提供了关键维度。该数据集的出现填补了跨国劳动力市场边缘人群长期缺乏可比时序数据的空白,对理解欧洲劳动力市场的长期演变趋势具有重要学术价值,并广泛应用于联合国可持续发展目标(SDG)中体面工作指标的监测与评估。
当前挑战
数据集所解决的领域问题在于揭示劳动力市场之外的隐性失业及潜在劳动供给,传统失业率指标往往低估了经济波动与社会结构性调整对特定人群(如女性、青年及年长劳动者)的影响。通过提供长达38年的逐年时序观测,该数据集使研究者能够量化分析性别与年龄维度下的劳动参与瓶颈,甄别不同国家因制度、文化或政策导致的劳动退出差异,进而优化劳动力激活策略。在构建过程中,挑战主要源自跨国数据源的异构性:各国调查口径、问卷设计与抽样方法存在显著差异,ILO需通过复杂的统计模型对原始数据进行校准与插值,以确保跨时间与跨国的可比性。此外,数据标注中引入了‘调整值’(Adjusted)与‘源标志’等多级元数据,增加了数据质量管理的复杂性,而Electric Sheep Europe在重构时需兼顾Parquet格式的高效存储与schema的标准化,以平衡下游机器学习任务的便捷性与原始数据溯源的可信度。
常用场景
经典使用场景
该数据集聚焦于欧洲39个国家1990至2027年间按性别与年龄划分的劳动力市场外人口规模,是劳动经济学与人口统计学交叉领域的重要资源。研究者在探究劳动力参与率长期演变趋势、刻画非经济活动人口的结构性特征时,常以此数据为基础,构建面板数据模型。其横跨近四十年的年度观测值,为分析欧洲各国适龄劳动人口退出劳动力市场的动态机制提供了连续且标准化的量化支撑,尤其适合用于性别差异视角下的比较研究与时间序列分解。
实际应用
在实际应用中,该数据集为欧洲各国劳动政策制定与社会保障体系优化提供了直接的证据支撑。政策分析者可以依据不同性别与年龄段人群的离场规模,精准识别最需要就业扶持或再培训干预的脆弱群体,从而设计更具靶向性的积极劳动力市场计划。此外,跨国可比性强的长序列数据也服务于国际组织(如欧盟委员会与世界银行)开展区域劳动力市场监测、评估结构性改革成效,并用于参数化宏观经济模型中劳动力参与率的假设设定。
衍生相关工作
围绕该数据衍生的经典工作主要集中在欧洲劳动参与率的驱动因子解析与预测建模方面。许多研究利用分性别非劳动力人口序列构建了‘劳动力退出风险’指数,并以此检验社会保障慷慨程度、迁入人口结构与技术替代效应对不同年龄群体离场行为的影响。另有一批工作基于该数据集的时间跨度特点,开发了结合多变量状态空间模型与情景仿真方法,前瞻性模拟人口老龄化背景下欧洲各国劳动力资源的演化路径,为养老金可持续性分析奠定了经验基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务