遇见数据集

electricsheepeurope/europe-ilo-eip-teip-sex-edu-nb-persons-outside-the-labour-force-by-sex-and-educat

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含37,080个观测值,覆盖39个欧洲国家,时间跨度为1987年至2025年,专注于其他劳动力未充分利用指标中的按性别和教育程度划分的非劳动力人口数(单位千)这一指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并筛选欧洲国家,经过ILO的统计部门根据国际劳工统计学家会议(ICLS)定义进行标准化处理。数据集为表格形式,包含20个列,如国家代码、年份、观测值、性别分类(总计、男性、女性)、教育水平分类、数据来源标签、观测状态等,适用于表格分类、回归或时间序列预测等自然语言处理任务。数据以年度频率发布,并包含数据质量说明(如使用最佳来源、分类列仅在指标发布时非空)。数据集由Electric Sheep Europe重新打包,旨在为欧洲提供统一的、机器学习就绪的数据层。

This dataset contains 37,080 observations across 39 European countries, spanning from 1987 to 2025, focusing on the indicator Persons outside the labour force by sex and education (thousands) under the topic Other measures of labour underutilization. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via the REST API and filtered to Europe ISO3 country codes, with harmonization by ILOs Department of Statistics based on International Conference of Labour Statisticians (ICLS) definitions. The dataset is in tabular format with 20 columns, including country code, year, observed value, sex disaggregation (total, male, female), education classification, source labels, observation status, etc., suitable for tabular classification, regression, or time-series forecasting tasks. Data is published at annual frequency and includes quality caveats (e.g., use of best source, disaggregation columns non-null only when published). It is repackaged by Electric Sheep Europe as part of a unified, ML-ready data layer for Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-teip-sex-edu-nb-persons-outside-the-labour-force-by-sex-and-educat 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过其REST API直接获取指标EIP_TEIP_SEX_EDU_NB的观测数据,并依据欧洲ISO3国家代码进行筛选。数据涵盖了39个欧洲国家,时间跨度从1987年至2025年,包含37,080条观测记录。ILOSTAT基于国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一化处理,并在source.label字段中标注数据来源,如劳动力调查等,以确保数据的可追溯性与一致性。
特点
数据集以面板数据结构呈现,核心指标为按性别与教育程度划分的劳动力市场外人口数量(单位:千)。观测变量包括国家代码、年份、性别分类(总、男、女)、教育水平聚合层级以及观测值,同时附有观测状态标志和多种注释字段(如数据序列中断、方法修订等)。数据频率为年度,且对于同一国家与年份存在多个来源时,采用ILO选定的“最佳来源”,有效保障了数据质量与可比性。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数便捷加载数据,并转换为Pandas DataFrame进行后续分析。典型应用包括按国家过滤以生成特定国家的时间序列,或按性别与教育维度进行分组聚合。此外,可利用pivot_table方法重塑为以年份为行、国家为列的矩阵形式,便于进行跨国的面板数据回归与时间序列预测建模。数据集标签支持表格分类、回归及时序预测等多种机器学习任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门基于ILOSTAT数据库构建,由Electric Sheep Europe于2025年重新打包并发布至HuggingFace平台,聚焦欧洲39个国家1987至2025年间按性别与教育程度划分的劳动力市场外部人口(单位:千人)数据。ILOSTAT作为全球劳动统计的权威来源,整合了来自劳动力调查、家庭收支调查等多源数据,并遵循国际劳工统计学家会议(ICLS)定义进行标准化处理。该数据集的核心研究问题在于量化分析欧洲地区不同性别与教育背景群体在劳动力市场之外的分布特征,为劳动力利用不足的测度(如潜在劳动力与边缘附着群体)提供粒度化数据支撑,对劳动经济学、社会政策评估及可持续发展目标(SDG)中的体面工作指标研究具有重要推动作用。
当前挑战
该数据集所解决的领域问题核心挑战在于:劳动力市场外部人口(即非劳动力)的传统统计往往仅呈现总量,忽略了性别与教育维度下的结构性差异,难以揭示隐性失业、 discouraged workers等劳动力利用不足现象的深层分布。构建过程中面临的挑战包括:ILOSTAT数据来源多元(劳动力调查、行政记录等),各来源在调查设计、定义口径与采样方法上存在差异,需通过复杂的协调机制与注释标记(如note_classif、note_indicator列中的断点与修订标识)确保时序数据的可比性;部分年份或国家的观测值存在可靠性标记(如obs_status为'Unreliable'),需研究者审慎筛选;此外,跨度为近40年的面板数据可能存在指标定义变迁、教育分类标准非一致(如nonstandard education level注释)等问题,对纵向分析构成挑战。
常用场景
经典使用场景
该数据集记录了1987年至2025年间39个欧洲国家按性别与教育程度划分的劳动力市场外人口数量(单位:千人次),涵盖逾三万七千条观测值。作为国际劳工组织ILOSTAT数据库的衍生资源,它常被用于劳动力利用不足的跨国时序分析、性别差异研究以及教育分层对劳动力参与率影响的计量建模。研究人员可通过该数据集构建面板数据模型,追踪欧洲各国经济转型期非劳动力人口的结构性变迁,或在时间序列预测任务中训练模型以预判未来劳动力供给趋势。其标准化的分类体系与年度频率特性,使其成为宏观经济政策评估与劳动力市场动态模拟的理想基础数据源。
实际应用
在实际应用中,该数据集为欧洲各国劳动部门、国际组织及政策智库制定劳动力激活策略提供了数据基石。例如,欧盟委员会可借此评估不同教育背景女性重返职场的政策干预效果,各国统计局则能将其纳入失业保障金预算模型与就业服务资源分配系统。金融机构与风险管理公司利用历史趋势预测区域性劳动力紧缺风险,教育规划部门则依据不同学历层次的非劳动力人口分布调整职业培训投入方向。此外,该数据还支撑了关于人口迁徙对东欧国家劳动力市场缺口的填补效应分析,成为社会政策模拟器和劳资关系谈判中的量化参考基准。
衍生相关工作
基于该数据集已衍生出多项标志性学术工作,包括利用贝叶斯结构时间序列模型解析欧洲经济危机期间非劳动力人口激增的因果路径研究,以及运用机器学习分类算法识别不同性别-教育组合退出劳动市场的前置预警特征。相关学者还构建了包含此数据在内的多源整合面板,检验欧洲一体化进程中劳动力市场趋同假说,并发展出针对教育-性别交叉项的时空地理加权回归方法。另有工作将此数据与GDP、产业就业结构等宏觀指标关联,构建了劳动力潜在供给的预测系统,其方法论被后续的欧洲就业战略评估报告广泛引用,形成了从数据治理到政策模拟的完整研究链条。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务