遇见数据集

electricsheepeurope/europe-ilo-luu-xlu2-sex-geo-rt-combined-rate-of-time-related-underemployment-and

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

这是一个关于欧洲34个国家的时间相关就业不足和失业综合率(LU2)的统计数据集。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,覆盖1998年至2025年,包含6,143个观测值。数据集包含一个核心指标:按性别和城乡区域划分的时间相关就业不足和失业综合率(百分比)。数据列包括国家代码、国家名称、数据来源、指标代码、指标名称、性别分类、分类变量、观测年份、观测值、观测状态等。数据集适用于表格分类、回归和时间序列预测等自然语言处理任务,主要用于分析和预测劳动力市场中的就业不足和失业情况。数据以年度频率发布,经过ILO的标准化处理,确保一致性和可比性。

This is a statistical dataset focused on the composite rate of time-related underemployment and unemployment (LU2) across 34 European countries. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), covering the period from 1998 to 2025 and containing a total of 6,143 observations. The dataset includes one core indicator: the composite rate of time-related underemployment and unemployment (expressed in percentage), categorized by gender and urban-rural regions. The data columns comprise country code, country name, data source, indicator code, indicator name, gender classification, categorical variables, observation year, observed value, observation status, and other relevant fields. This dataset is suitable for natural language processing tasks such as table classification, regression, and time series forecasting, and is primarily used for analyzing and forecasting underemployment and unemployment conditions in labor markets. It is released annually and has been standardized by the ILO to ensure consistency and comparability.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-luu-xlu2-sex-geo-rt-combined-rate-of-time-related-underemployment-and 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API接口直接获取原始数据,筛选出欧洲34个国家的ISO3代码范围,并基于国际劳工统计学家会议(ICLS)的定义对调查微观数据进行协调统一。数据涵盖了1998年至2025年间的时间序列,总计6143条观测值,每条记录包含了性别(总、男、女)和城乡区域类型的细分维度。Electric Sheep Europe团队负责了数据的重新封装与标准化处理,将其转化为便于机器学习直接使用的Parquet格式。
特点
数据集的核心特点在于其聚焦于时间相关就业不足与失业的综合率(LU2),这是衡量劳动力未充分利用状况的关键指标。数据结构严谨,包含18个字段,如国家代码、来源标注、指标定义、细分分类及观测状态标记等,确保了数据的可追溯性与高透明度。此外,数据集覆盖了长达27年的时间跨度和34个欧洲国家,提供了丰富的面板数据,支持跨国家、跨性别及跨区域的多维比较分析,且每个观测值均附有质量标记(如序列中断、方法修订),便于使用者评估数据可靠性。
使用方法
使用时,研究者可通过HuggingFace Datasets库的load_dataset()函数直接加载数据集,并快速转换为Pandas DataFrame进行后续分析。典型应用包括针对特定国家(如德国)进行子集筛选、对单个指标进行时间序列可视化,或利用数据透视表构建国家×年份的矩阵面板数据。标准化的模式设计使得数据能够无缝对接各类回归分析、分类任务或时序预测模型,尤其适用于劳动经济学领域的跨国比较研究。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)创建,由Electric Sheep Europe团队于2025年重新整理并发布在HuggingFace平台上,聚焦于欧洲34个国家从1998年至2025年间时间相关就业不足与失业的综合比率(LU2)这一核心劳动利用不足指标。作为ILOSTAT数据库的重要组成部分,该数据集整合了各国劳动力调查、家庭收入调查及行政记录等多源微观数据,经ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行统一规范化,提供了按性别和城乡区域细分的观测值,共计6,143条记录。其研究问题直指传统失业率无法全面捕捉的劳动力闲置现象,为深入理解欧洲劳动力市场的结构性问题、评估就业政策的有效性以及追踪可持续发展目标(SDG)中的体面劳动进展提供了关键数据支撑,对劳动经济学、社会政策分析和国际比较研究具有重要影响力。
当前挑战
所解决的领域问题在于,传统失业率指标难以反映因工作时间不足而被迫接受非充分就业的劳动力群体,导致对劳动市场健康度的评估存在偏差,LU2综合率通过整合时间相关就业不足与失业人群,为更全面衡量劳动利用不足提供了替代性视角。构建过程中面临的挑战包括:跨34个国家、近30年时间跨度中,不同国家劳动力调查在问卷设计、抽样方法、时间点选择上存在显著异质性,ILO需通过统一标准进行数据源判定以选择‘最佳来源’,并通过状态标签(如‘方法修订’、‘序列中断’)标记质量波动;此外,数据按性别和城乡区域细分时,部分年份或国家的分类数据存在缺失,需在保持统计可比性与数据完整性之间权衡,这些已通过详细的元数据列和观测状态码加以记录和透明化处理。
常用场景
经典使用场景
该数据集的核心应用在于探究欧洲国家劳动力市场中时间相关就业不足与失业的复合形态(LU2),提供了一个跨越1998至2025年、涵盖34个欧洲国家的年度观测面板。研究者常利用其中的‘ref_area’、‘sex’、‘time’及‘obs_value’字段,构建多维度的时间序列模型或面板数据回归,用以剖析劳动力闲置的结构性特征,并对比不同性别及城乡地域间的差异。数据集良好的结构化设计使其能够无缝衔接主流统计软件与深度学习框架,成为欧洲劳动经济学实证分析的基础性数据支撑。
解决学术问题
在学术研究中,该数据集有效破解了传统失业率指标无法全面捕捉劳动力闲置广度的困境。LU2指标融合了时间相关就业不足与失业两类状态,弥补了仅关注完全失业群体的局限性,使研究者能够更精确地评估劳动力市场的真实松弛程度。其跨年度、跨国别的纵贯结构为检验制度变迁、经济周期波动及政策干预对劳动力利用效率的异质性影响提供了宝贵素材,尤其适用于探讨欧盟一体化进程中劳动市场调整的动态机制。
衍生相关工作
这一数据集的发布衍生了一系列依托ILOSTAT标准化框架的欧洲劳动力研究。Electric Sheep Europe团队以其作为模板,打造了一套覆盖欧洲多国的统一化、机器学习就绪型数据集体系,推动了劳动统计数据的广域可复现研究。受其启发,后续工作进一步拓展了LU2指标与其他劳动力利用不足指标(如LU1、LU3)的组合分析,并催生了基于该数据集的跨国家劳动力闲置预测模型。此外,基于该数据集的时间序列分解与趋势聚类研究,也为理解欧洲内部劳动力市场的空间收敛与分化提供了新的分析框架。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务