遇见数据集

electricsheepeurope/europe-ilo-luu-xlu4-sex-edu-geo-rt-composite-rate-of-labour-underutilization-lu4-by-s

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的“其他劳动力利用不足指标”数据,具体针对欧洲地区。数据集涵盖了34个欧洲国家从1998年至2025年的28,552个观测值,核心指标为“按性别、教育程度和城乡地区划分的劳动力利用不足综合率(LU4)”(百分比)。数据通过ILOSTAT REST API获取,并过滤为欧洲国家代码,经过ILO的统计部门使用国际劳工统计学家会议(ICLS)定义进行标准化处理。数据集包含多个列,如国家代码、国家名称、数据来源、指标代码、性别分类(总计、男性、女性)、教育分类、城乡分类、年份、观测值、观测状态等,支持表格分类、回归和时间序列预测等机器学习任务。数据以年度频率发布,并包含数据质量说明,如使用最佳来源和分类列的非空条件。数据集由Electric Sheep Europe重新打包,以Parquet格式发布,便于使用Hugging Face的`load_dataset()`加载。

This dataset contains Other measures of labour underutilization data from the International Labour Organization (ILO) ILOSTAT database, specifically for Europe. It includes 28,552 observations across 34 European countries from 1998 to 2025, with the key indicator being Composite rate of labour underutilization (LU4) by sex, education and rural / urban areas (%). Data is pulled directly from the ILOSTAT REST API and filtered to Europe ISO3 country codes, harmonized by the ILOs Department of Statistics using International Conference of Labour Statisticians (ICLS) definitions. The dataset features columns such as country code, country name, source, indicator code, sex disaggregation (total, male, female), education classification, rural/urban classification, year, observed value, observation status, etc., supporting machine learning tasks like tabular classification, regression, and time-series forecasting. Data is published at annual frequency and includes quality caveats, such as the use of the best source and non-null conditions for disaggregation columns. Repackaged by Electric Sheep Europe in Parquet format for easy loading with Hugging Faces `load_dataset()`.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-luu-xlu4-sex-edu-geo-rt-composite-rate-of-labour-underutilization-lu4-by-s 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API直接获取原始指标数据,并依据国际劳工统计学家会议(ICLS)的定义对各国劳动力调查微观数据进行统一协调。数据采集范围限定于欧洲34个国家的ISO3代码,经Electric Sheep Europe团队重新打包处理,形成包含28,552条观测值的结构化表格。每条记录涵盖性别、教育程度、城乡区域等多维度分类变量,并标注数据来源、观测状态及系列中断等质量注释,确保信息的可追溯性与透明度。
特点
数据集聚焦于劳动力利用不足综合率(LU4)这一核心指标,时间跨度覆盖1998年至2025年,呈现年度频率的纵向观测。其独特之处在于融合了性别(总、男、女)、教育水平及城乡地域的三重交叉分类,提供了精细化的社会群体分析视角。数据来源标识清晰,支持区分国家劳动力调查等不同统计路径,同时包含观测值可靠性标记与系列变更说明,为研究者甄别数据质量提供了关键依据。34个欧洲国家的广泛覆盖使跨国比较与区域趋势分析成为可能。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数直接加载该数据集,并利用to_pandas方法将其转换为DataFrame格式进行灵活操作。典型应用包括按国家代码筛选特定区域数据、对LU4指标进行时间序列排序与可视化,以及通过透视表构建国家×年份的观测值矩阵,便于开展面板数据分析或回归建模。数据集内嵌的维度分类列(如sex、classif1、classif2)支持基于性别、教育或城乡分组的多层次切片分析,满足从宏观趋势到群体差异的多元研究需求。
背景与挑战
背景概述
劳动力资源的高效配置是区域经济可持续发展的基石,然而传统的失业率指标已难以全面捕捉劳动市场的真实闲置状况。在此背景下,国际劳工组织(ILO)于2025年发布了名为'欧洲劳动力利用不足综合率(LU4)按性别、教育与城乡区域划分'的数据集,由Electric Sheep Europe在HuggingFace平台重新封装整理。该数据集源自ILOSTAT权威统计数据库,汇集了欧洲34个国家自1998年至2025年间共计28,552条观测值,核心指标LU4综合反映了因时间、技能或经济环境等因素导致的劳动力未充分利用程度。通过按性别、教育水平和城乡区域的精细分层,该数据集为劳动经济学、社会政策与可持续发展目标(SDG)的实证研究提供了高分辨率的数据支撑,填补了传统指标在刻画劳动市场结构性矛盾方面的空白。
当前挑战
该数据集所应对的核心挑战在于传统失业率统计的局限性,即其无法涵盖那些因劳动时间不足、技能错配或丧失就业信心而被边缘化的劳动力群体,LU4指标的构建正是为了弥合这一鸿沟,提供更全面的劳动市场健康状况图景。在数据集构建层面,挑战源自多源异构数据的整合与标准化:数据需从各国劳动力调查、家庭收支调查及行政记录中提取,并遵循国际劳工统计学家会议(ICLS)的统一定义进行协调,确保跨国家、跨时间序列的可比性。此外,分类变量的复杂嵌套(如教育与城乡区域的交叉维度)、年份间的统计口径变动(如方法论修订导致的序列中断)以及观测值状态标记(如“不可靠”或“临时性”数据)的处理,均对数据的清洗与质量控制提出了严苛要求。
常用场景
经典使用场景
在欧洲劳动力市场的宏观分析中,该数据集的核心价值在于追踪劳动力利用不足综合率(LU4)的长期演变趋势。研究者可以借助该数据对不同性别、受教育程度以及城乡地域的群体进行精细化的比较研究,从而透视经济活动人口中潜在劳动力闲置的结构性差异。其经典用途体现在对时间序列数据的深度挖掘上,通过构建面板数据模型或进行趋势分解,能够揭示欧洲各国在1998至2025年间劳动力利用不足水平的动态变迁与周期性波动。
衍生相关工作
立足于该高质量、规范化的数据资源,学术界已衍生出一系列富有洞见的经典研究工作。其中包括运用动态面板广义矩估计算法,探讨技术进步与全球化对欧洲各国劳动力利用不足率的非对称影响;也有学者构建马尔可夫状态转换模型,以刻画劳动力市场在不同经济周期中的冷热切换特征。此外,基于性别与教育维度拆解的结构性分解方法也被广泛应用于测算人口老龄化与教育扩张对劳动力利用不足格局的长期贡献率。这些研究共同推动了劳动力市场分析方法的创新与政策评估基准的完善。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲劳动力利用不足的综合率(LU4),按性别、教育程度及城乡地域进行细致拆解,为劳动经济学领域的前沿研究提供了关键数据支撑。结合国际劳工组织对劳动力市场非充分就业形态的持续关注,该数据有助于深化对结构性失业、隐性就业不足及就业质量的地域差异的量化分析。在研究方向上,近期热点集中于利用此类长期面板数据构建时间序列预测模型,以揭示后疫情时代欧洲劳动力市场的复苏轨迹与不均等性;同时,通过结合地理与教育维度,剖析欧洲内部人口老龄化、技能错配及区域发展失衡对劳动力资源错配的驱动效应,为制定更具包容性的就业政策与教育投资策略提供了可靠的实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务