遇见数据集

electricsheepeurope/europe-ilo-luu-xlu4-sex-nb-composite-measure-of-labour-underutilization-lu4-b

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含2,334个观测值,涉及欧洲37个国家的劳动力未充分利用(LU4)复合度量数据,时间跨度为1991年至2025年,涵盖1个指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤欧洲国家代码。数据集包含多个列,如国家代码、指标、性别、年份、观测值等,用于表格分类、回归和时间序列预测任务。数据以英文为主,已通过Electric Sheep Europe重新打包,便于机器学习使用。

This dataset contains 2,334 observations of composite measure of labour underutilization (LU4) by sex (thousands) data across 37 Europe countries, spanning 1991–2025, covering 1 distinct indicators. The data is sourced from ILOSTAT, the ILOs central statistics database, pulled via API and filtered to Europe ISO3 country codes. It includes columns such as country code, indicator, sex, year, and observed value, and is designed for tabular classification, regression, and time-series forecasting tasks. The dataset has been repackaged by Electric Sheep Europe for ML-ready use.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-luu-xlu4-sex-nb-composite-measure-of-labour-underutilization-lu4-b 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过REST API接口直接提取了劳动力利用不足综合指标(LU4)的数据,并过滤出37个欧洲国家的观测记录。数据集构建过程中,ILOSTAT依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行规范化处理,并标记数据来源以确保可追溯性。最终,由Electric Sheep Europe团队重新打包并发布,形成了包含2,334条观测、覆盖1991年至2025年时间跨度的结构化表格数据。
特点
该数据集的核心特点在于其聚焦欧洲地区劳动力利用不足的综合度量,按性别(男性、女性、总计)进行细分,提供了唯一的关键指标——LU4(以千人为单位)。数据涵盖了37个欧洲国家,具有较长的时间跨度,且每个观测都包含了详尽的信息,如国家代码、数据来源、指标标签、观测值、观测状态及相关注释,便于用户进行多维度分析与质量控制。数据以Parquet格式存储,并遵循CC-BY-4.0许可协议,有利于学术研究与商业应用。
使用方法
用户可通过HuggingFace Datasets库便捷地加载该数据集,使用`load_dataset`函数即可将数据导入为DataFrame格式。在此基础上,可依据国家代码(ref_area)筛选特定国家的数据,进行国家间的比较分析;也可按时间序列对单一指标进行趋势观察与可视化。此外,通过数据透视功能,能够将数据重塑为国家×年份的矩阵形式,便于进行面板数据分析或计量经济学建模。代码示例清晰展示了从数据加载到清洗与分析的全流程,极大降低了使用门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,依托其核心数据库ILOSTAT,由Electric Sheep Europe于2025年重新整合发布,旨在提供欧洲37个国家1991至2025年间劳动力利用不足的综合测量指标(LU4),并按性别进行细分。作为全球劳动力统计的权威来源,ILOSTAT通过统一国际劳工统计学家会议(ICLS)定义,对各国劳动力调查、家计调查等微观数据进行协调处理,确保跨国可比性。该数据集聚焦于传统失业率之外更广泛的劳动力利用不足现象,为分析隐性失业、不充分就业等结构性劳动力问题提供了标准化、高频次的时序数据,对欧洲劳动经济学研究、劳动力市场政策评估及国际比较具有重要支撑作用。
当前挑战
该数据集主要挑战在于:1)所解决的领域问题方面,传统失业率指标难以全面反映劳动力市场的真实困难,例如被迫兼职、因市场原因放弃求职等隐性利用不足情形,而构建综合LU4指标需要整合多维度信息,对数据源的协调性和定义一致性要求极高,ILOSTAT虽提供最佳来源选择,但不同国家调查方法、样本框架的差异仍可能造成可比性偏差;2)构建过程中,数据来源复杂多样,涵盖劳动调查、行政记录等多种渠道,时间跨度长达35年,期间各国统计标准、分类体系及调查方案可能发生变动(如断裂标记'Break in series'所示),需依赖ILO专家团队持续进行数据清洗、插补与版本管理,同时确保37个国家每年观测值的完整性与时效性,对数据治理能力提出了严峻考验。
常用场景
经典使用场景
劳动力利用不足的综合测度(LU4)数据集聚焦于欧洲37个国家1991至2025年间按性别分类的劳动力未充分利用指标,为劳动经济学领域的经典研究提供了宝贵的时序面板数据。研究人员常借助此数据集开展跨国劳动力市场效率的比较分析,通过追踪LU4指标的年度波动,量化不同性别群体在就业参与率、隐性失业及潜在劳动力供给方面的结构性差异。该数据集整合自国际劳工组织权威统计数据库ILOSTAT,经规范化处理后便于直接加载,适用于多元回归、固定效应模型及面板向量自回归等经典计量方法,是探究欧洲劳动力市场周期性与结构性特征的理想资源。
衍生相关工作
本数据集衍生了多项具有影响力的开创性工作,尤其在劳动力市场预测与不平等分析领域。研究者基于此数据集构建了欧洲劳动力闲置状态的时序预测模型,结合宏观经济变量与性别分解数据,推动了状态空间模型与机器学习集成方法在劳动统计中的应用。部分经典工作利用LU4指标与福利制度特征的关联分析,深化了关于社会保障网络如何缓冲劳动力冲击的理论认识。此外,该数据集催生了跨学科的比较研究框架,将LU4与教育水平、产业转型及移民流动数据融合,揭示了数字经济发展对传统用工模式的替代效应,为后疫情时代劳动力市场的复苏路径设计提供了关键的数据驱动洞见。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲各国劳动力利用不足的综合测量指标(LU4),按性别分列,涵盖1991年至2025年间37个欧洲国家的2334条观测记录。在国际劳工组织(ILO)的协调框架下,该数据通过整合劳动力调查、行政记录等多源数据,为后疫情时代劳动力市场复苏、结构性就业矛盾及性别不平等问题提供了精细化量化工具。当前研究前沿围绕其在高频时序预测、多维分类建模及政策评估中的应用展开,例如基于宏观经济波动与劳动力流动的动态关联分析,以及利用机器学习模型识别不同性别、国家与时间维度下的隐性失业模式。该数据集作为欧洲劳动力统计领域最具权威性的开放资源之一,不仅支撑了国际组织对体面劳动目标的监测,亦为学者与政策制定者揭示了劳动力资源错配的深层机制,在推动数据驱动的社会政策创新中具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务