遇见数据集

electricsheepeurope/europe-ilo-luu-xlu4-sex-age-geo-rt-composite-rate-of-labour-underutilization-lu4-by-s

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲34个国家1998年至2025年间关于劳动力未充分利用综合率(LU4)的统计数据,共计47,947个观测值。核心指标为“按性别、年龄和城乡地区划分的劳动力未充分利用综合率(LU4)(%)”,数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过劳动力调查等来源收集并经过统一处理。数据集提供了按国家、性别(总计、男性、女性)、年龄分类、城乡地区分类以及年份细分的结构化数据,适用于劳动力市场分析、时间序列预测和相关研究。数据以表格形式组织,包含引用、观测状态、注释等元数据字段,支持机器学习任务如表格分类、回归和时间序列预测。

This dataset contains statistical data on the Composite Labor Underutilization Rate (LU4) from 34 European countries between 1998 and 2025, with a total of 47,947 observations. The core indicator is the Composite Labor Underutilization Rate (LU4) (%) disaggregated by gender, age group, and urban-rural region. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), collected from sources such as labor force surveys and uniformly processed. The dataset provides structured data disaggregated by country, gender (total, male, female), age group, urban-rural region, and year, which is suitable for labor market analysis, time series forecasting and related research. The data is organized in tabular format, contains metadata fields such as citations, observation status and notes, and supports machine learning tasks including tabular classification, regression and time series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-luu-xlu4-sex-age-geo-rt-composite-rate-of-labour-underutilization-lu4-by-s 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过调用其REST API接口(https://rplumber.ilo.org/data/indicator?id=LUU_XLU4_SEX_AGE_GEO_RT)直接抓取原始数据,并依据欧洲ISO3国家代码进行严格筛选,以沉淀出专注于欧洲区域的劳动利用不足综合率(LU4)指标。数据构建过程中,ILOSTAT基于国际劳动统计学家会议(ICLS)定义对各国劳动力调查的微观数据进行统一协调和标准化处理,确保跨国可比性。最终,由Electric Sheep Europe团队对原始数据进行了重新封装和整理,形成结构化数据集,包含47,947条观测记录,覆盖34个欧洲国家,时间跨度从1998年至2025年。
特点
该数据集的核心特色在于其聚焦于劳动利用不足综合率(LU4)这一综合指标,突破了传统失业率单维度衡量的局限,更全面地捕捉劳动力市场的闲置与潜力。数据集在人口统计维度上提供了精细化的分类,包括性别(男性、女性、总计)、年龄(如青年与成年人)以及地区类型(国家整体、城乡区域),便于进行多维交叉分析。数据来源标注清晰,每个观测值均附有来源标识(source.label),确保可追溯性,同时通过观测状态标志(obs_status)和系列中断注释(note_indicator)提示数据质量信息,为严谨的学术研究提供可靠基础。
使用方法
该数据集可通过HuggingFace Datasets库便捷调用,用户只需执行`from datasets import load_dataset`并指定数据集名称,即可将数据加载为Pandas DataFrame进行后续分析。典型用法包括:按国家代码过滤以分析单一国家的长期趋势,例如提取德国(DEU)数据;针对特定指标(如LUU_XLU4_SEX_AGE_GEO_RT)按时间排序后绘制时序图,揭示劳动利用不足率的演变规律;亦可利用数据透视表功能,构建以年份为行、国家为列的矩阵,便于进行面板数据分析或跨国家比较。该方法学设计兼顾了数据可访问性与分析灵活性,适用于学术研究、政策评估及经济监测等场景。
背景与挑战
背景概述
在劳动经济学与统计领域,劳动力利用不足的测度是评估经济健康与社会福祉的重要维度。国际劳工组织(ILO)于2025年通过其ILOSTAT数据库发布了欧洲地区劳动力利用不足综合率(LU4)数据集,该数据集由Electric Sheep Europe在HuggingFace平台上重新打包并分发。其核心研究问题聚焦于如何精准捕捉传统失业率未能涵盖的隐性劳动力闲置,涵盖性别、年龄及城乡区域等多维度分异。数据集囊括1998年至2025年间34个欧洲国家的47,947条观测记录,为比较劳动政策、追踪劳动市场结构性变化提供了标准化、跨国的实证基础,显著推动了劳动力市场无效率测度的国际比较研究。
当前挑战
该数据集所解决的领域问题在于,传统失业率指标忽视隐性闲置劳动力,如因就业不充分或求职受挫而退出市场的人群,LU4综合率通过整合更广泛的劳动力利用不足类型,弥补了这一缺口。构建过程中面临的挑战包括:跨国劳动调查在定义与口径上的异质性,ILO虽遵循国际劳动统计学家会议(ICLS)标准进行协调,但仍需处理各来源的偏差;时间序列中因调查方法更新或问卷修订导致的序列中断反复出现,需依赖观测状态标记(如'Break in series')进行识别;数据整合时需从多种混合频率(年度、季度)的原始数据中提取出一致的时间粒度,并确保城乡、年龄等分类变量的统一与完整,这对数据清洗与标准化能力提出了较高要求。
常用场景
经典使用场景
该数据集汇集了欧洲34个国家1998至2025年间劳动力利用不足综合率(LU4)的年度观测数据,按性别、年龄及城乡地域维度进行细致分层,覆盖近4.8万条记录。研究者常将其用于劳动力市场结构性分析与国际比较,通过时间序列建模揭示不同群体间劳动力闲置的演变规律,并借助分类回归框架识别社会经济因素与劳动力利用不足之间的关联。数据的高粒度特性也使其适用于构建多变量面板数据模型,探讨全球化、技术进步与政策干预对欧洲劳动力市场的异质性冲击。
实际应用
在实际应用中,该数据集为国际组织、国家统计部门及政策智库提供了标准化、可复用的劳动力监测工具。劳动经济学家借助它评估不同欧洲国家的劳动力市场韧性,比较各国在金融危机或公共卫生事件冲击后的恢复轨迹;社会政策研究者则利用性别与地域分层数据,识别就业援助资源配置不均衡的热点区域,为欧盟社会基金与各国公共就业服务体系的绩效评估提供量化支撑。此外,数据集的机器学习就绪格式允许快速部署预测模型,服务于劳动力预警系统的构建。
衍生相关工作
基于该数据集的派生研究主要沿三条路径展开:一是劳动力利用充分性指标的跨国比较研究,学者们通过对比LU4与传统失业率,论证了复合指标在反映真实劳动力闲置规模时的优势;二是机器学习预测模型的开发,利用时间序列与面板数据训练回归与分类器,对特定国家或人群的未来劳动力利用不足率进行短期展望;三是围绕数据源ILOSTAT的方法论拓展,包括数据插补技术、跨调查一致性调整,以及将LU4指标与教育、健康等社会指标联动的多维度分析框架。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务