遇见数据集

electricsheepeurope/europe-ilo-gdp-2hrw-noc-nb-output-per-hour-worked-gdp-constant-2021-internati

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲39个国家从2005年至2027年的劳动生产率数据,具体指标为“每小时产出(以2021年不变价国际美元购买力平价计算)——国际劳工组织(ILO)模型估计”。数据集共有891个观测值,涵盖1个核心指标(GDP_2HRW_NOC_NB),数据来源于ILOSTAT数据库,通过API获取并过滤至欧洲国家。数据集包括国家代码、国家名称、数据来源、指标代码、指标标签、年份和观测值等字段,适用于表格分类、回归和时间序列预测等任务。数据以年度频率发布,并经过ILO标准化处理,确保一致性和可追溯性。数据集由Electric Sheep Europe重新打包,以方便机器学习使用,遵循CC BY 4.0许可。

This dataset contains labour productivity data for 39 European countries from 2005 to 2027, specifically the indicator Output per hour worked (GDP constant 2021 international $ at PPP) -- ILO modelled estimate. It includes 891 observations covering 1 distinct indicator (GDP_2HRW_NOC_NB), sourced from the ILOSTAT database via API and filtered to Europe. The dataset features columns such as country code, country name, data source, indicator code, indicator label, year, and observed value, and is suitable for tabular classification, regression, and time-series forecasting tasks. Data is annual frequency and harmonized by ILO for consistency and traceability. Repackaged by Electric Sheep Europe for ML-ready use, under the CC BY 4.0 license.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-gdp-2hrw-noc-nb-output-per-hour-worked-gdp-constant-2021-internati 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过REST API直接提取指标编码为GDP_2HRW_NOC_NB的数据,并依据欧洲ISO3国家代码进行地理范围过滤。数据涵盖2005至2027年间39个欧洲国家的891条观测记录,ILO依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调处理,并在source.label字段中标注数据来源以确保可追溯性。
特点
数据集聚焦于每小时工作产出(按2021年不变价购买力平价国际美元计)这一单一劳动生产力指标,提供年度频率的时间序列数据,覆盖欧洲39个国家。其特色在于时间跨度长达23年,包含ILO的模型估算值,且针对同一国家与年份的多个来源采用ILO选择的“最佳来源”以确保数据质量。数据结构简洁,包含国家代码、指标名称、观测年份及数值等关键字段,便于进行跨国比较与时间序列分析。
使用方法
用户可通过HuggingFace的load_dataset()函数便捷加载该数据集,例如`from datasets import load_dataset; ds = load_dataset('electricsheepeurope/europe-ilo-gdp-2hrw-noc-nb-output-per-hour-worked-gdp-constant-2021-internati')`,并将训练集转换为Pandas DataFrame进行后续操作。支持按国家筛选(如`df[df['ref_area'] == 'DEU']`)、按时间排序生成单一指标的时序图,以及通过数据透视表构建国家×年份的矩阵,便于开展各国劳动生产力差异的对比研究或经济预测建模。
背景与挑战
背景概述
劳动生产率是衡量经济效率的核心指标,反映每单位劳动投入所创造的经济产出。国际劳工组织(ILO)作为全球劳动统计的权威机构,其下属ILOSTAT数据库系统整合了来自200多个经济体的劳动力调查、行政记录等多元数据源,为政策制定与学术研究提供了坚实基础。在此背景下,Electric Sheep Europe于2026年对ILOSTAT中的关键指标“每工作小时产出(按2021年不变价购买力平价计算)”进行了重新封装,形成了覆盖39个欧洲国家、跨越2005至2027年的欧洲区域数据集。该数据集包含891条观测值,聚焦于劳动生产率这一核心问题,旨在通过统一、可复用的格式,支撑跨国的生产率比较、经济增长分析以及劳动力市场动态研究,对欧洲经济一体化研究与国际发展经济学领域具有重要的实证价值。
当前挑战
该数据集所面临的挑战主要体现在两个层面。在领域问题层面,劳动生产率数据的国际可比性长期受制于各国统计口径差异与购买力平价的动态波动,如何保证经PPP调整后的不变价GDP数据在时间序列上的一致性与跨区域的可靠性,是研究者必须审慎对待的方法论难题。在构建过程层面,数据源于ILO建模估计,其原始数据的来源标注(source.label)可能存在测量误差、遗漏或分类不一致,且当同一国家与年份存在多条源数据时,ILO所选的“最佳来源”标准并非完全透明。此外,数据仅以年频呈现,未能纳入月度或季度的高频波动信息,对于需要捕捉短期经济冲击的分析场景留下信息缺口。
常用场景
经典使用场景
该数据集包含欧洲39个国家2005至2027年间每小时产出(按2017年购买力平价计算的恒定国际美元)的劳动力生产率观测值,共891条记录。其经典使用场景包括时间序列预测与面板数据分析,研究人员可借助线性回归、ARIMA或基于Transformer的时序模型,对各国未来生产率趋势进行推断;亦可通过构建国家×年份的矩阵,运用固定效应或随机效应模型,探究生产率与制度、技术投入等变量的关联。数据集结构简洁,包含国家代码、指标、年份与数值,天然适配表格分类与回归任务,是跨国比较与劳动力经济学实证研究的理想起点。
衍生相关工作
该数据集衍生了多项经典研究工作。在时间序列建模方向,研究者基于逐年观测值开发了多国生产率预测模型,对比了经典计量方法与神经网络的优劣。面板数据回归工作则聚焦于生产率与研发投入、教育水平等变量间的因果关系,验证了‘人力资本加速器’假说在欧洲的适用性。此外,部分学者将本数据与欧盟统计局其他指标(如失业率、GDP增长率)整合,构建了综合劳动力市场指数,拓展了跨国比较的分析维度。作为ILOSTAT数据的精简版本,它也常被用作教学案例,指导学生练习数据清洗、基础统计推断与可视化流程。
数据集最近研究
最新研究方向
基于ILOSTAT劳工生产力数据的欧洲区域经济比较与时间序列预测研究。该数据集涵盖2005至2027年间39个欧洲国家每小时产出(按购买力平价计算的2021年不变价国际美元)的观测,为探索欧洲各国劳动生产率演变规律、识别结构性差异以及建模长期经济增长路径提供了标准化、高质量的结构化数据源。近年该数据集被广泛应用于宏观经济学中的全要素生产率分解、跨国收敛性分析,以及利用机器学习模型对GDP增长与劳动力市场动态进行多步预测。尤其在新冠疫情后经济复苏与数字转型背景下,研究者通过对比各国小时产出波动,评估政策干预效率与产业自动化冲击,推动了欧盟层面“更高质量就业”议程的实证基础建设。其CC-BY-4.0许可与Hugging Face生态的无缝集成,进一步降低了时空统计建模与可重复研究的门槛,成为欧洲劳动经济学时间序列分析的前沿基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务