遇见数据集

electricsheepeurope/europe-ilo-gdp-211p-noc-nb-output-per-worker-gdp-constant-2021-international

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含关于劳动生产率的1,437个观测值,具体指标为每个工人的产出(以2021年不变国际美元购买力平价计算)——国际劳工组织模型估计。数据覆盖39个欧洲国家,时间跨度为1991年至2027年,每年一个数据点。数据集来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤到欧洲国家。数据包括国家代码、国家名称、来源信息、指标代码、指标标签、年份和观测值等列。数据以年度频率发布,并经过ILO的标准化处理,使用国际劳工统计学家会议(ICLS)定义进行协调。数据集适用于表格分类、回归和时间序列预测等任务,主要用于劳动经济学、宏观经济分析和政策研究。

This dataset contains 1,437 observations of Labour productivity data, specifically the indicator Output per worker (GDP constant 2021 international $ at PPP) -- ILO modelled estimates. It covers 39 Europe countries from 1991 to 2027, with annual frequency. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via REST API and filtered to Europe country codes. The dataset includes columns such as country code, country name, source information, indicator code, indicator label, year, and observed value. The data is harmonized using ICLS (International Conference of Labour Statisticians) definitions and is suitable for tabular classification, regression, and time-series forecasting tasks, primarily for labor economics, macroeconomic analysis, and policy research.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-gdp-211p-noc-nb-output-per-worker-gdp-constant-2021-international 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,聚焦于欧洲39个国家1991年至2027年间劳动者产出(以2021年不变价国际美元计)的生产率指标。数据通过ILOSTAT REST API直接抽取,并依据欧洲ISO3国家代码进行地理过滤。ILO依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行协调,确保统计口径的一致性。数据集共包含1,437条观测记录,每条记录均标注了数据来源,便于追溯与验证。
特点
该数据集的核心特点在于其时间跨度长(37年)、覆盖国家广泛(39个欧洲国家),且数据为年度频率,适用于面板数据分析与时间序列建模。关键变量包括国家代码、年份、观测值及数据来源标签,结构简洁而完整。数据预处理中已采用ILO选择的‘最佳来源’处理同一国家同年份的多源冲突,保证了数据质量。此外,该数据集已打包为Parquet格式,兼容Hugging Face的load_dataset()接口,极大简化了研究者与开发者的数据获取流程。
使用方法
用户可通过Hugging Face的datasets库直接加载该数据集,并转换为Pandas DataFrame进行后续分析。典型操作包括按国家代码筛选特定国家的子集,按时间序列绘制单一指标的折线图,或通过数据透视表构造国家×年份的矩阵,便于进行跨国比较与回归分析。数据集已按行存储,支持常见的表格分类、回归与时间序列预测任务,可直接用于机器学习的训练与评估流程。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年11月发布,经Electric Sheep Europe整理后于HuggingFace平台公开。其核心研究问题聚焦于欧洲39个国家在1991年至2027年间每位工人产出(以2021年不变价购买力平价美元计)的劳动生产力动态。作为ILOSTAT数据库的子集,该数据集依托ILO在劳动统计领域四十余年的权威积累,为分析欧洲经济效率、劳动力市场结构及生产力长期趋势提供了标准化的时序数据。凭借其覆盖37年跨度、涵盖东欧、西欧及巴尔干地区的完整版图,该数据已成为区域经济比较研究、跨国生产力收敛分析及政策评估的关键实证基础。
当前挑战
该数据集面临的挑战多重交织。在领域问题层面,劳动生产力指标受汇率波动、购买力平价更新及非正规经济规模等隐性因素扰动,单一指标难以全面反映真实产出效率。构建过程中,数据整合需解决多来源调查方法(如劳动力调查与企业记录)的统计口径差异,ILO虽采用国际劳动统计学家会议(ICLS)标准进行协调,但原始调查频率(年度、季度、月度)的不一致性仍会引入时序噪声。此外,模型估算值(如2025-2027年预测)的误差边界未明确标注,而部分国家在特定年份(如波黑1990年代)的数据空缺进一步增加了分析的不确定性。
常用场景
经典使用场景
该数据集汇聚了国际劳工组织ILOSTAT关于欧洲39个国家1991至2027年间每工人产出(以2021年恒定购买力平价国际美元计)的建模估算值,共计1437条观测记录。经典使用场景涵盖时序预测、面板数据回归和分类任务,研究者可借此分析欧洲各国劳动生产率的历史演变轨迹与未来趋势。借助HuggingFace Datasets接口,用户能便捷地加载数据并进行单国滤波、多指标对比或构建国家×年份的矩阵以开展跨国面板分析,为劳动经济学领域的量化研究提供了结构化、标准化的数据基础。
解决学术问题
该数据集有效回应了劳动经济学与宏观经济学中若干学术难题。首要解决的是欧洲各国劳动生产率长期缺失可比性量化数据的问题——通过ILO统一的方法论与购买力平价调整,研究者得以在控制价格水平差异的前提下比较各国劳动产出效率。其次,数据集覆盖至2027年的预测值,为经济收敛假说、增长核算以及制度因素对生产率影响等经典议题提供了实证素材。其意义在于弥合了国际劳动统计中的标准差异,推动基于微观调查与宏观核算融合的跨国面板研究,使得技术进步、人力资本与劳动力市场制度对生产率贡献的分解分析成为可能。
衍生相关工作
基于该数据集的标准化结构与ILOSTAT的权威来源,已衍生出一系列拓展性工作。Electric Sheep Europe团队将其整合进面向欧洲的机器学习就绪数据层,使得研究者可轻松调用HuggingFace Datasets接口进行多源联合分析。后续工作包括与其他欧洲经济指标(如GDP增速、失业率、教育支出)进行跨库关联,构建多维度生产率影响因素数据库;亦催生了基于时间序列分解与状态空间模型的劳动产出预测研究,以及运用面板回归探讨制度质量、创新投入与劳动生产率之间因果关系的经验文献。这些工作共同推动了劳动经济学数据集开放科学与可重复性研究范式的深化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务