遇见数据集

electricsheepeurope/europe-ilo-gdp-205u-noc-nb-output-per-worker-gdp-constant-2015-us-ilo-modelle

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含国际劳工组织(ILO)ILOSTAT数据库提供的39个欧洲国家1991年至2027年每个工人的产出(以2015年不变价美元计的GDP)的模拟估计数据,共1,437个观测值,涵盖一个核心指标(GDP_205U_NOC_NB),用于衡量劳动生产率。数据通过ILOSTAT REST API获取,并经过标准化处理,适用于表格分类、回归和时间序列预测等机器学习任务。

This dataset contains 1,437 observations of modelled estimates for output per worker (GDP constant 2015 US $) across 39 Europe countries from 1991 to 2027, sourced from the International Labour Organization (ILO) ILOSTAT database. It covers one key indicator (GDP_205U_NOC_NB) related to labour productivity, with data retrieved via the ILOSTAT REST API and standardized for machine learning tasks such as tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-gdp-205u-noc-nb-output-per-worker-gdp-constant-2015-us-ilo-modelle 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT统计数据库,通过其REST API直接采集指标代码为GDP_205U_NOC_NB的数据,并依据欧洲ISO3国家代码进行筛选过滤。原始数据基于国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家计调查等微观数据进行协调统一,来源信息被标注于source.label列中以便追溯。整个数据集共包含1437条观测记录,覆盖39个欧洲国家,时间跨度从1991年至2027年,由Electric Sheep Europe团队完成重新打包与标准化处理,以Parquet格式发布,便于机器学习领域的直接调用。
特点
该数据集聚焦于欧洲地区劳动力生产率的核心指标——每个工人的产出(以2015年不变价美元计),是ILO建模估算的最新成果。数据具有典型的面板结构,涵盖国家、年份与指标值三个维度,且观测值按年度频率呈现。每个国家的数据序列完整连续,均包含37个年份的观测。数据集还附带了来源编码与标签,便于用户识别数据的基础来源与质量层级。此外,数据遵守CC-BY-4.0许可协议,允许广泛使用,同时要求正确引用原始数据来源与重新打包方。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数直接加载该数据集,并利用to_pandas方法将其转换为Pandas DataFrame进行后续分析。针对单国别分析,可以基于ref_area列进行过滤;对于时间序列可视化,可按indicator列筛选并依time列排序后绘图;若需构建国家×年份的矩阵形式,可使用pivot_table方法进行透视。数据集的所有列均以标准化的字段名呈现,包括国家代码、国家名称、来源编码、指标编码、年份及指标值,极大降低了数据清洗与预处理的复杂度。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年11月发布,经由Electric Sheep Europe于2026年重新打包并托管于HuggingFace平台。数据集聚焦于欧洲39个国家1991至2027年间“每个工人的产出(以2015年不变价美元计)”这一劳动生产率核心指标,共包含1437条观测记录。ILOSTAT作为全球劳动统计的权威数据库,整合了来自劳动力调查、家庭收入调查及行政记录的多源数据,并通过国际劳工统计学家会议(ICLS)定义进行标准化处理。该数据集为研究欧洲各国劳动生产率长期演变、跨国比较以及与经济增长的关联提供了关键数据支撑,在劳动经济学、发展经济学及国际比较研究中具有重要应用价值,尤其为政策制定者评估劳动力市场效率与可持续发展目标进展提供了量化基础。
当前挑战
该数据集面临的挑战主要体现在两个层面。在领域问题层面,劳动生产率的数据化衡量需解决跨国比较中购买力平价的统一问题,以及不同国家间产业结构、技术进步和资本深化等因素对产出影响的拆解难题。在构建过程中,数据集的挑战包括:ILOSTAT需调和来自200多个经济体的多源异构数据,确保不同调查统计口径的一致性;针对同一国家-年份组合存在多个来源时,需通过算法选择“最佳来源”以避免数据冗余或矛盾;此外,数据仅包含年度频率,未能涵盖发布月度或季度高频序列的指标,限制了短期波动分析的能力。数据溯源标记虽通过source.label列实现,但原始数据质量对模型估计精度构成隐性挑战。
常用场景
经典使用场景
在欧洲劳动经济学与宏观经济研究中,该数据集的核心用途在于构建和验证劳动力生产率模型。基于国际劳工组织(ILO)的标准化估算,数据集提供了1991年至2027年39个欧洲国家“每名工人产出(以2015年不变价美元计)”的年度观测值,共计1,437条记录。研究者常将其作为时间序列面板数据,用于分析欧洲各国劳动生产率的历史演变轨迹、跨国差异及其收敛性,或是结合其他经济指标(如资本存量、教育水平)进行多元回归分析,以揭示驱动生产率增长的关键因素。数据集的结构化设计——包含国家代码、年份、指标值及来源标识——使其天然适配于机器学习的回归任务与时间序列预测任务,例如使用LSTM或Prophet模型对2027年后的生产率走势进行前瞻性模拟。
实际应用
在实际决策层面,该数据集直接服务于欧洲各国政府、国际组织以及多边金融机构的政策评估与制定。例如,欧盟委员会可以利用这些数据监测‘欧洲2020战略’或‘下一代欧盟’复苏计划中设定的生产率增长目标完成进度,为结构性改革措施(如劳动力市场灵活化、研发投入激励)的成效评估提供量化基准。国际货币基金组织(IMF)和世界银行在处理欧洲区域贷款项目时,亦依赖此类劳动生产率序列来测算潜在产出缺口与债务可持续性。在企业端,跨国制造业和服务业公司借助该数据集可以识别不同国家的劳动力成本效率,优化其欧洲供应链布局和海外投资选址——譬如比较东欧与西欧单位劳动力的产出效能差异。数据集以CC-BY-4.0许可开放,配合HuggingFace提供的统一接口,极大降低了政策分析师和商业智能团队的数据获取与整合门槛。
衍生相关工作
该数据集作为ILOSTAT标准框架下的欧洲子集,其价值已延伸至多个衍生性研究工作。Electric Sheep Europe团队将其重新打包并纳入‘欧盟机器学习就绪数据层’生态体系,使得研究者能够通过`load_dataset()`一行代码直接获取标准化Parquet格式数据,从而迅速开展复现性研究与基准测试。在学术领域,已有工作以此数据集为基础,结合欧盟统计局(Eurostat)的区域GDP数据与欧洲社会调查(ESS)的技能指标,构建了测度技术分化如何影响中欧和南欧国家就业结构的计量经济学模型。此外,该数据集也常被用于训练多任务学习模型以同时预测经济增长、就业率和碳排放强度等可持续发展目标(SDG)指标。值得注意的是,ILO的‘模拟估算’方法本身即是方法论研究的热点——不同来源数据融合与最优来源选择策略的稳健性检验,已成为劳动统计领域的一类重要专题,而该欧洲数据集为此类比较提供了实证锚点。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务