遇见数据集

Watt Counts dataset

收藏
arXiv2026-07-03 更新2026-07-05 收录
数据链接:
官方服务:

资源简介:

Watt Counts数据集是由马德里理工大学与苏黎世应用科学大学联合创建的大语言模型推理性能基准数据集,旨在解决GPU能耗与延迟预测的评估难题。该数据集涵盖42个开源大语言模型(参数量0.1B至27B)与8款NVIDIA服务器级GPU的组合性能数据,包含离线与服务器两种部署场景下的功率消耗和词元间延迟指标。数据采集通过实际部署测试完成,系统测量了不同负载条件下的GPU平均功耗和推理延迟时序特征。该数据集主要应用于可持续人工智能领域,为优化大语言模型部署能效提供基准支撑,助力研究人员开发无需硬件实测的跨平台性能预测模型。

Watt Counts Dataset is a benchmark dataset for large language model (LLM) inference performance jointly developed by the Technical University of Madrid and the Zurich University of Applied Sciences, aiming to address the challenge of evaluating GPU energy consumption and latency prediction. This dataset covers combined performance data for 42 open-source large language models with parameter sizes ranging from 0.1B to 27B and 8 NVIDIA server-grade GPUs, including power consumption and inter-token latency metrics under two deployment scenarios: offline and server-side. The data was collected through actual deployment tests, where the system measured the average power consumption of GPUs and the temporal characteristics of inference latency under varying load conditions. This dataset is primarily applied in the field of sustainable artificial intelligence, providing benchmark support for optimizing the energy efficiency of LLM deployments and assisting researchers in developing cross-platform performance prediction models that do not require physical hardware testing.

创建时间:
2026-07-03
原始信息汇总

数据集概述:WattGPU

WattGPU 是一个用于预测GPU上大语言模型(LLM)推理的能耗和延迟特征的框架,无需进行性能分析或硬件访问。

核心功能

  • 预测推理期间的平均GPU功耗
  • 预测Token间延迟(ITL)

输入信息

仅需以下公开信息:

  • 公开的GPU规格参数
  • 公开的LLM元数据

泛化能力

该模型能够泛化到未见过的GPU和未见过的LLM,支持在运行实验前做出能耗感知的部署决策。

仓库内容

  • WattGPU.ipynb:包含数据预处理、特征工程、模型训练、评估及论文结果复现的主笔记本。
  • requirements.txt:Python依赖项。
  • 实验中使用的数据,包括用于训练和评估的 Watt Counts 子集。

安装与运行

  1. 克隆仓库后,需使用Python 3.12创建虚拟环境。
  2. 安装依赖:uv pip install -r requirements.txt
  3. 启动Jupyter Lab并打开 WattGPU.ipynb,其中包含论文中的完整流程。

许可证

Apache 2.0。

搜集汇总
数据集介绍
Watt Counts dataset 数据集图片
构建方式
在大规模语言模型(LLM)推理能耗日益攀升的背景下,Watt Counts dataset 应运而生,旨在为异构GPU上的LLM部署提供系统化的能耗与延迟基准。该数据集通过对42个开源稠密LLM(参数量从0.1B到27B不等)与8款NVIDIA服务器级GPU(涵盖Volta至Hopper架构)进行系统性测量构建而成。测量过程覆盖离线批量处理与服务器实时推理两种典型场景,其中服务器场景进一步细分为低负载与高负载两种请求到达模式。实验采用vLLM推理引擎,记录每轮推理中的平均GPU功耗与令牌间延迟,并针对每个(GPU, LLM, 场景)组合进行多次重复采样以保证数据可靠性。所有原始测量数据及处理脚本均以开源形式发布,支持可复现研究。
特点
该数据集的核心特色在于其全面性与实用性并存。首先,它覆盖了从2018年至2024年间发布的八款不同代际、不同功耗等级的NVIDIA服务器GPU,以及从轻量级到中等规模的多样化LLM架构,为跨硬件与跨模型的泛化性研究提供了坚实基础。其次,数据集不仅记录原始功耗与延迟值,还包含从公开规格中提取的丰富特征,如GPU的TDP、显存带宽、晶体管数量以及LLM的参数量、层数、注意力头数等,便于直接用于机器学习建模。此外,数据集针对每个(GPU, LLM, 场景)组合提供多次重复测量,方差信息可被用于评估预测模型的稳健性。值得注意的是,数据集中明确排除了消费级GPU和混合专家模型,确保了数据的纯粹性与研究聚焦。
使用方法
研究者可利用该数据集开展多维度分析与建模。一方面,可直接将功耗与延迟指标作为预测目标,训练回归模型以实现对未见过的GPU或LLM组合的性能预估,从而避免昂贵的实际硬件测试。数据集提供的丰富公开特征(如GPU规格与LLM元数据)可作为输入特征,而通过留一GPU或留一LLM的交叉验证可系统评估模型的泛化能力。另一方面,数据集适用于GPU选型优化、LLM比较研究以及能耗感知的系统调度策略验证。例如,给定一个目标LLM,可通过在不同GPU上的测量数据计算能耗效率排名,从而在不进行物理部署的情况下做出最优决策。开源的数据与代码仓库也为他人复现实验或扩展新GPU与LLM提供了便利通道。
背景与挑战
背景概述
在大型语言模型(LLM)推理日益普及的当下,数据中心的能耗问题备受关注。为精准优化LLM与GPU的匹配部署,Mauricio Fadel Argerich、Jonathan Fürst和Marta Patiño-Martínez等研究人员于2026年推出了Watt Counts数据集。该数据集由马德里理工大学与苏黎世应用科学大学共同构建,旨在解决LLM推理能耗与延迟的预测难题。其核心研究问题聚焦于如何在不依赖硬件访问或耗时的性能剖析前提下,仅凭公开元数据实现对未知GPU与LLM组合的功率及延迟预估。该数据集覆盖42个开源LLM与8款NVIDIA服务器级GPU,为模型提供训练与验证基础,在学术界与工业界引发了广泛关注,成为推动可持续AI部署的重要工具。
当前挑战
Watt Counts数据集所应对的领域挑战在于,LLM推理部署亟需高效的GPU选择策略,而传统方法依赖大量物理剖析,成本高昂且难以泛化至新硬件或模型。具体挑战包括:1)领域问题层面,现有模型多针对已知GPU-LLM组合设计,面对未见过的GPU或LLM时,预测精度骤降,且常用的TDP与Roofline基线在服务器场景下误差高达190%与80%;2)构建过程中,所测量的离线与服务器场景下GPU功率与延迟数据受连续批处理、负载波动等因素影响显著,需要确保数据准确、均匀且覆盖多代硬件架构与不同规模模型,同时排除专家混合模型等复杂架构带来的额外建模负担。这些挑战共同构成了预测模型在通用性与准确性上的主要障碍。
常用场景
经典使用场景
随着大语言模型在云端部署的迅猛增长,GPU集群的能耗已成为数据中心运营的核心挑战。Watt Counts数据集专为评估和预测LLM推理过程中的GPU功耗与延迟而构建,覆盖了8款NVIDIA服务器级GPU和42个参数量从0.1B到27B的稠密开源模型。其最经典的用途在于,借助纯公开的LLM元数据和GPU规格参数,训练出无需硬件访问或额外剖析即可泛化至未见GPU与模型的功耗与延迟预测模型。该数据集支持离线批处理与在线服务器两种典型推理场景,通过留一GPU法和留一LLM法交叉验证,系统性地评估模型对未见过硬件与模型的泛化能力,为能源感知的部署决策提供了坚实的数据基础。
衍生相关工作
Watt Counts数据集的出现催生了一系列高质量的衍生工作,推动了LLM推理能耗预测领域的范式转变。最核心的衍生工作即本文提出的WattGPU,它基于该数据集训练出首个针对未见GPU的功耗与延迟预测模型,并通过严格的留一法验证树立了评估基准。此外,该数据集为后续的能耗感知推理调度器(如throttLL’eM)提供了关键训练数据,使集群级的GPU动态调频成为可能。它还被用于验证Roofline驱动型ML模型(如Imai等人的工作)与图神经网络方法(如Fu等人的LLMCO2)对多代GPU的泛化能力。同时,Watt Counts作为ML.ENERGY与AI Energy Score等权威功耗领导者的补充数据源,帮助社区突破了仅依赖高端硬件的局限,拓展了中低端GPU的能耗建模边界,并启发了TokenPowerBench等轻量级剖析基准的设计思路。
数据集最近研究
最新研究方向
当前,针对大语言模型推理能耗的优化已成为绿色人工智能领域的研究热点。Watt Counts 数据集的发布为这一方向提供了关键支撑,其最新研究聚焦于 WattGPU 预测框架,旨在仅利用公开的 LLM 元数据和 GPU 规格,无需硬件访问或预配置即可精准预测未知 GPU 与 LLM 组合的功耗与延迟。该研究在 42 个开源模型与 8 款服务器级 GPU 上验证,功耗预测误差在离线场景下低至 3.4%,延迟预测误差在服务场景下仅为 8.5%,显著优于传统的 TDP 与 roofline 基线。这一工作不仅为小规模部署提供了经济可行的能效评估工具,更通过支持能耗感知的 GPU 选型,直接回应了 EU AI Act 等监管对透明可持续报告的要求,对降低 AI 推理的碳足迹具有深远意义。
相关研究论文
  • 1
    WattGPU: Predicting Inference Power and Latency on Unseen GPUs and LLMs马德里理工大学; 苏黎世应用科学大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务