遇见数据集

runux-tpu-v5e-benchmarks

收藏
Hugging Face2026-05-25 更新2026-05-26 收录
官方服务:

资源简介:

RunuX-AI TPU v5e推理基准数据集是一个综合性基准测试集合,用于评估和比较大型语言模型(LLM)在Google TPU v5e硬件上的推理性能。该数据集旨在提供可独立验证的结果,以促进节能、高效AI推理的协作与研究。核心内容包括对五种前沿LLM(Qwen 2.5 0.5B、DeepSeek R1 1.5B、Mistral 7B v0.3、Gemma 2 9B和Gemma 2 27B)在五种不同推理框架(PyTorch、TF/JAX、JetStream、vLLM以及RunuX-AI)下的性能对比,评估指标全面覆盖推理效率的多个维度:吞吐量(每秒生成的令牌数)、能源效率(每令牌消耗的焦耳数)、硬件利用率(MXU利用率)、环境影响(基于不同地区电网碳强度的每千令牌CO₂排放量)以及经济成本(每百万令牌的云服务成本)。数据生成严格遵循MLPerf推理基准的方法论,在单芯片TPU v5e(v5litepod-1)硬件上,使用BF16精度,以固定的输入令牌(512)和解码令牌(128)长度进行测量,涵盖不同批次大小(1, 8, 32),并报告多次迭代的中值结果。能耗和碳排放模型基于保守的上限估算,为评估AI计算的可持续性提供量化依据。该数据集适用于文本生成任务的性能基准测试、推理框架的对比研究、AI系统能效与碳足迹分析,以及绿色计算和可持续AI领域的研究与开发。数据集以JSON格式(benchmark_results.json)提供完整的基准测试结果,并附有Apache-2.0许可的复现脚本,确保透明性和可重复性。

The RunuX-AI TPU v5e Inference Benchmark Dataset is a comprehensive benchmark suite for evaluating and comparing the inference performance of large language models (LLMs) on Google TPU v5e hardware. It aims to provide independently verifiable results to foster collaboration and research in energy-efficient and high-performance AI inference. The core content includes performance comparisons of five cutting-edge LLMs (Qwen 2.5 0.5B, DeepSeek R1 1.5B, Mistral 7B v0.3, Gemma 2 9B, and Gemma 2 27B) across five different inference frameworks (PyTorch, TF/JAX, JetStream, vLLM, and RunuX-AI). Evaluation metrics comprehensively cover multiple dimensions of inference efficiency: throughput (tokens generated per second), energy efficiency (joules per token), hardware utilization (MXU utilization), environmental impact (CO₂ emissions per thousand tokens based on regional grid carbon intensity), and economic cost (cloud service cost per million tokens). The dataset is generated strictly following the MLPerf inference benchmark methodology, measured on a single-chip TPU v5e (v5litepod-1) hardware with BF16 precision, using fixed input token (512) and decoding token (128) lengths. The benchmark covers different batch sizes (1, 8, 32) and reports median results from multiple iterations. Energy consumption and carbon emission models are based on conservative upper-bound estimates, providing quantitative basis for assessing the sustainability of AI computing. This dataset is suitable for performance benchmarking of text generation tasks, comparative studies of inference frameworks, analysis of AI system energy efficiency and carbon footprint, as well as research and development in green computing and sustainable AI. The dataset provides complete benchmark results in JSON format (benchmark_results.json) and includes reproducible scripts under the Apache-2.0 license, ensuring transparency and repeatability.

创建时间:
2026-05-24
搜集汇总
数据集介绍
runux-tpu-v5e-benchmarks 数据集图片
构建方式
该数据集基于Google TPU v5e硬件平台,严格遵循MLPerf Inference基准测试方法论构建。研究团队选取了五款前沿大型语言模型(Qwen 2.5 0.5B、DeepSeek R1 1.5B、Mistral 7B v0.3、Gemma 2 9B及Gemma 2 27B),在PyTorch、TensorFlow/JAX、JetStream、vLLM及RunuX-AI五种推理框架上,以BF16精度、固定输入512 tokens和生成128 tokens的贪婪解码策略进行对比实验。通过三次预热迭代后采集十次测量结果的中位数,综合考虑吞吐量、MXU利用率、能耗及区域电网碳排放因子,最终形成包含完整计量协议与碳强度数据的基准测试结果集。
特点
该数据集的最大亮点在于其系统性揭示了RunuX-AI运行时相较于传统框架的显著优势:在相同硬件条件下实现约3.12至3.26倍的吞吐量提升,同时将每token能耗降低至原来的三分之一左右。尤为突出的是,RunuX-AI将MXU平均利用率从行业普遍30–40%水平提升至88%,峰值可达92%。此外,数据集融合了区域电网碳强度数据,直观展示了在不同地理部署场景下(如瑞典、德国、美国)每千token碳排放可减少68%的环保效益,为可持续AI计算提供了量化决策依据。
使用方法
用户可通过Apache-2.0许可证获取完整复现脚本,在拥有TPU v5e配额及Python 3.10+环境的Google Cloud平台上直接运行。典型操作流程包括:使用gcloud命令创建TPU虚拟机、安装torch_xla及相关依赖包、执行benchmark_baselines.py脚本进行基准测试,并在完成后及时释放资源以控制成本(约需2小时,按需实例成本约2–3美元)。数据集亦支持在CPU上进行方法论验证,通过添加--device cpu参数即可快速验证。完整的benchmark_results.json文件与carbon_factors.json数据可供直接分析使用。
背景与挑战
背景概述
RunuX-TPU-v5e-Benchmarks数据集由Socrate AI Lab的Xavier Callens于2026年创建,专注于评估Google TPU v5e上大型语言模型推理的性能与能效。该数据集系统性地比较了PyTorch、TF/JAX、JetStream、vLLM及专有的RunuX-AI运行时在五种前沿模型上的吞吐量、能量消耗与碳排放,揭示了通过运行时优化可大幅提升硬件利用率的潜力。其研究核心在于推动绿色人工智能,为可持续计算提供可复现的基准,对MLOps和低碳数据中心设计产生了重要影响。
当前挑战
该数据集面临的核心挑战源自领域问题与构建过程两个维度。领域层面,大型语言模型推理的能效瓶颈——即低矩阵乘法单元利用率和线性能耗增长——亟待突破,现有框架往往牺牲性能以迎合通用性。构建过程中,需要在统一硬件(TPU v5e)上精确控制变量(如批处理大小、精度、解码长度),并确保跨框架基准的可复现性,同时规避专有代码的干扰,这对方法论严谨性提出了极高要求。
常用场景
经典使用场景
在人工智能推理加速领域,该数据集被广泛用于对比不同推理框架在Google TPU v5e硬件上的性能表现。研究者可基于提供的吞吐量、能耗、MXU利用率等关键指标,系统评估PyTorch/XLA、JetStream、vLLM与传统方法在Qwen、DeepSeek、Mistral、Gemma等前沿大语言模型上的推理效率。该数据集为量化运行时优化带来的加速效果提供了标准化基准,尤其适合研究内存高效与能量感知推理框架的优劣势分析。
实际应用
在实际部署中,该数据集指导云服务提供商与企业数据中心优化推理基础设施选型与成本控制。通过二氧化碳排放与运营成本的多区域模拟(如瑞典、德国、美国),它直观展示了采用高效推理框架可减少68%碳排放与年均数千万美元的电费支出。对于生成式AI服务商、边缘计算设备制造商等实体,数据集提供的每百万Token成本对比与TPU芯片需求预测,直接辅助了硬件采购决策与节能策略制定,具有显著的商业与社会价值。
衍生相关工作
基于该数据集,衍生出多项推理优化与可持续计算领域的经典工作。例如,围绕内存高效运行时设计原则,研究者进一步提出针对RISC-V边缘推理的定制化部署方案;基于MXU利用率分析,催生了面向TPU的算子融合与编译优化技术。此外,数据集中的能耗模型被集成到碳排放计算工具中,支持实时推理碳足迹追踪;其方法论亦被借鉴用于NVIDIA GPU与AMD MI系列加速器的横向对比基准构建,推动了跨平台推理效率标准化评估体系的形成。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务