遇见数据集

onprem-llm-benchmark

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

Scherm On-Premise LLM Inference Benchmark 是一个用于评估大型语言模型(LLM)在真实GPU硬件上本地推理性能的可复现基准测试数据集。它旨在衡量本地部署的三个关键维度:最大可容纳模型大小、吞吐量(tokens/s)和并发用户数支持,为主权AI设备的规模评估(产品×用户数×GPU×成本)提供数据支持。数据集包含五个模态的基准测试结果:对话/代码服务、嵌入生成、语音转文本、视觉/OCR以及旧版GPU上的GGUF格式模型服务。数据覆盖从Pascal到Ada Lovelace架构的六种GPU型号(如GTX 1080 Ti、Tesla P100、RTX 2080 Ti、RTX 4070、RTX 4090、L40S)。实验采用严谨方法:每个测试点进行至少10次重复,报告中位数、四分位距、p95/p99分位数和95%置信区间;使用固定种子确保确定性;记录完整的执行环境(包括GPU、驱动、运行时版本、模型和修订版);并采用两种后端以反映实际部署场景(vLLM用于现代Ada GPU的AWQ量化模型,Ollama/GGUF用于旧版Pascal/Turing GPU)。数据集以CSV文件形式提供,每个模态对应一个汇总文件。关键性能指标包括:服务模态的tokens/s、首令牌时间、每令牌输出时间;嵌入模态的embeddings/s;STT模态的实时因子和音频处理速度;视觉模态的延迟和吞吐量。数据集还包含已知限制说明,如旧GPU兼容性问题、硬件软件bug和大视觉模型内存要求。适用于硬件选型、容量规划和本地LLM部署性能预测等场景,由Scherm公司基于UFRGS的GPPD-HPC集群生产。

Scherm On-Premise LLM Inference Benchmark is a reproducible benchmark dataset for evaluating the local inference performance of large language models (LLMs) on real GPU hardware. It aims to measure three key dimensions for on-premise deployment: maximum model size capacity, throughput (tokens/s), and supported concurrent users, providing data support for the scale assessment of sovereign AI devices (product × users × GPU × cost). The dataset includes benchmark results for five modalities: conversation/code serving, embeddings generation, speech-to-text (STT), vision/OCR, and GGUF format model serving on legacy GPUs. Data covers six GPU models from Pascal to Ada Lovelace architectures (e.g., GTX 1080 Ti, Tesla P100, RTX 2080 Ti, RTX 4070, RTX 4090, L40S). The experiments employ a rigorous methodology: each test point is repeated at least 10 times, reporting median, interquartile range (IQR), p95/p99 percentiles, and 95% confidence intervals; fixed seeds ensure determinism; complete execution environments are recorded (GPU, driver, runtime versions, model, revision); and two backends are used to reflect real deployment scenarios (vLLM for AWQ quantized models on modern Ada GPUs, Ollama/GGUF for legacy Pascal/Turing GPUs unable to run vLLM). The dataset is provided as CSV files, with one summary file per modality. Key performance metrics include: tokens/s, time to first token (TTFT), and time per output token (TPOT) for serving; embeddings/s for embeddings; real-time factor (RTF) and audio processing speed for STT; and latency and throughput for vision. The dataset also includes known limitations, such as compatibility issues with older GPUs, software bugs on specific hardware, and memory requirements for large vision models. It is suitable for scenarios like hardware selection, capacity planning, and performance prediction for local LLM deployment, produced by Scherm based on the UFRGS GPPD-HPC cluster.

创建时间:
2026-05-29
原始信息汇总

数据集概述:Scherm 本地 LLM 推理基准测试 (v0.3.1)

该数据集为可复现的本地 GPU 上的大语言模型 (LLM) 推理性能基准测试,主要服务于本地化 AI 应用的硬件选型与容量规划。

  • 语言: 葡萄牙语 (pt)、英语 (en)
  • 许可: Apache-2.0
  • 标签: 基准测试, LLM 推理, 硬件, GPU, 本地部署, HPC, 主权AI
  • 发布者: Scherm (专注于 HPC 和主权AI)

数据集结构

数据集按不同的推理模态和场景,划分为以下 6 个配置 (Config),每个对应一个独立的 CSV 文件:

配置名称 文件 主要指标
serving serving_ALL.csv tokens/s (吞吐量), TTFT, TPOT (并发场景)
ollama ollama_ALL.csv tokens/s (聚合), TTFT (老GPU用GGUF)
embed embed_ALL.csv embeddings/s (RAG向量化,模型: BGE-M3)
stt stt_ALL.csv RTF (实时因子), 秒音频/秒 (语音转文字,模型: Whisper)
vision vision_ALL.csv 延迟/吞吐量 (视觉/OCR,模型: NuMarkdown-8B, Qwen2.5-VL)
rerank rerank_ALL.csv (query, doc) 对/秒 (RAG重排序,模型: bge-reranker-v2-m3)

该数据集覆盖了完整的本地 RAG 流水线:嵌入生成 → 重排序 → LLM → OCR → 语音转文字,共 6 种模态。

核心方法论

  • 严格性: 每个测试点进行 ≥10 次重复,报告中位数 + IQR + p95/p99 + 95% 置信区间,以处理非对称的延迟分布。
  • 确定性: 固定随机种子 (1234)、启用 enforce_eager 模式、设置环境变量 VLLM_ENABLE_V1_MULTIPROCESSING=0、丢弃预热数据。
  • 环境记录: 每次运行都记录 GPU 型号、驱动版本、运行时版本、模型和修订版本。
  • 双后端: 使用 vLLM (支持 AWQ 量化,针对 Ada 等现代 GPU) 和 Ollama/GGUF (用于不支持 vLLM 的 Pascal/Turing 老架构 GPU)。
  • 硬件覆盖: 涵盖 7 款 GPU (来自 NVIDIA 的 Pascal, Turing, Ada Lovelace 三代架构),以及 AMD Radeon RX 7900 XT (RDNA3, 20GB),提供了罕见的 NVIDIA vs AMD 本地 LLM 推理对比。

关键测试结果与硬件阶梯

以 Qwen2.5-7B 模型为例,展示了从经济型到企业级硬件的吞吐量 (tokens/s) 性能阶梯,表征了硬件规格与实际处理能力的关系。

GPU 架构 显存 后端 32用户时吞吐量 峰值吞吐量
GTX 1080 Ti Pascal 11 GB Ollama GGUF ~104 tok/s ~104 tok/s
Tesla P100 Pascal 16 GB Ollama GGUF ~101 tok/s ~101 tok/s
RTX 2080 Ti Turing 11 GB Ollama GGUF ~225 tok/s ~225 tok/s
RTX 4070 Ada Lovelace 12 GB vLLM AWQ ~981 tok/s 1,050 tok/s @64
RTX 4090 Ada Lovelace 24 GB vLLM AWQ ~1,098 tok/s 2,472 tok/s @128
L40S Ada Lovelace 46 GB vLLM AWQ (进行中)
  • 结论: 一张 RTX 4090 在同模型和同并发规模下,性能可达 GTX 1080 Ti 的约 10 倍,并能支持 128 个以上的并发用户。
  • 关键洞察: 显存 (VRAM) 比计算速度更重要。例如,14B 模型在 16GB 显存 (P100) 上运行良好 (~58 tok/s),但在 11GB 显存 (GTX 1080 Ti) 上会触发 CPU 卸载,导致性能骤降至 ~5 tok/s。
  • L40S 能力上限: 46GB 显存的 L40S 可运行最大 32B-AWQ 模型 (~640 tok/s @ 64用户),而 72B-AWQ 需要 80GB+ 显存。

其他亮点

  • 嵌入 (RAG): L40S 上 BGE-M3 模型可达 ~680 嵌入/秒,比 RTX 4070 快约 2.4 倍。
  • 语音转文字: Whisper large-v3 模型在 Ada GPU 上达到 RTF 0.006 (约 170 倍实时),可同时转录数十个音频流。

已知限制 (v0.1)

  • Pascal/Turing 架构的 GPU (计算能力 6.x/7.5) 由于 CUDA 版本兼容性问题,无法运行 vLLM,因此改用 Ollama/GGUF 后端。
  • L40S 与 vLLM v0.11.0 存在内核打包问题,需使用 latest image 解决。
  • VLM/OCR 模型的全精度版本在 12GB 显存上会导致 OOM 错误,需要 24GB+ 显存。
  • 语音转文字的 WER 和 OCR 的 CER 指标需要带标注的数据集 (如 Common Voice 葡萄牙语) 来评估,将在 v0.2 版本中补充。

复现与使用

  • 数据集根目录下的 scripts/ 文件夹提供了复现脚本:Python 执行器、Slurm 批处理脚本、矩阵启动器和数据合并脚本 (merge_results.py)。
  • 每个任务生成唯一的 CSV 分片,格式为 <模态>_<GPU>_<JobID>_<时间戳>_<模型>.csv,最终由 merge_results.py 整合。
  • 代码许可: Apache-2.0;数据许可: CC-BY-4.0。
搜集汇总
数据集介绍
onprem-llm-benchmark 数据集图片
构建方式
该数据集通过系统化的基准测试方法论构建,聚焦于本地部署的LLM推理性能评估。测试覆盖7款GPU(涵盖NVIDIA与AMD两大厂商的4种架构),并设计了包括文本生成(serving)、嵌入(embeddings)、语音转文本(STT)、视觉/OCR(vision)、重排序(rerank)以及基于GGUF格式的旧GPU推理(ollama)在内的六种模态。每个测试点执行至少10次重复,以中位数、四分位距及百分位数等统计指标确保结果鲁棒性。实验环境均被详细记录(如GPU型号、驱动版本、运行时库等),并通过固定随机种子和预热机制保证可复现性。数据集以CSV格式按模态分类存储,便于后续分析与比对。
特点
该数据集的核心特点在于其严谨的工程化设计与实用导向。首先,其测量维度聚焦于决定本地部署可行性的三大关键指标:能容纳的最大模型规模、吞吐量(tokens/s)及支持并发用户数,为硬件选型提供了直观参考。其次,数据涵盖了从老旧Pascal架构(如GTX 1080 Ti)到最新Ada Lovelace架构(如L40S)的完整性能阶梯,并首次在公开数据中系统比较了AMD RDNA3 GPU(RX 7900 XT)与NVIDIA竞品在LLM推理中的表现。此外,数据集还囊括了完整RAG管道的所有组件(嵌入、重排序、LLM推理、OCR及语音识别),提供了端到端性能评估的宝贵素材。
使用方法
用户可通过Hugging Face数据集库直接加载不同模态的子集(如'serving'、'embed')进行使用。数据集提供简洁的API接口,支持按GPU型号、模型规格或并发度等维度筛选数据,便于分析特定配置下的性能表现。所有测试脚本均开源在'scripts/'目录下,用户可通过Slurm作业管理系统或Python直接运行,复现完整的基准测试流程。数据以CSV格式记录,用户可自行借助数据分析工具(如Pandas)进行深度挖掘,或合并多个子集以构建自定义的性能对比视图。此数据集特别适用于需要评估本地硬件与模型适配性的企业或个人开发者。
背景与挑战
背景概述
随着大型语言模型在企业级应用中的普及,本地化部署成为关乎数据主权与隐私保护的关键议题。然而,不同GPU架构在推理性能上的差异显著,现有基准测试多聚焦于云端环境,缺乏对国产化和异构硬件生态的系统性评估。Scherm On-Premise LLM Inference Benchmark于2024年由巴西UFRGS大学的GPPD-HPC团队与Scherm公司联合发布,旨在为本地化LLM部署提供可重复的硬件选型依据。该基准覆盖NVIDIA及AMD的7款GPU与4种架构,首次在公开文献中纳入AMD Radeon RX 7900 XT与NVIDIA的横向对比,填补了本地推理领域跨厂商性能数据的空白。其核心研究问题为:在给定预算与用户规模下,如何选择最优GPU组合以最大化吞吐量并支持最大模型容量。该基准通过严格的ACM方法论(10次以上重复、中位数与四分位距统计)确保结果可信,为构建主权AI基础设施提供了科学决策工具。
当前挑战
该数据集主要应对两大挑战。领域层面,本地化LLM部署面临硬件异构性与性能不对称的难题:老旧Pascal/Turing架构GPU无法运行现代vLLM后端,仅能通过Ollama/GGUF方案降级使用,导致相似显存容量的GPU间吞吐差异可达10倍(如RTX 4090相较GTX 1080 Ti)。此外,不同模态任务(如文本生成、嵌入提取、语音识别)对显存与计算密度的需求迥异,单一硬件难以平衡全栈RAG管道的效率。构建过程中,团队遭遇多重技术壁垒:L40S在vLLM v0.11.0中因核心封装缺陷出现“无内核映像”错误,需临时切换至最新镜像;高端VLMs在12GB显存范围内直接导致OOM失败,迫使后续版本将测试门槛提升至24GB以上;同时,跨GPU的驱动版本与运行时环境需严格记录以消除噪声,增加了实验复现的复杂性。
常用场景
经典使用场景
在本地部署大语言模型(LLM)的决策过程中,该数据集被广泛用于评估不同硬件配置下的推理性能。通过测量三个核心维度——可容纳的最大模型、吞吐量(tokens/s)和支持的并发用户数——它为用户提供了一套可复现的基准测试结果。研究者与工程师可以依据这些数据,在GPU型号、内存容量和预算限制之间做出权衡,从而精准匹配算力需求与实际业务负载。例如,在Qwen2.5-7B模型上,RTX 4090相对于GTX 1080 Ti实现了约10倍的吞吐提升,这一对比极具参考价值。
衍生相关工作
该衍生数据集推动了多项经典工作的发展,包括但不限于基于真实GPU性能数据的硬件推荐系统、模型量化策略的性价比分析,以及跨架构推理框架的基准测试库。例如,研究者利用其中的GGUF和AWQ对比数据,提出了针对旧款GPU(如Pascal/Turing)的模型压缩与离线推理优化方案。同时,数据集中的多模态性能指标(如Vision/OCR延迟)启发了针对OCR与STT流水线的端到端加速研究。未来,随着DGX Spark(GB10)和B200等新硬件的纳入,该数据集有望成为本地LLM部署领域的标准化评估基石,并衍生出用于自动化容量规划与硬件选型的预测模型。
数据集最近研究
最新研究方向
该数据集深度聚焦于本地化大语言模型推理的性能基准测试,旨在量化不同硬件架构(从消费级GPU到企业级数据中心GPU)在运行LLM时的吞吐量、并发用户数及模型适配能力。其前沿价值体现在首次系统性地对比了NVIDIA与AMD GPU在本地推理场景下的表现差异,并覆盖了从传统Pascal架构到最新Ada Lovelace架构的历代硬件演变。研究热点紧密关联“主权AI”与“本地化部署”趋势,特别针对数据隐私敏感行业和算力受限环境,提供了一份可复现的硬件选型指南。通过精准呈现RTX 4090等消费级GPU在并发128用户时仍能保持高效推理,该基准测试不仅为云服务替代方案提供了量化依据,更推动了AI硬件资源利用效率的透明化评估,其方法论与数据集已成为HPC与边缘智能领域的重要参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务