onprem-llm-benchmark
收藏资源简介:
Scherm On-Premise LLM Inference Benchmark 是一个用于评估大型语言模型(LLM)在真实GPU硬件上本地推理性能的可复现基准测试数据集。它旨在衡量本地部署的三个关键维度:最大可容纳模型大小、吞吐量(tokens/s)和并发用户数支持,为主权AI设备的规模评估(产品×用户数×GPU×成本)提供数据支持。数据集包含五个模态的基准测试结果:对话/代码服务、嵌入生成、语音转文本、视觉/OCR以及旧版GPU上的GGUF格式模型服务。数据覆盖从Pascal到Ada Lovelace架构的六种GPU型号(如GTX 1080 Ti、Tesla P100、RTX 2080 Ti、RTX 4070、RTX 4090、L40S)。实验采用严谨方法:每个测试点进行至少10次重复,报告中位数、四分位距、p95/p99分位数和95%置信区间;使用固定种子确保确定性;记录完整的执行环境(包括GPU、驱动、运行时版本、模型和修订版);并采用两种后端以反映实际部署场景(vLLM用于现代Ada GPU的AWQ量化模型,Ollama/GGUF用于旧版Pascal/Turing GPU)。数据集以CSV文件形式提供,每个模态对应一个汇总文件。关键性能指标包括:服务模态的tokens/s、首令牌时间、每令牌输出时间;嵌入模态的embeddings/s;STT模态的实时因子和音频处理速度;视觉模态的延迟和吞吐量。数据集还包含已知限制说明,如旧GPU兼容性问题、硬件软件bug和大视觉模型内存要求。适用于硬件选型、容量规划和本地LLM部署性能预测等场景,由Scherm公司基于UFRGS的GPPD-HPC集群生产。
Scherm On-Premise LLM Inference Benchmark is a reproducible benchmark dataset for evaluating the local inference performance of large language models (LLMs) on real GPU hardware. It aims to measure three key dimensions for on-premise deployment: maximum model size capacity, throughput (tokens/s), and supported concurrent users, providing data support for the scale assessment of sovereign AI devices (product × users × GPU × cost). The dataset includes benchmark results for five modalities: conversation/code serving, embeddings generation, speech-to-text (STT), vision/OCR, and GGUF format model serving on legacy GPUs. Data covers six GPU models from Pascal to Ada Lovelace architectures (e.g., GTX 1080 Ti, Tesla P100, RTX 2080 Ti, RTX 4070, RTX 4090, L40S). The experiments employ a rigorous methodology: each test point is repeated at least 10 times, reporting median, interquartile range (IQR), p95/p99 percentiles, and 95% confidence intervals; fixed seeds ensure determinism; complete execution environments are recorded (GPU, driver, runtime versions, model, revision); and two backends are used to reflect real deployment scenarios (vLLM for AWQ quantized models on modern Ada GPUs, Ollama/GGUF for legacy Pascal/Turing GPUs unable to run vLLM). The dataset is provided as CSV files, with one summary file per modality. Key performance metrics include: tokens/s, time to first token (TTFT), and time per output token (TPOT) for serving; embeddings/s for embeddings; real-time factor (RTF) and audio processing speed for STT; and latency and throughput for vision. The dataset also includes known limitations, such as compatibility issues with older GPUs, software bugs on specific hardware, and memory requirements for large vision models. It is suitable for scenarios like hardware selection, capacity planning, and performance prediction for local LLM deployment, produced by Scherm based on the UFRGS GPPD-HPC cluster.
数据集概述:Scherm 本地 LLM 推理基准测试 (v0.3.1)
该数据集为可复现的本地 GPU 上的大语言模型 (LLM) 推理性能基准测试,主要服务于本地化 AI 应用的硬件选型与容量规划。
- 语言: 葡萄牙语 (pt)、英语 (en)
- 许可: Apache-2.0
- 标签: 基准测试, LLM 推理, 硬件, GPU, 本地部署, HPC, 主权AI
- 发布者: Scherm (专注于 HPC 和主权AI)
数据集结构
数据集按不同的推理模态和场景,划分为以下 6 个配置 (Config),每个对应一个独立的 CSV 文件:
| 配置名称 | 文件 | 主要指标 |
|---|---|---|
serving |
serving_ALL.csv | tokens/s (吞吐量), TTFT, TPOT (并发场景) |
ollama |
ollama_ALL.csv | tokens/s (聚合), TTFT (老GPU用GGUF) |
embed |
embed_ALL.csv | embeddings/s (RAG向量化,模型: BGE-M3) |
stt |
stt_ALL.csv | RTF (实时因子), 秒音频/秒 (语音转文字,模型: Whisper) |
vision |
vision_ALL.csv | 延迟/吞吐量 (视觉/OCR,模型: NuMarkdown-8B, Qwen2.5-VL) |
rerank |
rerank_ALL.csv | (query, doc) 对/秒 (RAG重排序,模型: bge-reranker-v2-m3) |
该数据集覆盖了完整的本地 RAG 流水线:嵌入生成 → 重排序 → LLM → OCR → 语音转文字,共 6 种模态。
核心方法论
- 严格性: 每个测试点进行 ≥10 次重复,报告中位数 + IQR + p95/p99 + 95% 置信区间,以处理非对称的延迟分布。
- 确定性: 固定随机种子 (1234)、启用
enforce_eager模式、设置环境变量VLLM_ENABLE_V1_MULTIPROCESSING=0、丢弃预热数据。 - 环境记录: 每次运行都记录 GPU 型号、驱动版本、运行时版本、模型和修订版本。
- 双后端: 使用 vLLM (支持 AWQ 量化,针对 Ada 等现代 GPU) 和 Ollama/GGUF (用于不支持 vLLM 的 Pascal/Turing 老架构 GPU)。
- 硬件覆盖: 涵盖 7 款 GPU (来自 NVIDIA 的 Pascal, Turing, Ada Lovelace 三代架构),以及 AMD Radeon RX 7900 XT (RDNA3, 20GB),提供了罕见的 NVIDIA vs AMD 本地 LLM 推理对比。
关键测试结果与硬件阶梯
以 Qwen2.5-7B 模型为例,展示了从经济型到企业级硬件的吞吐量 (tokens/s) 性能阶梯,表征了硬件规格与实际处理能力的关系。
| GPU | 架构 | 显存 | 后端 | 32用户时吞吐量 | 峰值吞吐量 |
|---|---|---|---|---|---|
| GTX 1080 Ti | Pascal | 11 GB | Ollama GGUF | ~104 tok/s | ~104 tok/s |
| Tesla P100 | Pascal | 16 GB | Ollama GGUF | ~101 tok/s | ~101 tok/s |
| RTX 2080 Ti | Turing | 11 GB | Ollama GGUF | ~225 tok/s | ~225 tok/s |
| RTX 4070 | Ada Lovelace | 12 GB | vLLM AWQ | ~981 tok/s | 1,050 tok/s @64 |
| RTX 4090 | Ada Lovelace | 24 GB | vLLM AWQ | ~1,098 tok/s | 2,472 tok/s @128 |
| L40S | Ada Lovelace | 46 GB | vLLM AWQ | (进行中) | — |
- 结论: 一张 RTX 4090 在同模型和同并发规模下,性能可达 GTX 1080 Ti 的约 10 倍,并能支持 128 个以上的并发用户。
- 关键洞察: 显存 (VRAM) 比计算速度更重要。例如,14B 模型在 16GB 显存 (P100) 上运行良好 (~58 tok/s),但在 11GB 显存 (GTX 1080 Ti) 上会触发 CPU 卸载,导致性能骤降至 ~5 tok/s。
- L40S 能力上限: 46GB 显存的 L40S 可运行最大 32B-AWQ 模型 (~640 tok/s @ 64用户),而 72B-AWQ 需要 80GB+ 显存。
其他亮点
- 嵌入 (RAG): L40S 上 BGE-M3 模型可达 ~680 嵌入/秒,比 RTX 4070 快约 2.4 倍。
- 语音转文字: Whisper large-v3 模型在 Ada GPU 上达到 RTF 0.006 (约 170 倍实时),可同时转录数十个音频流。
已知限制 (v0.1)
- Pascal/Turing 架构的 GPU (计算能力 6.x/7.5) 由于 CUDA 版本兼容性问题,无法运行 vLLM,因此改用 Ollama/GGUF 后端。
- L40S 与 vLLM v0.11.0 存在内核打包问题,需使用
latestimage 解决。 - VLM/OCR 模型的全精度版本在 12GB 显存上会导致 OOM 错误,需要 24GB+ 显存。
- 语音转文字的 WER 和 OCR 的 CER 指标需要带标注的数据集 (如 Common Voice 葡萄牙语) 来评估,将在 v0.2 版本中补充。
复现与使用
- 数据集根目录下的
scripts/文件夹提供了复现脚本:Python 执行器、Slurm 批处理脚本、矩阵启动器和数据合并脚本 (merge_results.py)。 - 每个任务生成唯一的 CSV 分片,格式为
<模态>_<GPU>_<JobID>_<时间戳>_<模型>.csv,最终由merge_results.py整合。 - 代码许可: Apache-2.0;数据许可: CC-BY-4.0。




