4x RTX 3090 LLM benchmark archive
收藏资源简介:
这是一个包含638个本地推理测量结果的基准测试数据集,来自一个配备4x RTX 3090 GPU的96 GB家用设备。数据集详细记录了模型检查点、量化方法、KV数据类型、TP布局、引擎构建、工作负载(如提示长度、输出长度)以及性能指标(如每秒令牌数)。数据以Markdown目录、SQLite数据库和JSONL格式提供,支持查询和分析,旨在提供可复现和可比较的基准测试结果。
This is a benchmark dataset containing 638 local inference measurement results, sourced from a 96 GB home workstation equipped with 4x RTX 3090 GPUs. The dataset comprehensively records model checkpoints, quantization methods, KV data types, tensor parallel (TP) layout, engine build configurations, workload parameters (including prompt length, output length), and performance metrics such as tokens per second. The data is provided in Markdown tables, SQLite databases, and JSONL formats, supporting query and analysis operations, with the core objective of providing reproducible and comparable benchmark results.
数据集概述
这是一个4× RTX 3090 本地推理基准测试存档,包含来自同一台96GB家用主机的638次本地推理测量结果,其中637次附带了确切的启动命令。
核心数据特征
- 覆盖范围:638个测量结果来自 20个基准测试活动,涵盖 14个模型系列。
- 支持引擎:主要包括 vLLM (531行)、llama.cpp (69行),以及实验性 exllamav3 (38行)。
- 量化类别:包含 23种 量化类别,如 AutoRound INT4、AWQ INT4、Laguna 对称 INT4 等,未被笼统归为“INT4”。
关键区别与定位
- 本仓库是一个 基准测试存档,而非排行榜。不同活动间的测试工具和变量可能不同,因此某些行不应直接比较。
- 每个结果都保留了重现或理解其上下文所需的关键信息,包括:
- 模型工件(检查点、量化方式、源版本)
- 运行时(引擎、版本、注意力后端、KV缓存数据类型)
- GPU布局(TP、PP、DP、实例数、功率限制、P2P状态)
- 工作负载(提示长度、输出长度、并发数、上下文限制)
- 指标含义(单流壁钟速率、解码速率、聚合吞吐量、TTFT)
- 执行凭证(确切的启动命令或参数、源工件、归一化状态)
值得关注的示例分析
- Qwen3.5-122B 量化对比:在相同 TP4、220W 设置下,AutoRound INT4 达到 110.5 tok/s,而 AWQ INT4 为 92.7 tok/s,差异达 19.2%。
- Qwen3.6-27B TP 与 P2P 矩阵:单流 AutoRound 测试中,TP4 获胜(69.26 vs 53.8 tok/s);并发数64时,TP2 产生 473.1 tok/s 聚合吞吐量,而 TP4 为 294.76 tok/s。最优布局取决于工作负载。
- KV-cache 扫描:包含 55次 跨上下文深度和 KV 格式的测试,指标语义分离。
- Laguna S 2.1 DFlash 矩阵:包含短提示、长上下文、前缀重用和并发等场景下的 target-only、K7、K15 测量。
快速查询方式
- SQLite:数据文件
data/benchmarks.sqlite包含所有638行,可直接查询。 - JSONL:
data/benchmarks.jsonl为公开源文件。 - Python脚本:
scripts/query.py是轻量级的无依赖 JSONL 查询助手。
硬件配置
- 设备:4× RTX 3090,运行于 PCIe 3.0 x16,总计 96 GB VRAM,无 NVLink。
- P2P状态:CUDA P2P 已启用并通过所有12个定向 GPU 对的数据传输验证。
- 功率限制:大多数运行使用 220 W 的每卡功率限制。
相关资源链接




