遇见数据集

4x RTX 3090 LLM benchmark archive

收藏
github2026-07-28 更新2026-07-29 收录
官方服务:

资源简介:

这是一个包含638个本地推理测量结果的基准测试数据集,来自一个配备4x RTX 3090 GPU的96 GB家用设备。数据集详细记录了模型检查点、量化方法、KV数据类型、TP布局、引擎构建、工作负载(如提示长度、输出长度)以及性能指标(如每秒令牌数)。数据以Markdown目录、SQLite数据库和JSONL格式提供,支持查询和分析,旨在提供可复现和可比较的基准测试结果。

This is a benchmark dataset containing 638 local inference measurement results, sourced from a 96 GB home workstation equipped with 4x RTX 3090 GPUs. The dataset comprehensively records model checkpoints, quantization methods, KV data types, tensor parallel (TP) layout, engine build configurations, workload parameters (including prompt length, output length), and performance metrics such as tokens per second. The data is provided in Markdown tables, SQLite databases, and JSONL formats, supporting query and analysis operations, with the core objective of providing reproducible and comparable benchmark results.

创建时间:
2026-07-28
原始信息汇总

数据集概述

这是一个4× RTX 3090 本地推理基准测试存档,包含来自同一台96GB家用主机的638次本地推理测量结果,其中637次附带了确切的启动命令。

核心数据特征

  • 覆盖范围:638个测量结果来自 20个基准测试活动,涵盖 14个模型系列
  • 支持引擎:主要包括 vLLM (531行)llama.cpp (69行),以及实验性 exllamav3 (38行)
  • 量化类别:包含 23种 量化类别,如 AutoRound INT4、AWQ INT4、Laguna 对称 INT4 等,未被笼统归为“INT4”。

关键区别与定位

  • 本仓库是一个 基准测试存档,而非排行榜。不同活动间的测试工具和变量可能不同,因此某些行不应直接比较。
  • 每个结果都保留了重现或理解其上下文所需的关键信息,包括:
    • 模型工件(检查点、量化方式、源版本)
    • 运行时(引擎、版本、注意力后端、KV缓存数据类型)
    • GPU布局(TP、PP、DP、实例数、功率限制、P2P状态)
    • 工作负载(提示长度、输出长度、并发数、上下文限制)
    • 指标含义(单流壁钟速率、解码速率、聚合吞吐量、TTFT)
    • 执行凭证(确切的启动命令或参数、源工件、归一化状态)

值得关注的示例分析

  • Qwen3.5-122B 量化对比:在相同 TP4、220W 设置下,AutoRound INT4 达到 110.5 tok/s,而 AWQ INT4 为 92.7 tok/s,差异达 19.2%
  • Qwen3.6-27B TP 与 P2P 矩阵:单流 AutoRound 测试中,TP4 获胜(69.26 vs 53.8 tok/s);并发数64时,TP2 产生 473.1 tok/s 聚合吞吐量,而 TP4 为 294.76 tok/s。最优布局取决于工作负载。
  • KV-cache 扫描:包含 55次 跨上下文深度和 KV 格式的测试,指标语义分离。
  • Laguna S 2.1 DFlash 矩阵:包含短提示、长上下文、前缀重用和并发等场景下的 target-only、K7、K15 测量。

快速查询方式

  • SQLite:数据文件 data/benchmarks.sqlite 包含所有638行,可直接查询。
  • JSONLdata/benchmarks.jsonl 为公开源文件。
  • Python脚本scripts/query.py 是轻量级的无依赖 JSONL 查询助手。

硬件配置

  • 设备:4× RTX 3090,运行于 PCIe 3.0 x16,总计 96 GB VRAM无 NVLink
  • P2P状态:CUDA P2P 已启用并通过所有12个定向 GPU 对的数据传输验证。
  • 功率限制:大多数运行使用 220 W 的每卡功率限制。

相关资源链接

搜集汇总
数据集介绍
4x RTX 3090 LLM benchmark archive 数据集图片
构建方式
该数据集源自一台配备4块RTX 3090显卡、总计96 GB显存的家用服务器,旨在系统性地记录大规模语言模型在本地推理场景下的性能表现。构建过程遵循严谨的实验设计,每一组测量均附带详细的运行上下文,包括模型检查点、量化方案、引擎版本、张量并行(TP)与流水线并行(PP)布局、功率限制、工作负载参数(如提示长度和并发数)以及精确的启动命令。数据采集覆盖了vLLM、llama.cpp和实验性的exllamav3三种推理引擎,共收集了638次独立测量结果,其中637次保留了完整的命令行记录。所有数据以JSONL格式存储为公共源文件,并同步构建了可查询的SQLite数据库,便于后续分析与复现。
特点
该数据集的核心特点在于其高度的结构化和可复现性。它并非简单的排行榜,而是一个包含丰富元数据的性能档案库,避免了传统基准测试中仅记录单一令牌生成速率的局限性。每一条记录都详细标注了模型族(涵盖14个家族)、量化类别(细分为AutoRound INT4、AWQ INT4等23种,而非统一归为INT4)、注意力后端、KV缓存数据类型、GPU拓扑结构及P2P状态等信息。这种细粒度的分类使得研究者能够精确对比不同配置下的性能差异,例如在同一硬件上,AutoRound INT4较AWQ INT4提升了19.2%的吞吐量。数据集还区分了单流解码速率与聚合吞吐量等不同指标,确保了比较的公平性与科学性。
使用方法
使用者可通过多种方式高效利用该数据集。直接克隆仓库后,可使用SQLite命令行工具对benchmarks.sqlite文件进行灵活查询,例如筛选特定模型和引擎下的性能数据。同时,仓库提供了轻量级的Python脚本scripts/query.py,支持按模型、引擎或实验计划进行过滤,并输出JSONL格式的结果。对于深度分析,可直接解析data/benchmarks.jsonl文件,结合METHODOLOGY.md中的指标定义与比较规则,自定义对比实验。此外,catalog目录下按模型、实验计划和引擎整理了可读性强的Markdown文档,便于快速浏览和提取关键案例,如Qwen3.5-122B的量化对比实验或KV缓存扫描的多维度结果。
背景与挑战
背景概述
该数据集创建于2024年,由研究者alesha-pro维护,旨在系统性地记录在4x RTX 3090(96 GB VRAM)家用设备上推理大型语言模型(LLM)的详细测量结果。核心研究问题在于,现有多数基准测试仅提供模型名称和单一每秒令牌数(tok/s),忽略了诸如检查点、量化方案、KV缓存数据类型、张量并行(TP)布局、引擎版本等关键变量,导致结果难以复现和对比。该档案收录了来自14个模型家族、20个基准测试活动的638次测量,涵盖vLLM、llama.cpp及exllamav3引擎,并保留了637次运行的确切启动命令。该数据集的价值在于提供了高保真的上下文信息,使研究者能够深入理解不同配置对推理性能的影响,填补了社区在高规格多GPU环境下细粒度LLM性能数据的空白,对模型部署优化和硬件适配研究具有重要参考意义。
当前挑战
该数据集所解决的领域挑战在于,LLM推理性能受众多参数(如量化类型、注意力后端、拓扑布局)交织影响,传统单一指标的基准报告方式无法反映真实性能差异,甚至导致误导性比较。例如,AutoRound INT4与AWQ INT4在同设备上的吞吐差异可达19.2%,而TP4与TP2在不同并发下的表现截然相反,这凸显了缺乏标准化、多维度的性能记录方法的困境。构建过程中面临的主要挑战包括:1)需要严格记录每个测量结果的完整上下文(共23种量化类别、多个引擎版本及拓扑组合),确保数据可复现;2)测试矩阵庞大且纵向时间跨度长,不同活动间测试变量(如工作负载、功率限制)可能不同,因此需明确标识可比性条件,避免外行误用;3)在PCIe 3.0 x16拓扑下无NVLink,需验证CUDA P2P传输并管理220 W功率限制对性能的影响,这些物理约束增加了结果解读的复杂度。
常用场景
经典使用场景
该数据集聚焦于4块RTX 3090组建的96GB显存本地推理系统,为大规模语言模型在消费级多GPU环境下的推理性能提供了详尽的基准测试档案。其经典使用场景涵盖模型在不同量化方案(如AutoRound INT4、AWQ INT4)、张量并行策略(TP2、TP4)、键值缓存数据类型以及功率限制下的端到端推理速度与吞吐量对比,特别适用于评估在显存受限但具备多卡互联能力的硬件上运行70B至122B参数量级模型的可行性与最优配置。
实际应用
在实际部署场景中,该数据集直接指导了在无NVLink的PCIe 3.0多卡系统上运行大模型的工程决策。基于其记录的不同并发度下TP2与TP4的吞吐表现(如64并发时473.1 vs 294.76 tok/s),开发者能够依据实际服务负载特征选择最优的张量并行配置;同时,通过对比AutoRound与AWQ等量化方案的性能差异(19.2%),可为边缘计算、本地私有化部署或云成本敏感型推理服务提供量化方案选型依据,从而在显存、延迟与吞吐三者间达成工程权衡。
衍生相关工作
该数据集衍生了一系列聚焦多卡推理优化与量化技术的深度分析工作,包括针对CUDA P2P状态对张量并行效率影响的系统探究、全定制all-reduce通信原语在4x3090场景下的性能测评,以及不同键值缓存深度与格式组合下的推理行为建模。此外,其高精度启动命令记录能力催生了基于trace的完整原始运行时数据开源项目(如laguna-dflash-4x3090),为后续研究者在模拟器校准、功耗预测模型构建及异构计算调度策略设计等领域提供了珍贵的参考基线与验证基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务