遇见数据集

open-models-benchmark-results

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

该数据集是一个本地LLM评估排行榜,由@ahmedBargady维护。数据集的目的是系统性地评估和比较开源基础模型在本地集群环境下的性能,涵盖数学推理、常识推理和推理吞吐量三个维度。所有评估均在标准化的硬件配置上进行:2x NVIDIA A100-SXM4-80GB GPU(总计160GB显存),使用vLLM(v0.27.1)推理引擎和EleutherAI lm-evaluation-harness评估框架。数据集存储为CSV格式(`data/train.csv`),包含以下字段:模型名称、硬件/执行配置(如单GPU或双GPU张量并行)、精度(bfloat16、FP8、AWQ-int4等)、输入速度(tokens/s)、GSM8K严格精确匹配得分、HellaSwag长度归一化准确率得分以及评估日期。当前数据集包含13个模型/配置的评估结果,涵盖Qwen3.8-27B、DeepSeek-R1-Distill-Qwen-32B、Mistral-Small-24B-Instruct-2501等模型及其量化变体。该数据集适用于模型性能比较、量化与硬件配置的权衡分析,以及复现本地LLM评估。

This dataset is a local LLM evaluation leaderboard maintained by @ahmedBargady. The purpose of the dataset is to systematically evaluate and compare the performance of open-source base models in a local cluster environment, covering three dimensions: mathematical reasoning, commonsense reasoning, and inference throughput. All evaluations are conducted on standardized hardware configuration: 2x NVIDIA A100-SXM4-80GB GPU (total 160GB VRAM), using vLLM (v0.27.1) inference engine and EleutherAI lm-evaluation-harness framework. The dataset is stored in CSV format (`data/train.csv`), containing the following fields: model name, hardware/execution configuration (e.g., single GPU or dual GPU tensor parallelism), precision (bfloat16, FP8, AWQ-int4, etc.), input speed (tokens/s), GSM8K strict exact match score, HellaSwag length-normalized accuracy score, and evaluation date. The current dataset includes evaluation results for 13 model/configurations, covering models such as Qwen3.8-27B, DeepSeek-R1-Distill-Qwen-32B, Mistral-Small-24B-Instruct-2501, and their quantized variants. This dataset is suitable for model performance comparison, trade-off analysis between quantization and hardware configuration, and reproducing local LLM evaluations.

创建时间:
2026-08-22
原始信息汇总

⚡ 本地 LLM 评估排行榜数据集

数据集概览

这是由 @ahmedBargady 维护的公开基准测试排行榜,记录了开源权重基础模型在本地 NVIDIA A100 GPU 上的评估指标、准确率得分、吞吐量遥测数据及量化权衡分析。数据集采用 Apache 2.0 许可证,主要面向英文文本生成任务的模型评估。

硬件与系统配置

配置项 详情
维护者 @ahmedBargady
GPU 设置 2x NVIDIA A100-SXM4-80GB
总显存 160 GB
推理引擎 vLLM (v0.27.1) / CUDA 13.2
评估框架 EleutherAI lm-evaluation-harness

评估指标说明

本数据集从三个主要维度评估模型性能:

  1. GSM8K — 数学与多步推理能力,采用严格精确匹配(Strict Exact Match)评估。包含 8,500 道小学水平的数学应用题,测试模型的多步推理、算术计算和思维链逻辑能力。

    • 85.0%:卓越的数学与多步推理能力

    • 70.0% - 85.0%:较强的通用推理能力
    • < 60.0%:在多步算术或格式约束方面表现不足
  2. HellaSwag — 常识推理与自然语言推断能力,采用长度归一化准确率(Acc Norm)评估。测试模型对现实场景(体育活动、烹饪、日常人际互动等)最合理续写选项的选择能力。

    • 82.0%:最先进的常识理解与物理世界上下文对齐能力

    • 75.0% - 82.0%:良好的语言理解与上下文补全能力
    • ~25.0%:随机猜测基线(4 选 1 多项选择)
  3. 输入速度(tok/s) — 预填充吞吐量与推理遥测数据,衡量批处理评估期间 vLLM 下的每秒处理 token 数。更高的输入吞吐量意味着更快的提示处理速度和更低的首次 token 延迟。

    • TP=2(双 A100):可达 6,200+ tok/s,利用 NVLink 张量并行
    • TP=1(单 A100):根据模型架构和量化精度在 2,000 - 4,200 tok/s 之间变化

排行榜数据摘要

模型 硬件/执行 精度 输入速度 (tok/s) GSM8K HellaSwag 日期
Qwen/Qwen3.8-27B 2x A100 (TP=2) bfloat16 6,213.6 70.36% 82.85% 2026-08-22
Qwen/Qwen3.8-27B 1x A100 (TP=1) bfloat16 2,724.9 70.36% 82.80% 2026-08-22
Qwen/Qwen3.8-27B-FP8 1x A100 (TP=1) fp8 2,063.3 68.76% 82.91% 2026-08-22
deepseek-ai/DeepSeek-R1-Distill-Qwen-32B 1x A100 (TP=1) bfloat16 4,114.2 82.41% 81.86% 2026-08-22
casperhansen/deepseek-r1-distill-qwen-32b-awq 1x A100 (TP=1) awq-int4 3,036.5 86.20% 80.89% 2026-08-23
stelterlab/Mistral-Small-24B-Instruct-2501-AWQ 1x A100 (TP=1) awq-int4 4,240.3 89.16% 82.98% 2026-08-23
orcarouter/Qwen3.8-27B-Uncensored-FP8 1x A100 (TP=1) fp8 2,890.7 73.16% 82.91% 2026-08-23
RedHatAI/DeepSeek-R1-Distill-Qwen-32B-FP8-dynamic 1x A100 (TP=1) fp8-dynamic 3,571.9 81.73% 81.86% 2026-08-23
ornith-ai/Ornith-1.5-35B-A3B 1x A100 (TP=1) bfloat16 5,982.0 50.27% 81.02% 2026-08-23
mlasli/Qwen3.8-27B-Heretic-Uncensored-BF16 1x A100 (TP=1) bfloat16 3,895.0 58.76% 82.45% 2026-08-23
Qwen/Qwen3-8B 1x A100 (TP=1) bfloat16 16,348.7 87.57% 74.89% 2026-08-23
Qwen/Qwen3-0.6B 1x A100 (TP=1) bfloat16 134,702.1 42.00% 47.22% 2026-08-23
deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B 1x A100 (TP=1) bfloat16 63,708.2 70.36% 44.80% 2026-08-23
nvidia/Qwen3.6-35B-A3B-NVFP4 1x A100 (TP=1) nvfp4 7,782.5 2.43% 83.02% 2026-08-23

关键发现与权衡分析

  1. 量化影响(FP8 vs BF16)

    • GSM8K 数学推理:完整 bfloat16 为 70.36%,而 FP8 量化版本为 68.76%(仅下降约 1.6%,但显存占用降低 50%)
    • HellaSwag 常识 NLI:两个模型表现几乎一致(82.80% vs 82.91%)
  2. 张量并行扩展(2x A100 vs 1x A100)

    • 通过张量并行扩展到 2 块 A100 GPU,预填充吞吐量从 2,724.9 tok/s 提升至 6,213.6 tok/s(加速 2.28 倍)

仓库文件结构

  • data/train.csv:驱动 Hugging Face 原生数据集查看器的结构化 CSV 表格数据
  • leaderboard.csv:基准测试摘要指标的主副本
  • hf_bench_results.json:包含每个样本的提示日志、似然值和模型配置的原始输出 JSON
  • README.md:数据集卡片文档
搜集汇总
数据集介绍
open-models-benchmark-results 数据集图片
构建方式
该数据集构建于统一规范化的本地集群评测环境之中,依托双路NVIDIA A100-SXM4-80GB GPU(总计160GB显存)与vLLM推理引擎(v0.27.1,CUDA 13.2)作为基础硬件设施,借助EleutherAI的lm-evaluation-harness框架,对开源权重基础模型实施多维度的性能度量。评测体系涵盖数学推理(GSM8K)、常识推理(HellaSwag)以及真实场景下的预填充吞吐量三个核心维度。模型在严格控制张量并行度与精度(bfloat16、FP8、AWQ等)的前提下逐一执行标准任务,所得原始日志经结构化处理汇入CSV表格,形成可供交互式查阅的排行榜数据集。
使用方法
使用者可通过读取CSV表格或利用Hugging Face数据集查看器直接访问各模型的性能指标,便于进行横向对比与趋势洞察。如需复现实验流程,可参照README中提供的命令行指引,利用vLLM后端与lm-evaluation-harness工具,通过设置模型名称、张量并行度、精度类型及显存利用率等关键参数,在本地环境逐步执行GSM8K和HellaSwag评测任务。整个流程强调参数配置的透明化与结果的可追溯性,为研究者和工程师提供了标准化的评测范式,有助于推动高效、稳健的开源模型落地应用。
背景与挑战
背景概述
开放权重基础模型的迅猛发展催生了对其性能进行系统性评估的迫切需求。在此背景下,由研究者Ahmed Bargady于2026年创建并维护的open-models-benchmark-results数据集应运而生,旨在为本地部署的大语言模型提供标准化的基准评测平台。该数据集专注于记录在NVIDIA A100 GPU环境下,多种模型在不同精度(包括bfloat16、FP8、AWQ等)配置下的数学推理能力、常识推理能力以及实际吞吐量表现,涵盖Qwen、DeepSeek、Mistral等系列模型。通过将推理引擎统一至vLLM并采用EleutherAI lm-evaluation-harness框架,该数据集为研究者提供了可复现的评估流程,促进了模型量化与推理效率之间的权衡分析,对边缘部署和资源受限场景下的模型选型具有重要指导意义。
当前挑战
该数据集所面临的挑战首先体现在领域普遍存在的评估基准与真实应用场景之间的偏差,即单一静态基准难以全面捕捉模型在多样化任务中的泛化能力,尤其对于数学推理这类需要严格格式匹配的任务,细微的提示差异或解码参数变化都可能导致显著的性能波动。其次,数据集构建过程中反映出量化模型的性能稳定性问题,例如FP8量化在保留常识推理能力的同时,数学推理精度出现下滑,而AWQ等混合精度方案则表现出更复杂的性能曲线,这揭示了量化与模型能力之间非线性的相互作用,增加了公平比较不同优化策略的难度。此外,硬件扩展的线性加速假设受到挑战,双卡张量并行虽能提升吞吐量,但性能增益受限于模型架构和通信开销,且不同模型在同一硬件配置下的吞吐差异巨大,如何构建一个兼顾多维度指标且可解释的综合评估体系仍是开放性问题。
常用场景
经典使用场景
该数据集作为开源模型基准测试排行榜,为评估大型语言模型在本地环境中的综合性能提供了标准化的评测框架。其经典使用场景聚焦于多维度模型能力对比,涵盖数学推理(GSM8K)、常识推理(HellaSwag)以及推理吞吐量(Prefill tok/s)三大核心指标。研究者和工程师可依据此数据集,在统一硬件配置(如NVIDIA A100)与推理引擎(vLLM)下,客观比较不同开源模型、不同量化精度(bfloat16、FP8、AWQ)及不同张量并行设置对模型性能与效率的权衡影响。
解决学术问题
该数据集系统性地解决了开源模型评估中普遍存在的基准不统一、硬件环境差异大、量化影响评估缺失等学术难题。通过规范化评测流程与指标,它使研究者能够精确量化模型压缩技术(如量化)对推理准确率的具体影响,揭示张量并行扩展带来的性能增益规律,并为模型选型与部署决策提供了可靠的数据支撑。其发布填补了针对本地化部署场景的公开基准数据空白,促进了可复现、可比较的模型评估研究,对推动高效、经济的开源模型应用具有重要意义。
实际应用
在实际应用中,该数据集是工程团队进行模型选型与硬件配置评估的关键工具。它直接服务于大语言模型的本地化部署优化,工程师可参考榜单数据,结合具体业务需求(如数学能力优先或高吞吐量优先),在众多候选模型与量化版本中做出权衡抉择。同时,该数据集的实测吞吐量数据为容量规划、成本估算及性能调优提供了量化依据,尤其适用于对数据隐私敏感、需在私有GPU集群上部署模型的企事业单位。
数据集最近研究
最新研究方向
当前,开源大模型评测领域正经历从单一性能指标向多维效能评估的深刻变革,该数据集以标准化本地集群为依托,聚焦数学推理、常识推理与吞吐量的联合分析,揭示了模型精度与推理效率间的微妙平衡。前沿方向涵盖量化感知的权衡解析,如FP8与BF16在GSM8K上展现的微小精度差异与显存占用减半的显著收益,以及张量并行扩展性的实证,如双卡A100将预填充吞吐提升2.28倍。尤其值得关注的是,不同架构与量化策略的组合(如AWQ、动态FP8)正促使评测向更细粒度的鲁棒性、部署适配性延伸,为高效本地推理的工程选型提供了关键参考,推动了开源模型在真实场景中的落地评估革新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务