遇见数据集

gdpval-evals

收藏
Hugging Face2026-06-07 更新2026-06-08 收录
官方服务:

资源简介:

GDPVal Hermes Agent vLLM 评估追踪数据集是一个私有的评估产物存储库,用于记录和分析Hermes智能体在本地通过vLLM服务在NVFP4和FP8量化大型语言模型上执行GDPVal(OpenAI)基准测试的结果。数据集包含每次评估运行的详细产出文件,如运行摘要、按任务统计的使用情况文件以及每个请求的遥测日志(存储于`agent_requests.jsonl`并归档于`telemetry.tar.gz`)。评估围绕220个任务展开,核心评估指标为平均奖励(`avg_reward`)。数据集提供了全面的模型性能矩阵,包括已完成评估的头条结果(涵盖Qwen、Gemma、Nemotron等多个模型系列的不同量化版本)以及因基础设施问题而处于待处理/部分完成状态的运行记录。此外,数据集详尽记录了每个模型在评估时使用的精确vLLM服务配置(Docker命令和参数),确保了评估环境的可复现性。除了基础性能分数,数据集还包含深入的性能分析指标:多令牌预测(MTP)草稿令牌的逐位置接受率分析、部分运行的llama.cpp引擎计时详情(如TTFT、吞吐量)、每次运行的元数据(如使用的代理、引擎、评判模型、硬件)以及详细的代理端令牌消耗统计。该数据集适用于研究大型语言模型在智能体任务中的性能、比较不同量化技术(如FP8、NVFP4、AWQ、GPTQ)的效果、分析推测解码策略的效率,以及评估服务配置对模型推理性能和资源消耗的影响。

The GDPVal Hermes Agent vLLM Evaluation Tracking Dataset is a proprietary evaluation artifact repository designed to record and analyze the results of GDPVal (OpenAI) benchmark tests executed by Hermes Agent on large language models quantized with NVFP4 and FP8 formats via local vLLM serving services. The dataset contains detailed output files from each evaluation run, including run summaries, task-wise usage statistics files, and telemetry logs for every request, which are stored in "agent_requests.jsonl" and archived in "telemetry.tar.gz". The evaluation covers 220 tasks, with the core evaluation metric being average reward ("avg_reward"). The dataset provides a comprehensive model performance matrix, including headline results of completed evaluations covering various quantized versions of multiple model families such as Qwen, Gemma, and Nemotron, as well as run records that are pending or partially completed due to infrastructure issues. In addition, the dataset thoroughly documents the exact vLLM service configurations (Docker commands and parameters) used for each model during evaluation, ensuring the reproducibility of the evaluation environment. Beyond basic performance scores, the dataset also includes in-depth performance analysis metrics: per-position acceptance rate analysis of draft tokens for Multi-Token Prediction (MTP), timing details of the llama.cpp engine for partial runs such as Time to First Token (TTFT) and throughput, metadata for each run (e.g., used agent, engine, judging model, hardware), and detailed token consumption statistics on the agent side. This dataset is applicable to research on the performance of large language models in agent tasks, comparing the effects of different quantization techniques such as FP8, NVFP4, AWQ, GPTQ, analyzing the efficiency of speculative decoding strategies, and evaluating the impact of service configurations on model inference performance and resource consumption.

创建时间:
2026-06-05
原始信息汇总

数据集概述:GDPVal Hermes Agent vLLM Evaluation Traces

该数据集包含基于 OpenAI GDPVal 基准的 Hermes Agent 评估工件,所有评估均针对由 vLLM 服务的本地 NVFP4 和 FP8 模型进行。数据集本质上是一个工件存储库,而非经过清洗的行式数据集,其核心数据存在于运行摘要、按任务划分的使用文件以及按请求记录的遥测日志中。

核心指标

  • avg_reward:所有 220 个任务的平均奖励值,是衡量模型性能的关键指标。
  • pass_at_1:为与 tau2 参考模式保持向后兼容而提供,但在 GDPVal 上过于稀疏,无法有效区分模型(最佳运行约 5%)。建议使用 avg_reward 及其分布。

数据结构

布局与 exolabs/tau2-hermes-nemotron-eval-data 一致:每个完成的运行位于顶层 <model-shortname>_<TS>/ 目录下。目录内包含运行摘要、按任务的使用文件、以及归档的每请求遥测日志(agent_requests.jsonl)。

主要评估结果(Headline Matrix)

下表展示了已完成评估且结果完整的模型性能排名。

排名 模型 任务数 平均奖励 中位数奖励 pass@1 零奖励任务数 最大轮次命中
1 Jackrong/Qwopus3.6-27B-v2 219 0.7203 0.7800 0.0320 4 6
2 sakamakismile/Qwen3.6-27B-NVFP4 20 0.6447 0.8146 0.0500 2 0
3 cyankiwi/Qwen3.6-35B-A3B-AWQ-4bit 219 0.5873 0.7111 0.0228 43 4
4 sakamakismile/Qwen3.6-27B-Text-NVFP4-MTP 219 0.5837 0.7455 0.0183 39 1
5 google/gemma-4-31B-it 220 0.5663 0.5982 0.0091 10 0
6 Qwen/Qwen3.6-35B-A3B-FP8 219 0.5533 0.6727 0.0365 43 8
7 Qwen/Qwen3.6-27B 219 0.5280 0.6667 0.0091 50 1
8 leon-se/gemma-4-E2B-it-FP8-Dynamic 219 0.1717 0.0000 0.0000 135 0
9 leon-se/gemma-4-E2B-it-FP8-Dynamic 220 0.1556 0.0000 0.0091 136 0
10 nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4 219 0.0000 0.0000 0.0000 219 0

最大轮次命中 指因达到代理交互上限而截断的任务,这些任务被视为模型输出结果(奖励为0),而非基础设施故障。

待处理/部分运行结果

以下模型的评估因基础设施或实施故障而未能完全完成,目前被隔离。

模型 总任务数 已评分 待处理故障数 部分平均奖励 状态
cyankiwi/gemma-4-26B-A4B-it-AWQ-4bit 220 70 150 0.4732 存在基础设施故障
cyankiwi/gemma-4-31B-it-AWQ-4bit 220 220 0 0.5441 存在缺失任务
leon-se/gemma-4-E4B-it-FP8-Dynamic 219 219 0 0.1968 存在缺失任务
openai/gpt-oss-120b 219 218 1 0.4883 存在基础设施故障
openai/gpt-oss-20b 219 88 131 0.0000 存在基础设施故障
LiquidAI/LFM2.5-8B-A1B 219 219 0 0.0595 存在缺失任务
mimo-v2-flash-iq2m 20 11 9 0.0697 存在基础设施故障
mimo-v2-flash-iq2m 20 20 0 0.3227 存在缺失任务
mimo-v2-flash-iq2xxs 20 20 0 0.2563 存在缺失任务
NVIDIA-Nemotron/Nemotron-Ultra-3-mopd-052726-mixed_nvfp4-fp8_amax_1000x65k 220 71 149 0.6886 存在基础设施故障
nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-FP8 220 220 0 0.3252 存在缺失任务
nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-NVFP4 220 218 2 0.3345 存在基础设施故障
nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4 220 7 213 0.0000 存在基础设施故障
Qwen/Qwen3.5-122B-A10B-gptq-int4 220 5 215 0.0000 存在基础设施故障
cyankiwi/Qwen3.5-9B-AWQ-4bit 220 219 1 0.3289 存在基础设施故障
lovedheart/Qwen3.5-9B-FP8 219 219 0 0.3999 存在缺失任务
Qwen/Qwen3.5-9B 220 6 214 0.2207 存在基础设施故障
Qwen/Qwen3.6-27B-FP8 220 219 1 0.5830 存在基础设施故障
sakamakismile/Qwen3.6-27B-NVFP4 220 219 1 0.6331 存在缺失任务
RedHatAI/Qwen3.6-35B-A3B-NVFP4 219 217 2 0.4457 存在基础设施故障
Qwen/Qwen3.6-35B-A3B 220 217 3 0.6195 存在基础设施故障
step-3.7-flash-iq4xs 20 16 4 0.5853 存在基础设施故障
step-3.7-flash-iq4xs 20 20 0 0.4963 存在缺失任务
step-3.7-flash-q3km 20 20 0 0.6161 存在缺失任务
step-3.7-flash-q3km 20 20 0 0.5300 存在缺失任务

MTP 草稿令牌接受率

下表展示了采用 vLLM 引擎的模型在 MTP(Multi-Token Prediction)推理过程中的草稿令牌接受情况。

排名 运行标识 草案次数 平均接受长度 p0 p1 p2 p3
1 nemotron-ultra-3-mopd-... 4.22M 4.28 0.925 0.858 0.786 0.711
2 qwen3.6-35b-a3b_... 3.88M 3.84 0.836 0.742 0.665 0.601
3 qwen3.6-35b-a3b-awq-4bit_... 2.19M 4.11 0.897 0.809 0.737 0.670
4 qwen3.6-27b-text-nvfp4-mtp_... 1.65M 4.11 0.897 0.807 0.733 0.669
5 qwen3.6-27b-fp8_... 1.74M 4.09 0.896 0.804 0.728 0.664
6 qwen3.6-35b-a3b-fp8_... 2.02M 4.02 0.884 0.787 0.707 0.642
7 qwen3.6-27b_... 1.66M 4.07 0.906 0.816 0.706 0.644
8 gpt-oss-120b_... 2.45M 2.83 0.651 0.442 0.311 0.214
9 qwen3.6-35b-a3b-nvfp4_... 4.23M 4.03 0.885 0.788 0.711 0.646
10 qwen3.5-9b-fp8_... 1.87M 3.84 0.845 0.739 0.661 0.597
11 qwen3.5-9b-awq-4bit_... 2.14M 3.68 0.823 0.702 0.613 0.540
12 qwen3.5-9b_... 1.14M 3.64 0.815 0.691 0.603 0.533
13 qwen3.5-122b-a10b-gptq-int4_... 1.99M 4.45 0.946 0.886 0.832 0.782

引擎时序(llama.cpp 按请求)

对于使用 llama.cpp 引擎的运行,记录了平均首次令牌时间(TTFT)、解码吞吐量、预填充吞吐量等时序数据。

排名 运行标识 平均TTFT (ms) 解码吞吐量 (tok/s) 预填充吞吐量 (tok/s)
1 step-3.7-flash-q3km_20260607T061506Z 3588.9 71.2 1454.0
2 step-3.7-flash-iq4xs_20260607T044220Z 3493.8 81.4 1830.6
3 step-3.7-flash-q3km_20260607T140502Z 3194.6 38.1 1338.3
4 step-3.7-flash-iq4xs_20260607T135829Z 1850.0 53.8 1626.0
5 mimo-v2-flash-iq2m_20260607T141330Z 1917.9 63.2 1080.6
6 mimo-v2-flash-iq2xxs_20260607T140641Z 1841.0 58.4 1213.3
7 mimo-v2-flash-iq2m_20260607T054242Z 2122.0 85.2 1154.2

运行轴键

当前唯一的活跃矩阵轴是 model × benchmark。其他轴(如 agent、engine、judge、GPU、vLLM 版本)保持恒定,并作为一级键记录在每个运行的 full_run_manifest.json 中。

排名 运行标识 agent engine judge GPU vLLM
1 qwopus3.6-27b-v2_... hermes vllm gpt-5.4 NVIDIA B300 SXM6 AC 0.22.0
2 nemotron-ultra-3-mopd-... hermes vllm gpt-5.4 NVIDIA B300 SXM6 AC 0.22.0
3 exo-qwen3.6-27b-nvfp4_... hermes vllm gpt-5.4 NVIDIA B300 SXM6 AC
4 qwen3.6-27b-nvfp4_... hermes vllm gpt-5.4 NVIDIA B300 SXM6 AC 0.22.0
5 qwen3.6-35b-a3b_... hermes vllm gpt-5.4 NVIDIA B300 SXM6 AC 0.22.0
6 step-3.7-flash-q3km_... hermes vllm gpt-5.4 NVIDIA B200
7 qwen3.6-35b-a3b-awq-4bit_... hermes vllm gpt-5.4 NVIDIA B300 SXM6 AC 0.22.0
8 step-3.7-flash-iq4xs_... hermes vllm gpt-5.4 NVIDIA B200
9 qwen3.6-27b-text-nvfp4-mtp_... hermes vllm gpt-5.4 NVIDIA B300 SXM6 AC 0.22.0
10 qwen3.6-27b-fp8_... hermes vllm gpt-5.4 NVIDIA B200 0.22.0
11 gemma-4-31b-it_... hermes vllm gpt-5.4 NVIDIA B200 0.22.0
12 qwen3.6-35b-a3b-fp8_... hermes vllm gpt-5.4 NVIDIA B300 SXM6 AC 0.22.0
13 gemma-4-31b-it-awq-4bit_... hermes vllm gpt-5.4 NVIDIA B300 SXM6 AC 0.22.0
14 step-3.7-flash-q3km_... hermes vllm gpt-5.4 NVIDIA B200
15 qwen3.6-27b_... hermes vllm gpt-5.4 NVIDIA B300 SXM6 AC 0.22.0
16 step-3.7-flash-iq4xs_... hermes vllm gpt-5.4 NVIDIA B200
17 gpt-oss-120b_... hermes vllm gpt-5.4 NVIDIA B300 SXM6 AC 0.22.0
18 gemma-4-26b-a4b-it-awq-4bit_... hermes vllm gpt-5.4 NVIDIA B200
搜集汇总
数据集介绍
gdpval-evals 数据集图片
构建方式
该数据集是Hermes Agent在本地vLLM服务环境下,对NVFP4与FP8量化模型进行GDPVal(OpenAI)评估的产物。其构建并非传统的行列式数据清洗,而是以运行工件事务存储的形式呈现。每个完整的模型运行结果均存放于以模型简称加时间戳命名的顶层目录中,目录内包含了运行摘要、各任务的使用情况文件以及按请求记录的遥测日志,完整的评估轨迹得以系统化归档。
使用方法
使用者可通过复制README中提供的Docker运行命令,在Blackwell级主机上精确复现各模型的vLLM服务配置。核心指标`avg_reward`与配套的奖励分布、MTP接受率及引擎时序,为模型量化策略与推理加速方案的对比分析提供了可直接引用的严谨基准。对于产生基础设施错误的运行,数据集亦将其隔离存放,确保主评估矩阵的纯净与可比性。
背景与挑战
背景概述
GDPVal Evals 数据集由 Hermes Agent 团队于近期创建,聚焦于在大语言模型(LLM)代理评估背景下,对采用不同量化及服务配置(如 NVFP4、FP8、AWQ 等)的模型进行系统的性能比较。该数据集以 OpenAI 的 GDPVal 评测框架为基础,通过 vLLM 推理引擎在 Blackwell 级 GPU 上部署模型,采集了包括平均奖励(avg_reward)、令牌接受率、推理延迟等在内的多维评估指标。其核心研究问题在于:在低比特量化与推测解码等前沿技术条件下,不同稀疏架构(Dense vs. MoE)、不同量化精度(FP8 vs. NVFP4)及推理引擎(vLLM vs. llama.cpp)如何影响代理任务的综合表现。该数据集的发布为 LLM 高效推理与代理评估研究提供了宝贵的基准素材。
当前挑战
该数据集面临显著挑战。领域问题层面,其致力于解决 LLM 代理评测中奖励信号稀疏的问题,尤其是 pass@1 指标在 GDPVal 任务上区分度极低(最佳运行仅约 5%),亟需更鲁棒的 avg_reward 指标及奖励分布分析。构建过程中挑战重重:首先,基础设施故障频发,导致部分模型运行因 `infra outstanding` 而中断或数据不完整,如 NVIDIA Nemotron-3-Super 及 Nemotron-Ultra 等模型均出现大量任务未完成(多达 213 个任务)的严重数据缺失;其次,量化相关兼容性问题突出,例如 FP8 MoE 后端(flashinfer_cutlass)无法支持 block-FP8 的组形状量化键,必须切换至 Triton 后端,这增加了实验复现的复杂性;此外,不同版本的 vLLM(v0.21.0 vs v0.22.0)及不同 GPU 型号(B200 vs B300)引入了环境维度差异,虽记录为元数据但增加了跨运行横向对比的解释难度。
常用场景
经典使用场景
在大型语言模型的评估体系中,GDPVal(OpenAI)评测数据集已成为衡量智能体任务执行能力的关键基准。该数据集通过涵盖220个多样化任务的奖励机制,为研究者提供了一个量化模型在复杂工具调用与多步推理场景中表现的标准平台。经典使用场景包括对比不同量化精度模型(如NVFP4与FP8)在相同任务集上的平均奖励得分(avg_reward),以及评估推测解码(如MTP机制)对生成质量的影响。研究者借此可系统性地验证模型架构、量化策略与推理加速技术之间的协同效应,揭示在资源受限条件下保持高性能的优化路径。
解决学术问题
该数据集有效解决了当前学术研究中关于量化模型在智能体任务中性能衰减的核心问题。传统上,低精度量化往往被视为牺牲任务完成质量的妥协方案,而GDPVal通过精细化的奖励分布分析,揭示了NVFP4等先进量化格式在特定任务上可接近甚至超越全精度模型的潜力。它允许学界量化研究不同量化策略(如块状FP8 vs. 统一NVFP4)对工具调用准确率和多轮对话连贯性的影响,为理解模型容量与推理效率之间的权衡提供了实证基础。这一贡献突破了仅依赖困惑度或简单基准测试的局限,推动了对量化模型真实智能体能力评估的方法论革新。
实际应用
在实际工业应用中,GDPVal评测框架直接服务于边缘计算与云端协同部署场景中对高效推理引擎的选择。数据集生成的详细遥测日志与引擎时序统计(如首令牌延迟与解码吞吐量)使得工程团队能够针对特定硬件(如NVIDIA B200与B300 GPU)精确调优vLLM服务配置,包括张量并行度、KV缓存数据类型与推测令牌数量。在智能代理系统中,开发者可依据该数据集的奖励得分矩阵决定采用何种量化模型作为基础,从而在保持用户交互体验的同时,将内存占用降低数倍,这对于资源敏感的对话机器人与自动化工作流编排系统具有不可替代的指导意义。
数据集最近研究
最新研究方向
该数据集聚焦于低比特量化与推测解码技术在大规模语言模型智能体评估中的前沿探索,具体通过Hermes Agent在vLLM服务框架下对NVFP4、FP8及AWQ等不同精度模型的GDPVal基准评测,系统性地比较了平均奖励、MTP草稿令牌接受率及引擎时序等核心指标,揭示了量化压缩对智能体任务执行效能的非线性影响,尤其强调了NVFP4格式在保持高吞吐的同时如何通过混合精度策略平衡推理速度与任务成功率,为下一代高效能、低延迟的智能体部署提供了关键实证支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务