tau2-evals
收藏资源简介:
tau2-bench Hermes Agent vLLM Evaluation Traces 是一个私有数据集,专门用于评估大型语言模型在电信领域客户支持任务中的表现。数据集基于 tau2-bench 基准,通过 Hermes Agent 框架对多种本地 vLLM 服务模型(包括 NVFP4、FP8、BF16 等量化格式)进行多轮对话评估。每个评估任务模拟一个客户支持场景:GPT-4.1 作为用户模拟器扮演客户,被评估模型扮演支持代理(具备访问 tau2 电信领域工具集的终端能力),官方 tau2 验证器根据预设的真实目标对对话最终状态进行二元评分(通过/失败),核心评估指标为平均奖励(avg_reward,即 pass@1)。数据集包含多个模型的完整评估运行痕迹,组织方式参考了 exolabs/tau2-hermes-nemotron-eval-data,每个运行存储在以模型短名称和时间戳命名的目录中。README 提供了详细的评估结果矩阵,涵盖 33 个不同模型(如 Qwen、Gemma、Nemotron 等系列)的性能数据(样本数、平均奖励、中位数奖励、pass@1、零分样本数、最大轮次命中数),并列出部分待处理运行。此外,数据集还记录了每个模型的具体 vLLM 服务配置(包括 Docker 运行命令、量化参数、推理优化设置等)、多令牌预测(MTP)草案令牌的接受率统计,以及针对 llama.cpp 引擎的请求级计时指标(如首令牌时间、解码吞吐量)。该数据集适用于研究语言模型在领域特定任务中的工具使用、多轮对话能力、量化模型性能比较以及推理引擎优化等方面。
数据集概述:tau2-bench Hermes Agent vLLM Evaluation Traces
该数据集包含使用 Hermes Agent 在本地 vLLM 服务的 NVFP4 / FP8 / BF16 模型上运行的 tau2-bench(sierra-research/tau2-bench)电信领域评估轨迹。
任务与评估
- 每项任务是一个多轮客户支持对话:由 gpt-4.1 用户模拟器扮演客户,被评估模型扮演客服代理(拥有 tau2 电信领域栈的终端工具集访问权限)。
- 官方 tau2 验证器根据真实目标对最终环境状态进行评分。
- 评分采用二进制(每个任务),核心指标是
avg_reward(对于二进制评分等同于pass@1)。
数据布局与状态
- 布局类似于
exolabs/tau2-hermes-nemotron-eval-data:每个完成的运行位于顶层<model-shortname>_<TS>/目录下。 - 包含一个“待处理/部分运行”的表格,记录了因基础设施故障而尚未纳入主评估矩阵的运行。
主要评估结果(Headline Matrix)
| # | 模型 | N | avg_R | pass@1 | zeros | max-turns hit |
|---|---|---|---|---|---|---|
| 1 | mimo-v2-flash-iq2m |
20 | 1.0000 | 1.0000 | 0 | 0 |
| 2 | step-3.7-flash-iq4xs |
20 | 1.0000 | 1.0000 | 0 | 0 |
| 3 | step-3.7-flash-q3km |
20 | 1.0000 | 1.0000 | 0 | 0 |
| 4 | Qwen/Qwen3.6-27B |
500 | 0.9980 | 0.9980 | 1 | 1 |
| ... | ... | ... | ... | ... | ... | ... |
| 31 | nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-FP8 |
500 | 0.2860 | 0.2860 | 357 | 0 |
| ... | ... | ... | ... | ... | ... | ... |
| 38 | nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4 |
500 | 0.0000 | 0.0000 | 500 | 0 |
- 表格展示了不同模型在
avg_reward(即pass@1)、零分任务数(zeros)以及达到最大代理迭代轮次(max-turns hit)方面的表现。 - 排名前列的模型(如前3名)在20次测试中获得了满分,而Qwen系列模型在500次测试中表现出高效率(
avg_reward> 0.98)。 - 部分模型(如某些Gemma变体、Nemotron变体)得分较低,甚至为0。
MTP Draft Token Acceptance(MTP推测解码接受率)
- 接受率基于 vLLM 的
/metrics快照计算,按位置从左到右统计。 pN列是累积联合概率,表示位置 0 到 N 的 draft token 均被接受的概率。- 提供了不同运行下的平均接受长度(
mean acceptance length),例如qwen3.6-27b_20260607T005257Z-fleet8为 3.57,表明相对于贪婪解码的有效加速倍数。
Engine Timing(llama.cpp 引擎时序)
- 对于使用 llama.cpp (GGUF) 引擎的运行,报告了每请求的时序统计,包括平均 TTFT、解码吞吐量(decode tok/s)、预填充吞吐量(prefill tok/s)以及 draft 接受率。
Run Axis Keys(运行轴键)
- 主要矩阵轴为
model × benchmark,其他轴(如agent、engine、judge、GPU、vLLM版本)保持恒定并记录在full_run_manifest.json中。 - 提供了每个运行对应的 agent(hermes)、engine(vllm / llama_cpp)、judge(gpt-4.1)、GPU(NVIDIA B300 SXM6 AC / NVIDIA B200)及 vLLM 版本信息。
vLLM 服务配置
- 数据集详细说明了每个模型所使用的 vLLM Docker 运行命令,包括模型路径、服务名、并行设置、内存配置、缓存策略、MoE 后端、推理器(reasoning parser)及工具调用解析器(tool-call parser)等。
- 特别指出了某些模型(如
Qwen/Qwen3.6-35B-A3B-FP8)需要tritonMoE 后端,以及nvidia/Qwen3.6-35B-A3B-2.06GB-per-token模型需要特定的环境变量和私有权重镜像。




