遇见数据集

tau2-evals

收藏
Hugging Face2026-06-07 更新2026-06-08 收录
官方服务:

资源简介:

tau2-bench Hermes Agent vLLM Evaluation Traces 是一个私有数据集,专门用于评估大型语言模型在电信领域客户支持任务中的表现。数据集基于 tau2-bench 基准,通过 Hermes Agent 框架对多种本地 vLLM 服务模型(包括 NVFP4、FP8、BF16 等量化格式)进行多轮对话评估。每个评估任务模拟一个客户支持场景:GPT-4.1 作为用户模拟器扮演客户,被评估模型扮演支持代理(具备访问 tau2 电信领域工具集的终端能力),官方 tau2 验证器根据预设的真实目标对对话最终状态进行二元评分(通过/失败),核心评估指标为平均奖励(avg_reward,即 pass@1)。数据集包含多个模型的完整评估运行痕迹,组织方式参考了 exolabs/tau2-hermes-nemotron-eval-data,每个运行存储在以模型短名称和时间戳命名的目录中。README 提供了详细的评估结果矩阵,涵盖 33 个不同模型(如 Qwen、Gemma、Nemotron 等系列)的性能数据(样本数、平均奖励、中位数奖励、pass@1、零分样本数、最大轮次命中数),并列出部分待处理运行。此外,数据集还记录了每个模型的具体 vLLM 服务配置(包括 Docker 运行命令、量化参数、推理优化设置等)、多令牌预测(MTP)草案令牌的接受率统计,以及针对 llama.cpp 引擎的请求级计时指标(如首令牌时间、解码吞吐量)。该数据集适用于研究语言模型在领域特定任务中的工具使用、多轮对话能力、量化模型性能比较以及推理引擎优化等方面。

创建时间:
2026-06-05
原始信息汇总

数据集概述:tau2-bench Hermes Agent vLLM Evaluation Traces

该数据集包含使用 Hermes Agent 在本地 vLLM 服务的 NVFP4 / FP8 / BF16 模型上运行的 tau2-bench(sierra-research/tau2-bench)电信领域评估轨迹。

任务与评估

  • 每项任务是一个多轮客户支持对话:由 gpt-4.1 用户模拟器扮演客户,被评估模型扮演客服代理(拥有 tau2 电信领域栈的终端工具集访问权限)。
  • 官方 tau2 验证器根据真实目标对最终环境状态进行评分。
  • 评分采用二进制(每个任务),核心指标是 avg_reward(对于二进制评分等同于 pass@1)。

数据布局与状态

  • 布局类似于 exolabs/tau2-hermes-nemotron-eval-data:每个完成的运行位于顶层 <model-shortname>_<TS>/ 目录下。
  • 包含一个“待处理/部分运行”的表格,记录了因基础设施故障而尚未纳入主评估矩阵的运行。

主要评估结果(Headline Matrix)

# 模型 N avg_R pass@1 zeros max-turns hit
1 mimo-v2-flash-iq2m 20 1.0000 1.0000 0 0
2 step-3.7-flash-iq4xs 20 1.0000 1.0000 0 0
3 step-3.7-flash-q3km 20 1.0000 1.0000 0 0
4 Qwen/Qwen3.6-27B 500 0.9980 0.9980 1 1
... ... ... ... ... ... ...
31 nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-FP8 500 0.2860 0.2860 357 0
... ... ... ... ... ... ...
38 nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4 500 0.0000 0.0000 500 0
  • 表格展示了不同模型在 avg_reward(即 pass@1)、零分任务数(zeros)以及达到最大代理迭代轮次(max-turns hit)方面的表现。
  • 排名前列的模型(如前3名)在20次测试中获得了满分,而Qwen系列模型在500次测试中表现出高效率(avg_reward > 0.98)。
  • 部分模型(如某些Gemma变体、Nemotron变体)得分较低,甚至为0。

MTP Draft Token Acceptance(MTP推测解码接受率)

  • 接受率基于 vLLM 的 /metrics 快照计算,按位置从左到右统计。
  • pN 列是累积联合概率,表示位置 0 到 N 的 draft token 均被接受的概率。
  • 提供了不同运行下的平均接受长度(mean acceptance length),例如 qwen3.6-27b_20260607T005257Z-fleet8 为 3.57,表明相对于贪婪解码的有效加速倍数。

Engine Timing(llama.cpp 引擎时序)

  • 对于使用 llama.cpp (GGUF) 引擎的运行,报告了每请求的时序统计,包括平均 TTFT、解码吞吐量(decode tok/s)、预填充吞吐量(prefill tok/s)以及 draft 接受率。

Run Axis Keys(运行轴键)

  • 主要矩阵轴为 model × benchmark,其他轴(如 agentenginejudge、GPU、vLLM版本)保持恒定并记录在 full_run_manifest.json 中。
  • 提供了每个运行对应的 agent(hermes)、engine(vllm / llama_cpp)、judge(gpt-4.1)、GPU(NVIDIA B300 SXM6 AC / NVIDIA B200)及 vLLM 版本信息。

vLLM 服务配置

  • 数据集详细说明了每个模型所使用的 vLLM Docker 运行命令,包括模型路径、服务名、并行设置、内存配置、缓存策略、MoE 后端、推理器(reasoning parser)及工具调用解析器(tool-call parser)等。
  • 特别指出了某些模型(如 Qwen/Qwen3.6-35B-A3B-FP8)需要 triton MoE 后端,以及 nvidia/Qwen3.6-35B-A3B-2.06GB-per-token 模型需要特定的环境变量和私有权重镜像。
搜集汇总
数据集介绍
tau2-evals 数据集图片
构建方式
tau2-evals数据集是围绕通信领域的智能体性能评估而构建的,其核心依托于tau2-bench框架。每个任务被设计成一个多轮客服对话场景:由gpt-4.1扮演客户模拟器,待评估模型则扮演支持代理,并配备访问tau2通信域工具集的终端能力。对话结束后,官方的tau2验证器将最终环境状态与预定义的基准目标进行比对,输出二元奖励信号。所有运行轨迹均按照模型缩写与时间戳的层级目录结构进行组织,并包含了从vLLM服务配置到MTP草案令牌接受率等全面的运行元数据。
特点
该数据集最显著的特征在于其精细的量化评估矩阵与丰富的技术维度。核心指标avg_reward等同于pass@1,用于衡量模型在严格二元评分下的任务完成率。数据集中包含了从密集模型到MoE架构、从NVFP4到FP8及AWQ等多种量化方案的评估结果,覆盖了从27B到550B不同参数规模的模型。此外,每个运行记录都包含了vLLM服务的精确Docker启动命令、MTP草案令牌逐位置接受率的统计,以及引擎时序数据,为研究量化精度与推理性能之间的权衡提供了宝贵素材。
使用方法
使用该数据集时,研究者可依据模型名称与时间戳目录定位特定运行记录,并通过其中的overall_summary.json文件获取关键评估指标。数据集提供的评级矩阵表格可直接用于横向对比不同模型与量化方案在通信客服任务上的表现。对于复现评估流程,每个模型条目下附带的vLLM Docker运行命令可直接在Blackwell级GPU主机上执行,其中需注意部分模型需要设置HF_TOKEN以访问私有权重仓库。MTP接受率表格则有助于深入分析推测解码策略的效率,研究者可通过pN列的累积联合概率计算出条件接受率。
背景与挑战
背景概述
tau2-evals数据集由Sierra Research团队于2026年构建,旨在评估大规模语言模型在电信领域多轮客服对话中的代理性能。该数据集基于tau2-bench基准框架,通过gpt-4.1模拟用户角色、被测模型扮演客服代理并配备终端工具集,最终由官方tau2验证器对环境终止状态与真实目标进行二进制评分。核心研究问题聚焦于不同量化精度(NVFP4/FP8/BF16)和架构密度(稠密与混合专家模型)对代理任务完成率的影响,为低精度推理部署提供了标准化评估手段。该数据集对工业级语言模型量化与代理能力交叉领域具有重要参考价值。
当前挑战
tau2-evals所应对的领域问题在于现有基准难以系统评估量化模型在复杂交互式代理场景中的实际表现,传统分类或生成指标无法反映多步工具调用与状态验证的达成质量。构建过程中的挑战包括:需协调vLLM多种量化后端(如flashinfer_cutlass与triton对块FP8的支持差异),处理因基础设施故障导致的运行不完整(如quarantined的partial runs),以及确保多引擎(vLLM与llama.cpp)下MTP自推测解码的可复现测量。此外,对最大轮次截断(max-turns hit)与推理失败的准确区分亦增加了评估复杂度。
常用场景
经典使用场景
在电信客服领域,自动化对话系统正逐步取代传统人工坐席,成为提升服务效率与降低运营成本的关键技术路径。该数据集正是在这一背景下应运而生,其经典使用场景聚焦于评估多轮对话中智能客服代理的性能表现,尤其是那些需要调用后端运维工具完成真实业务操作的场景。具体而言,数据集中每一份记录都呈现了一次完整的客户支持对话,由GPT-4.1模拟用户发起需求,而待评估模型扮演客服代理,利用终端工具集访问电信领域堆栈执行操作,最终由官方验证器根据环境状态与标准答案的匹配程度给出二进制评分。这种端到端的任务范式使得该数据集成为衡量大语言模型在复杂工具调用环境中推理与执行能力的权威基准。
实际应用
在真实世界的电信运营环境中,该数据集所蕴含的评估方法论已在多个层面展现出实际应用价值。首先,它被用于甄别不同精度量化方案下的模型服务质量,例如NVFP4、FP8与BF16等不同浮点格式对模型推理准确率的影响,帮助工程团队在计算资源与性能之间做出最优权衡。其次,数据集中的对话痕迹可以复现用于压力测试,验证高并发场景下智能客服系统的稳定性与响应速度。此外,通过分析模型在最大轮次截断等极端条件下的表现,开发人员能够精准定位系统瓶颈,从而优化提示词策略或工具调用流程,最终提升面向终端用户的整体交互体验。
衍生相关工作
该数据集的出现催生了一系列富有启发性的后续研究工作。一方面,围绕其提供的高精度评估痕迹,研究社区衍生出多种针对多轮工具调用场景的模型微调算法,旨在通过监督学习提升代理在电信领域的操作准确率。另一方面,基于该数据集中记录的MTP投机解码接受率数据,涌现了大量关于自回归模型解码效率优化的探索,包括改进的采样策略与多令牌预测头设计,这些工作直接推动了大模型推理速度的显著提升。此外,该数据集也被用作验证各类量化技术可行性的标杆,从低比特量化到混合精度压缩,相关论文均以该数据集上的pass@1指标作为关键性能依据,从而建立了从模型压缩到实际部署效果之间的可量化桥梁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务