遇见数据集

exolabs/tau2-evals

收藏
Hugging Face2026-06-12 更新2026-06-14 收录
官方服务:

资源简介:

该私有数据集包含来自Hermes Agent在本地vLLM服务的NVFP4、FP8、BF16模型上运行的tau2-bench电信领域评估痕迹。每个任务是一个多轮客户支持对话:GPT-4.1用户模拟器扮演客户,被评估模型扮演支持代理(可访问tau2电信领域堆栈的终端工具集),官方tau2验证器根据真实目标对最终环境状态进行评分。评分是每个任务的二进制评分,主要指标是平均奖励(即二进制评分的pass@1)。数据集布局参考了exolabs/tau2-hermes-nemotron-eval-data,每个完成的运行都位于顶级目录<model-shortname>_<TS>/下。

This private dataset comprises evaluation traces generated during the tau2-bench telecom domain evaluation executed by Hermes Agent on NVFP4, FP8, and BF16 models deployed via local vLLM services. Each task takes the form of a multi-turn customer support conversation: the GPT-4.1-powered user simulator assumes the role of a customer, while the model under evaluation acts as the support agent with access to the terminal toolset of the tau2 telecom domain stack. The official tau2 validator scores the final environment state against predefined real-world objectives. Scoring for each task follows a binary rating scheme, with the primary evaluation metric being average reward (equivalent to pass@1 of the binary ratings). The dataset layout is referenced from exolabs/tau2-hermes-nemotron-eval-data, where each completed run is stored under the top-level directory named <model-shortname>_<TS>.

提供机构:
exolabs
搜集汇总
数据集介绍
exolabs/tau2-evals 数据集图片
构建方式
tau2-evals数据集源自电信领域智能客服场景,通过tau2-bench评估框架系统性地构建。其核心流程涉及多轮对话:gpt-4.1模拟客户提问,待测模型扮演客服代理并借助终端工具集操作tau2电信域堆栈,最终由官方tau2验证器对比最终环境状态与既定目标状态,给出二元评分(通过或未通过)。每次完整运行的评估轨迹被组织在顶层目录下,以模型简称与时间戳命名,完整复现了从对话交互到状态验证的全链条。
特点
该数据集最鲜明的特征在于其专注于评估各类量化模型在统一电信任务上的表现,覆盖了NVFP4、FP8、BF16等精度格式,以及基于vLLM、exo和llama_cpp等不同推理引擎的部署。其核心指标为二元的pass@1(即平均奖励),并衍生出中位数奖励、零分任务数等统计信息。此外,数据集详细记录了每个模型的令牌消耗(输入与输出)、MTP草稿令牌的逐位置接受率(p0至p6)及平均接受长度,为分析模型推理效率与解码质量提供了细致入微的数据支撑。
使用方法
用户可利用此数据集对新的语言模型或量化方案进行电信客服场景下的标准化评估。使用方法是将待测模型通过提供的vLLM Docker命令(包含精确的量化策略与推理参数)部署为服务,然后运行tau2-bench评估流程。数据集提供的配置脚本(如models.toml与launch-vllm.sh)可复现所有基准模型的服务配置,用户只需替换模型标识与权重路径即可完成横向对比,最终通过解析overall_summary.json中的平均奖励与引擎时序指标来量化新模型的性能表现。
背景与挑战
背景概述
tau2-evals数据集由Sierra Research团队于2025年创建,聚焦于电信领域中多轮对话代理系统的评估。该数据集的核心研究问题在于量化量化神经网络在真实任务中的表现,特别是通过对比不同精度(如NVFP4、FP8、BF16)下推理引擎对用户模拟交互任务完成度的影响。数据集采用tau2基准框架,借助gpt-4.1驱动的用户模拟器与支持代理进行多轮客户服务对话,并由官方验证器对最终环境状态进行二进制评分。当前,该数据集已成为衡量高效低精度推理模型在复杂对话场景中实用性的重要基准,推动着大规模语言模型在资源受限环境中的部署与优化研究。
当前挑战
该数据集所解决的领域问题在于,大语言模型在电信客服等实际场景中面临部署效率与任务完成准确性的双重挑战,而现有基准往往忽略量化推理对代理行为的影响。tau2-evals通过模拟真实多轮交互,直面代理在有限资源下达成目标的瓶颈。构建过程中,其挑战尤为突出:首先是基础设施的复杂性,需针对不同模型(如vLLM、llama.cpp)与量化方案(NVFP4、FP8等)精确复现服务配置,任何参数偏差都可能导致结果偏离;其次是评分机制的严苛与二值性,仅凭最终状态匹配度打分,无法捕获代理在中间步骤中的细微成败;此外,部分运行因基础设施故障而中断,致使数据集不完整,需要从大量不完全的追踪中分离有效信息,进一步增加了分析难度。
常用场景
经典使用场景
tau2-evals数据集的核心价值在于为电信领域智能客服代理提供标准化的多轮对话评估基准。该数据集完整记录了Hermes Agent在vLLM服务引擎上运行各类量化模型(如NVFP4、FP8、BF16)时的交互轨迹,每个任务均包含由gpt-4.1模拟的用户与待评估模型之间的完整对话历史,以及模型通过终端工具集对电信域状态的操作记录。研究者可借此系统性地比较不同量化精度和模型架构在电信客服场景下的任务完成率,是衡量模型在真实工具调用环境中表现的标准测试集。
衍生相关工作
tau2-evals数据集催生了多个方向的后续研究。基于其提供的多模型评测矩阵,研究者进一步探索了混合精度量化(如NVFP4与FP8混合方案)对MoE架构模型性能的影响,并衍生出针对电信领域特定障碍类型的失败模式分析工作。数据集记录的MTP推测解码接受率矩阵已被用于验证新型拒绝采样方法的有效性,其完整的推理时序数据则推动了模型服务性能预测模型的构建。此外,其与exolabs/tau2-hermes-nemotron-eval-data的兼容格式设计,为构建跨机构联合评测平台奠定了基础。
数据集最近研究
最新研究方向
tau2-evals数据集聚焦于电信领域多轮客服对话场景下,对大语言模型智能体性能进行系统性基准评估。当前前沿研究方向集中在对不同量化精度模型(如NVFP4、FP8、BF16)及推理引擎(vLLM、llama.cpp、exo)的agent任务表现进行横向对比,特别是结合MTP推测解码技术对模型推理效率与任务成功率的协同优化展开探索。该数据集为评估边缘部署场景下低比特量化模型在复杂工具调用任务中的实用性提供了关键基准,其发布意味着业界对智能体系统在受限硬件条件下实现高精度任务完成能力的评估体系迈入更为精细与标准化的阶段。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务