debdootmiitd/tau3-bench-qwen3.6-35b-a3b-v0
收藏资源简介:
该数据集是τ³-bench Phase 0基线评估的数据集,专门用于Qwen3.6-35B-A3B模型在tau2-bench基准测试上的Comvera Phase 0基线实验。它包含轨迹数据和操作工件,覆盖三个领域:航空(50个任务)、零售(114个任务)和电信(114个任务),每个任务进行4次试验。数据集包括官方提交数据(Config A,启用思考模式)和比较数据(Config B,禁用思考模式),以及LLM-judge自动错误识别输出、运行日志、报告和提交包。数据用于评估模型在客户服务代理任务中的性能,通过通过率等指标衡量,并支持复现实验。数据集基于τ³-bench v1.0.0版本,使用vLLM服务、GPT-4.1用户模拟器和自动审查流程生成。
许可证:Apache-2.0 语言: - 英语 标签: - tau-bench - tau2-bench - tau3-bench - AI智能体评估(agent-evaluation) - 客户服务 展示名称:τ³-bench Phase 0基线 —— Qwen3.6-35B-A3B (V0) 数据集规模分类:1K<n<10K # τ³-bench Phase 0基线 —— Qwen3.6-35B-A3B (V0) 本数据集包含`Qwen/Qwen3.6-35B-A3B`在[`sierra-research/tau2-bench`](https://github.com/sierra-research/tau2-bench)(提交哈希`3b005ddb...`,对应τ³-bench v1.0.0)上的**Comvera Phase 0基线模型**的轨迹数据与运行工件。 本数据集为排行榜拉取请求[sierra-research/tau2-bench#267](https://github.com/sierra-research/tau2-bench/pull/267)的配套资源。 ## 数据集结构 trajectories/ ← 官方提交数据(配置A,开启思考模式) ├── airline_results.json 50个任务 × 4次试验 = 200次模拟 ├── retail_results.json 114 × 4 = 456次模拟 └── telecom_results.json 114 × 4 = 456次模拟 config_b_trajectories/ 用于对比的配置B(关闭思考模式) ├── airline_results.json ├── retail_results.json └── telecom_results.json reviewed/ LLM评审自动错误识别结果 ├── config_a_*_reviewed.json (评审模型:GPT-4.1,可识别每一轮的错误类型) └── config_b_*_reviewed.json logs/ 运行时日志(包含vLLM服务、tau2运行、tau2评审、 自动重试、OpenAI配额事件) reports/ ├── phase0_results.md 最终报告 —— 涵盖方法论、全部18个基线单元格、 故障细分与可复现性说明 └── progress.md Phase 0运行期间的决策、偏差与事件的时间线日志 submission_package/ └── submission.json 符合schema规范的排行榜提交JSON文件 (该文件也可在sierra-research/tau2-bench#267中获取) ## 配置说明(配置A — 核心提交项) | 字段 | 取值 | |---|---| | 模型 | `Qwen/Qwen3.6-35B-A3B`(Hugging Face哈希`995ad96e`) | | 服务部署 | vLLM 0.19.1,参数为`--reasoning-parser qwen3 --tool-call-parser qwen3_xml --enable-auto-tool-choice` | | 智能体LLM参数 | `{"temperature": 0.6}`(使用默认Qwen3.5对话模板,支持思考模式) | | 用户模拟器 | `GPT-4.1-2025-04-14`,温度系数0.0 | | 单任务试验次数 | 4 | | 任务划分 | `base`(默认划分) | | 应用领域 | 航空(50)、零售(114)、电信(114) | | 银行知识任务 | 未运行(延后执行) | | 框架脚手架 | 默认tau-bench脚手架;无微调操作,无提示词修改 | ## 核心指标 ### 配置A(开启思考模式) | 应用领域 | Pass^1通过率 | Pass^2通过率 | Pass^3通过率 | Pass^4通过率 | |---|---:|---:|---:|---:| | 航空 | 0.810 | 0.743 | 0.705 | **0.680** | | 零售 | 0.833 | 0.746 | 0.682 | **0.632** | | 电信 | 0.993 | 0.987 | 0.980 | **0.974** | ### 配置B(关闭思考模式) | 应用领域 | Pass^1通过率 | Pass^2通过率 | Pass^3通过率 | Pass^4通过率 | |---|---:|---:|---:|---:| | 航空 | 0.685 | 0.570 | 0.495 | **0.440** | | 零售 | 0.805 | 0.713 | 0.660 | **0.623** | | 电信 | 0.998 | 0.996 | 0.993 | **0.991** | ## 电信领域说明(跨提交项对比时请务必阅读) 82%的电信领域任务(94/114)仅设置`reward_basis=('ENV_ASSERTION',)`——评估仅检查设备的最终状态,而非智能体是否指定了修复序列。严格子集(20个任务,`reward_basis=('ENV_ASSERTION', 'ACTION')`)可提供更保守的智能体质量度量:**配置A的Pass^4通过率为0.850**。本次报告的核心指标0.974符合基准测试惯例。 该现象是τ³-bench v1.0任务定义本身的属性,而非我们的评估流水线导致。完整诊断请参阅`reports/phase0_results.md`。 ## 复现方法 完整代码(包含vLLM启动脚本、tau2运行包装器、评审包装器与主脚本)托管于https://github.com/debdootiitd/tau-bench-phase0(配套仓库)。 快速复现命令如下: bash tau2 run --domain airline --agent-llm hosted_vllm/Qwen3.6-35B-A3B --agent-llm-args '{"temperature": 0.6}' --user-llm GPT-4.1 --user-llm-args '{"temperature": 0.0}' --num-trials 4 --max-concurrency 4 --auto-resume --save-to phase0_config_a_airline # 分别针对零售、电信领域重复上述命令;随后对每个results.json执行`tau2 review`以进行故障分析。 在单张H200显卡上运行总耗时约3小时(3个领域并行执行,每个领域并发数为4)。OpenAI用户模拟器与自动评审模块的总花费约90美元,覆盖全部12个测试单元格。



