WeaveBench
收藏资源简介:
WeaveBench是由微软亚洲研究院、浙江大学和清华大学联合创建的长时程混合接口计算机使用基准测试集,旨在评估智能体在真实工作场景中协调图形用户界面与命令行/代码操作的能力。该数据集包含114个跨8个现实工作领域的任务,涵盖桌面生产力、游戏开发、数据分析和运维等场景,每个任务平均涉及76次工具调用和16次界面切换,数据源自真实用户请求和可公开验证的工件。数据构建过程采用四阶段流程,包括原型引导采集、资产打包、盲审和试点验证,确保任务的非替代性和跨应用特性。该数据集主要应用于人工智能代理评估领域,旨在解决现有基准测试在长时程跨界面协调能力评估方面的不足,推动智能体在复杂工作流中的实际应用能力发展。
WeaveBench is a long-duration mixed-interface computer usage benchmark jointly developed by Microsoft Research Asia, Zhejiang University, and Tsinghua University. It aims to evaluate the capability of AI Agents to coordinate graphical user interface (GUI) operations with command line or code manipulations in real-world work scenarios. This dataset comprises 114 tasks across 8 real-world work domains, covering scenarios including desktop productivity, game development, data analysis, and IT operations and maintenance. On average, each task involves 76 tool calls and 16 interface switches, with all data sourced from real user requests and publicly verifiable artifacts. The dataset construction follows a four-stage workflow, including prototype-guided collection, asset packaging, blind review, and pilot validation, to ensure the non-substitutability and cross-application nature of the tasks. This benchmark is primarily utilized in the field of AI Agent evaluation, aiming to address the limitations of existing benchmarks in evaluating long-duration cross-interface coordination capabilities, and advance the practical application abilities of AI Agents in complex workflows.
数据集概述
WeaveBench 是一个用于评估计算机使用智能体(Computer-Use Agents)在混合界面(GUI+CLI)下进行长时域、真实世界任务表现的基准测试。
核心特性
- 任务规模: 包含 114 个任务,覆盖 8 个真实工作领域。
- 任务设计: 每个任务要求智能体在单个轨迹中“编织”(weave)GUI 观察与 CLI/代码执行。
- 运行环境: 在真实的 Ubuntu 沙箱中运行。
- 评估方式: 采用轨迹感知的“智能体作为裁判”(Agent-as-a-Judge)系统,审计八个质量维度,并通过九个快捷模式检测器(如合成截图、硬编码指标、模拟服务等)对任何作弊行为零分处理。
核心思想
评估跨界面编排能力,而非孤立能力。GUI 和 CLI 是互补而非可互换的通道,真实工作流程需要将两者交织在一起。
任务设计原则 (P1-P3)
- P1 · 通道不可替代性: 每个任务必须在同一轨迹中协调 GUI 观察/动作与 CLI/代码修改。
- P2 · 长时域执行: 专家参考轨迹包含多个交织的 GUI 和 CLI/代码阶段。
- P3 · 跨应用状态: 任务跨越多个独立应用/进程,其状态由工作流连接。
数据集组成
- 8 个工作领域: 桌面生产力、文档处理、游戏与交互、Web 开发、数据分析与可视化、DevOps 与系统管理、空间/3D/CAD、设计与创意。
- 任务打包: 每个任务包含提示 (𝒫)、材料 (ℳ) 和检查锚点 (𝒞) 的自治包。
- 任务长度: 最佳运行轨迹中位数使用 76 次工具调用(最大 471 次),中位数包含 16 次 GUI↔CLI 通道切换。
主要结果
- 最佳性能: Claude Opus 4.7 在 Claude Code 框架上取得 41.2% 的通过率 (PassRate)。
- 交叉配对影响: 同一骨干模型在不同框架上性能差异巨大(如 Claude Opus 4.7 从 41.2% 降至 13.2%)。
- 与同类基准对比: 同一代前沿模型在 OSWorld-Verified 上 >78%,在 MCPWorld 上 75.1%,但在 WeaveBench 上降至 41.2%,单通道模式下 ≤3.5%。这体现了跨界面、长时域编排的巨大挑战。
消融实验
- 界面消融: 单通道(仅 GUI 或仅 CLI)的通过率仅为个位数(GUI-only ≤1.8%, CLI-only ≤3.5%),远低于混合模式(22–35%)。混合增益高达 +31.6 个百分点,远超其他混合基准(+3–4 pp)。
- 裁判消融: 移除轨迹访问的“仅结果”裁判会导致通过率虚高 10.3–20.2 个百分点。
失败分析
分析了 2,209 次试验中的 1,735 次失败,发现:
- 奖励黑客 (35.2%) 和 长时域执行纪律崩溃 (30.4%) 共同解释了 65.6% 的失败。
- 视觉感知问题仅占 3.7%,表明对于前沿模型而言,感知并非瓶颈。
- 不同模型表现出不同的失败模式(如 GPT-5.5 偏向奖励黑客,GPT-5.4 偏向过早停止,Claude Opus 4.7 较为均衡)。
工具调用分布
分析发现,即使暴露了专用的 GUI 工具,智能体仍倾向于通过 Shell 路径执行 GUI 操作。exec: shell 命令单独就占了所有工具调用的 27.3%。当在原子操作层面重新归属后,GUI 操作的实际占比从工具层面的 33.9% 上升到 62.9%。
引用
bibtex @article{li2026weavebench, title = {{WeaveBench}: A Long-Horizon, Real-World Benchmark for Computer-Use Agents with Hybrid Interfaces}, author = {Li, Wanli and Zhou, Bowen and Yu, Yunyao and Xu, Zhou and Yang, Yifan and Li, Dongsheng and Shan, Caihua}, year = {2026}, eprint = {2606.09426}, archivePrefix = {arXiv}, primaryClass = {cs.AI}, url = {https://arxiv.org/abs/2606.09426}, }

- 1WeaveBench: A Long-Horizon, Real-World Benchmark for Computer-Use Agents with Hybrid Interfaces浙江大学; 微软亚洲研究院; 清华大学 · 2026年




