遇见数据集

WeaveBench

收藏
github2026-06-06 更新2026-06-07 收录
官方服务:

资源简介:

WeaveBench是一个长期、真实世界的基准测试,包含114个跨8个工作领域的任务,每个任务要求代理在单个轨迹中交替使用GUI点击和shell/代码交互。每个任务通过一个轨迹感知的Agent-as-Judge进行评分,该评分器读取聊天记录和交付物,并生成每条款证据,比文件存在性检查更难欺骗。

WeaveBench is a long-term, real-world benchmark containing 114 tasks across 8 working domains. Each task requires an AI Agent to alternate between GUI clicks and shell/code interactions within a single trajectory. Each task is scored by a trajectory-aware Agent-as-Judge, which reads chat logs and deliverables, generates clause-level evidence, and is harder to deceive than basic file existence checks.

创建时间:
2026-06-06
原始信息汇总

数据集概述:WeaveBench

WeaveBench 是一个专注于长时域、真实世界的计算机使用智能体基准测试数据集,其核心特点是要求智能体在单个任务轨迹中交织使用 GUI 点击与 Shell/代码命令(混合界面操作)。

核心规模

  • 任务数量:114 个长时域、真实世界任务。
  • 覆盖领域:跨越 8 个工作领域。

评估方式

  • 采用 轨迹感知的 Agent-as-Judge 评分机制。该机制会读取聊天记录和交付物,并针对每条评分项给出证据引用,比简单的文件存在性检查更难被欺骗。

主要性能结果(论文数据)

模型 × 工具框架 通过率 (PassRate)
Claude Opus 4.7 + Claude Code(最佳组合) 41.2 %
Claude Opus 4.7 + OpenClaw 35.1 %
GPT-5.5 + Codex CLI 35.1 %
GPT-5.5 + OpenClaw 33.3 %
GPT-5.4 + OpenClaw 22.8 %
Gemini 3.1 Pro + OpenClaw 1.8 %

:当前顶尖模型在同一级别任务(OSWorld-Verified)上报告通过率超过 78%,而 WeaveBench 的得分远未饱和,表明其具有较高挑战性。

运行环境要求

  • 硬件:Linux 主机,需支持 KVM 和 Docker(≥ 8 CPU,≥ 32 GB 内存,≥ 150 GB 可用磁盘空间)。
  • 软件:Python ≥ 3.10.12,Node ≥ 22。
  • API 密钥:需要 OpenRouter API key,用于驱动智能体和轨迹感知评估器。
  • 一次性磁盘占用:约 29.5 GB(包括 207 MB 任务数据、852 MB 运行时文件、28.46 GB 的 qcow2 虚拟机镜像等)。

数据集与资源获取

运行与输出

  • 快速试用:通过命令 weavebench-demo 可在约 1 秒内离线运行一个示例任务,并查看评分输出(无需虚拟机或 API 密钥)。
  • 完整流程:通过 bash scripts/setup.sh 完成一键设置,然后使用 weavebench-run 命令运行任务。
  • 输出结构:每个任务的运行结果存放在 results/ 目录下,包含 chat.jsonl(LLM 轨迹)、agent.log(智能体日志)、results.tar.gz(智能体产生的文件)和 score.json(评估得分及证据)。

引用格式

bibtex @article{li2026weavebench, title = {WeaveBench: A Long-Horizon, Real-World Benchmark for Computer-Use Agents with Hybrid Interfaces}, author = {Li, Wanli and Zhou, Bowen and Yang, Yifan and Yu, Yunyao and Li, Dongsheng and Xu, Zhou and Shan, Caihua}, year = {2026}, }

搜集汇总
数据集介绍
WeaveBench 数据集图片
构建方式
WeaveBench的构建源于对现有计算机使用智能体基准测试局限性的深刻反思。研究团队精心遴选了114项跨8个工作领域的长时域真实世界任务,每项任务均要求智能体在单次执行轨迹中交织使用图形用户界面点击与Shell/命令行操作。数据集依托OSWorld生态,为每项任务配置独立的Ubuntu虚拟机环境,并通过精心设计的评分模板,由轨迹感知的Agent-as-Judge机制依据对话记录与产出物进行逐条款的自动化评分,从而构建起一个高度真实且难以被简单规则欺骗的评估体系。
特点
该数据集的核心亮点在于其对混合界面交互的极致模拟与严苛的评估标准。每项任务都要求智能体在图形界面与命令行界面之间无缝切换,体现了真实工作场景中复杂的操作流。更为突出的是,其采用的轨迹感知Agent-as-Judge评分机制不仅检查最终交付物的存在,更深入分析整个执行轨迹中的证据链,有效防止了投机性行为,使得该基准测试在主流模型上远未达到饱和状态,为衡量智能体的长期规划与执行能力提供了极具挑战性的标尺。
使用方法
使用WeaveBench要求搭建一套完整的本地化评估环境,包括支持KVM的Linux宿主机、Docker及充足的计算资源。用户需通过一键式设置脚本完成数据集、运行时组件及约28.46GB的虚拟机镜像下载。评估时通过命令行工具`weavebench-run`指定任务域、模型与执行框架,并可灵活配置并行环境数量以加速评估。每项任务执行完毕后自动生成包含完整交互日志、产出物及最终评分的结构化结果目录,便于研究者进行深度分析与结果复现。
背景与挑战
背景概述
在人工智能迈向通用智能的征途中,如何构建能够自主完成多步骤、跨界面复杂任务的智能体,一直是学术界与工业界共同追寻的圣杯。计算机使用智能体由此应运而生,但其评估基准却长期囿于单一界面(如仅GUI或仅命令行)的模拟环境,与真实世界中图形界面与代码/Shell交织使用的场景相去甚远。为填补这一空白,由Wanli Li、Bowen Zhou等研究者于2026年提出的WeaveBench应运而生。该基准测试精心设计了114项长程、真实的跨域任务,覆盖软件运维、数据处理等8个工作领域,每一项任务都强制要求智能体在同一轨迹中灵活切换GUI点击与Shell/代码执行,开创性地引入了轨迹感知的“智能体作为裁判”评分机制,从交互记录与最终交付物中逐条提取评分证据,极大提升了评估的鲁棒性与真实性,为计算机使用智能体的能力评估树立了新的标杆。
当前挑战
WeaveBench所解决的领域核心挑战在于如何弥合现有基准测试与真实世界复杂应用之间的鸿沟。传统基准如OSWorld主要聚焦于纯GUI操作,忽略了现代工作流中代码与图形界面的高频交织,导致模型在理想化任务中表现优异,却在落地时举步维艰。为此,WeaveBench设计了114项任务,强制智能体在单次轨迹中掌握图形点击与命令行/代码编写两种交互模式的平滑切换能力。在构建过程中,团队面临了严峻挑战:首先,每项任务都需要构建出真实的异构环境(如Ubuntu虚拟机),并保证网络服务(如RabbitMQ)的稳定复现,对基础设施开销要求极高(单次设置需29.5GB存储)。其次,设计无作弊空间的评分机制极为困难,传统文件存在检查极易被绕过,因此研究者创新地引入“Agent-as-Judge”范式,令裁判模型深入解读智能体的完整聊天记录与产出物,逐条款验证,这本身对裁判模型的推理能力与证据提取精度提出了极高要求。
常用场景
经典使用场景
在人工智能领域,通用计算机使用代理的评估长期受限于任务粒度粗糙与交互模式单一的困境。WeaveBench应运而生,它精心设计了114项跨越8个工作领域的长时间跨度真实世界任务,每一任务均要求代理在单次轨迹中交织完成图形用户界面点击与Shell或代码指令操作。这一独特设计完美模拟了人类操作计算机时自然切换鼠标与键盘的典型模式,为评估代理在混合界面环境中的综合执行能力提供了前所未有的标准化测试场。
实际应用
在实际应用中,WeaveBench为开发面向操作系统的智能代理助理提供了关键的训练与验证平台。这些代理能够自主完成诸如管理RabbitMQ死信队列拓扑等复杂的IT运维任务,显著提升企业自动化运营效率。数据集中涵盖的多种工作领域任务,还可被应用于自动化测试、软件部署、数据分析流水线等场景,为实现真正意义上的计算机任务自动化铺平了道路。
衍生相关工作
WeaveBench的诞生催生了一系列富有启发性的衍生工作。研究者基于其混合界面交互范式,深入探索了OpenClaw、Codex CLI、Claude Code等多种代理框架的性能边界,并开展了针对OSWorld基准的混合评分实验。该数据集提供的轨迹感知评估思想,已经开始影响更广泛的计算机代理评估方法论设计,推动领域朝着更加真实、更加严谨的方向演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务