VisualClawArena
收藏资源简介:
VisualClawArena是一个专门设计用于评估多模态计算机使用代理能力的基准测试数据集,包含200个精心构建的场景,每个场景均配备视频片段、持久化工作空间、动态环境更新、多轮交互式指令以及可执行验证检查器。其核心设计目标是超越传统的静态视频问答任务,测试智能代理能否综合利用视频视觉证据、工作空间文件内容以及后续环境变化信息来完成任务。数据集包含5,000个人工编写的交互轮次,其中4,885个轮次被纳入发布版本,3,610个轮次明确要求视频输入。任务类型分为两种:3,500个可执行检查轮次(要求代理创建或修改工作空间文件)和1,385个多项选择题轮次。数据来源于三个上游数据集:indoor_vsi(100个场景)、egoschema(50个场景)和qvhighlights(50个场景)。数据集还包含15,280个暂存文件,并附带了2,266次评估运行的37,834条详细结果记录。每个场景的结构化数据包括:作为视觉证据的视频片段、初始工作空间目录、关键场景设置文件以及动态更新目录。数据集采用状态化评估协议,适用于多模态代理开发、视频理解、长上下文交互、自我进化系统等研究领域。
VisualClawArena is a benchmark dataset specifically designed to evaluate the capabilities of multimodal computer-use agents. It contains 200 carefully constructed scenarios, each equipped with video clips, persistent workspaces, dynamic environment updates, multi-turn interactive instructions, and executable verification checkers. Its core design goal is to go beyond traditional static video question-answering tasks, testing whether intelligent agents can comprehensively utilize video visual evidence, workspace file content, and subsequent environmental changes to complete tasks. The dataset includes 5,000 human-written interaction turns, with 4,885 turns included in the released version and 3,610 turns explicitly requiring video input. Task types are divided into two categories: 3,500 executable check turns (requiring agents to create or modify workspace files) and 1,385 multiple-choice question turns. Data is sourced from three upstream datasets: indoor_vsi (100 scenarios), egoschema (50 scenarios), and qvhighlights (50 scenarios). The dataset also contains 15,280 staging files and includes 37,834 detailed result records from 2,266 evaluation runs. Structured data for each scenario includes: video clips as visual evidence, an initial workspace directory, key scenario setup files, and a dynamic updates directory. The dataset employs a stateful evaluation protocol and is applicable to research areas such as multimodal agent development, video understanding, long-context interaction, and self-evolving systems.
数据集总览
VisualClawArena 是一个用于评估多模态计算机使用代理的基准测试,包含 200 个场景。其核心设计理念是测试代理是否能够结合视频证据、工作区文件和动态环境变化来执行任务,而非仅回答静态的视频问答。
- 版本:
2026-06-12 - 场景数量: 200
- 创作轮次: 5,000
- 发布轮次: 4,885
- 依赖视频的发布轮次: 3,610
- 发布轮次类型:
- 可执行检查轮次: 3,500
- 多项选择轮次: 1,385
- 来源桶:
indoor_vsi: 100 个场景egoschema: 50 个场景qvhighlights: 50 个场景
- 暂存文件数: 15,280
- 包含的结果运行数: 2,266
- 包含的每题结果行数: 37,834
- 论文匹配核心:
evaluations/summary_metrics.*文件中包含 3,106 个轮次
任务类型
该数据集包含两种任务类型:
- multi_choice: 代理回答多项选择题。
eval字段存储了接受的答案选项和选项文本。 - exec_check: 代理必须创建或更新工作区文件。
eval字段存储了检查器命令、预期退出代码和超时时间。
数据构成
每个场景位于 scenarios/<scenario_id>/ 目录下,主要包含以下两部分:
-
场景数据 (
data/)clip/: 作为视觉证据的视频片段。workspace/: 代理的初始工作目录,包含任务文档、结构化文件、转录文本、架构等。其中关键文件为:AGENTS.md: 设置文本,包含场景级别的工作规则、输出约束、引用风格和任务协议。IDENTITY.md: 为代理分配的角色的设置文本。USER.md: 场景背后的用户或利益相关者意图。
updates/: 在指定轮次应用的动态环境变化(如添加/修改文件)。
-
场景规范 (
spec/)questions.json: 有序的轮次列表。每个轮次包含指令、轮次类型、评估规则、模态标签、预期来源、技能标签和发布标志。scripts/check_*.py: 用于exec_check轮次的可执行检查器脚本,验证代理创建或编辑的文件。gold/: 某些检查器或分析所需的参考工件。layer*.md,GUIDE.md,video_grounding.md,video_grounding_auto.md: 构建和验证注释。
清单文件
manifest.json: 发布级别的计数和打包元数据。manifests/scenarios.jsonl: 每个场景一行,包含来源桶、场景ID、视频片段路径、数据路径、规范路径和轮次数。manifests/rounds.jsonl: 每个轮次一行,从所有questions.json文件中扁平化得来。manifests/files.jsonl: 包内暂存的文件清单。
评估文件
evaluations/ 目录包含用于分析的结果工件:
summary_metrics.csv和summary_metrics.json: 总指标,包括匹配的论文核心。result_runs.jsonl: 每个评估的运行/场景/设置一行。per_question_results.jsonl: 每个评估的问题一行,包含通过/失败结果和设置元数据。summaries/: 用于表格和分析的衍生摘要。raw_results/: 每个运行的results.json文件。
评估协议
一个典型的评估循环应遵循以下步骤:
- 将
data/workspace/暂存为代理的工作区。 - 提供来自
data/clip/的相关视频证据。 - 按顺序呈现
spec/questions.json中的轮次。 - 在触发轮次到达时应用
data/updates/中的有效载荷。 - 对于
multi_choice轮次,根据eval.answer对所选选项进行评分。 - 对于
exec_check轮次,针对该轮次的最终工作区状态运行指定的检查器命令。
注意:该基准测试具有状态性,后续轮次可能依赖于先前编辑的文件,而更新可能改变工作区。不应在每轮前重置工作区。
许可与重分发
该数据集的许可证标识为 other,因为它结合了多个上游数据集的衍生场景文件、生成的基准元数据和视频源。在重新分发视频或此包的修改副本前,需检查相关来源桶的上游条款。




