遇见数据集

VisualClawArena

收藏
Hugging Face2026-06-16 更新2026-06-17 收录
官方服务:

资源简介:

VisualClawArena是一个专门设计用于评估多模态计算机使用代理能力的基准测试数据集,包含200个精心构建的场景,每个场景均配备视频片段、持久化工作空间、动态环境更新、多轮交互式指令以及可执行验证检查器。其核心设计目标是超越传统的静态视频问答任务,测试智能代理能否综合利用视频视觉证据、工作空间文件内容以及后续环境变化信息来完成任务。数据集包含5,000个人工编写的交互轮次,其中4,885个轮次被纳入发布版本,3,610个轮次明确要求视频输入。任务类型分为两种:3,500个可执行检查轮次(要求代理创建或修改工作空间文件)和1,385个多项选择题轮次。数据来源于三个上游数据集:indoor_vsi(100个场景)、egoschema(50个场景)和qvhighlights(50个场景)。数据集还包含15,280个暂存文件,并附带了2,266次评估运行的37,834条详细结果记录。每个场景的结构化数据包括:作为视觉证据的视频片段、初始工作空间目录、关键场景设置文件以及动态更新目录。数据集采用状态化评估协议,适用于多模态代理开发、视频理解、长上下文交互、自我进化系统等研究领域。

VisualClawArena is a benchmark dataset specifically designed to evaluate the capabilities of multimodal computer-use agents. It contains 200 carefully constructed scenarios, each equipped with video clips, persistent workspaces, dynamic environment updates, multi-turn interactive instructions, and executable verification checkers. Its core design goal is to go beyond traditional static video question-answering tasks, testing whether intelligent agents can comprehensively utilize video visual evidence, workspace file content, and subsequent environmental changes to complete tasks. The dataset includes 5,000 human-written interaction turns, with 4,885 turns included in the released version and 3,610 turns explicitly requiring video input. Task types are divided into two categories: 3,500 executable check turns (requiring agents to create or modify workspace files) and 1,385 multiple-choice question turns. Data is sourced from three upstream datasets: indoor_vsi (100 scenarios), egoschema (50 scenarios), and qvhighlights (50 scenarios). The dataset also contains 15,280 staging files and includes 37,834 detailed result records from 2,266 evaluation runs. Structured data for each scenario includes: video clips as visual evidence, an initial workspace directory, key scenario setup files, and a dynamic updates directory. The dataset employs a stateful evaluation protocol and is applicable to research areas such as multimodal agent development, video understanding, long-context interaction, and self-evolving systems.

提供机构:
UCSC-VLAA
创建时间:
2026-06-14
原始信息汇总

数据集总览

VisualClawArena 是一个用于评估多模态计算机使用代理的基准测试,包含 200 个场景。其核心设计理念是测试代理是否能够结合视频证据、工作区文件和动态环境变化来执行任务,而非仅回答静态的视频问答。

  • 版本: 2026-06-12
  • 场景数量: 200
  • 创作轮次: 5,000
  • 发布轮次: 4,885
  • 依赖视频的发布轮次: 3,610
  • 发布轮次类型:
    • 可执行检查轮次: 3,500
    • 多项选择轮次: 1,385
  • 来源桶:
    • indoor_vsi: 100 个场景
    • egoschema: 50 个场景
    • qvhighlights: 50 个场景
  • 暂存文件数: 15,280
  • 包含的结果运行数: 2,266
  • 包含的每题结果行数: 37,834
  • 论文匹配核心: evaluations/summary_metrics.* 文件中包含 3,106 个轮次

任务类型

该数据集包含两种任务类型:

  • multi_choice: 代理回答多项选择题。eval 字段存储了接受的答案选项和选项文本。
  • exec_check: 代理必须创建或更新工作区文件。eval 字段存储了检查器命令、预期退出代码和超时时间。

数据构成

每个场景位于 scenarios/<scenario_id>/ 目录下,主要包含以下两部分:

  • 场景数据 (data/)

    • clip/: 作为视觉证据的视频片段。
    • workspace/: 代理的初始工作目录,包含任务文档、结构化文件、转录文本、架构等。其中关键文件为:
      • AGENTS.md: 设置文本,包含场景级别的工作规则、输出约束、引用风格和任务协议。
      • IDENTITY.md: 为代理分配的角色的设置文本。
      • USER.md: 场景背后的用户或利益相关者意图。
    • updates/: 在指定轮次应用的动态环境变化(如添加/修改文件)。
  • 场景规范 (spec/)

    • questions.json: 有序的轮次列表。每个轮次包含指令、轮次类型、评估规则、模态标签、预期来源、技能标签和发布标志。
    • scripts/check_*.py: 用于 exec_check 轮次的可执行检查器脚本,验证代理创建或编辑的文件。
    • gold/: 某些检查器或分析所需的参考工件。
    • layer*.md, GUIDE.md, video_grounding.md, video_grounding_auto.md: 构建和验证注释。

清单文件

  • manifest.json: 发布级别的计数和打包元数据。
  • manifests/scenarios.jsonl: 每个场景一行,包含来源桶、场景ID、视频片段路径、数据路径、规范路径和轮次数。
  • manifests/rounds.jsonl: 每个轮次一行,从所有 questions.json 文件中扁平化得来。
  • manifests/files.jsonl: 包内暂存的文件清单。

评估文件

evaluations/ 目录包含用于分析的结果工件:

  • summary_metrics.csvsummary_metrics.json: 总指标,包括匹配的论文核心。
  • result_runs.jsonl: 每个评估的运行/场景/设置一行。
  • per_question_results.jsonl: 每个评估的问题一行,包含通过/失败结果和设置元数据。
  • summaries/: 用于表格和分析的衍生摘要。
  • raw_results/: 每个运行的 results.json 文件。

评估协议

一个典型的评估循环应遵循以下步骤:

  1. data/workspace/ 暂存为代理的工作区。
  2. 提供来自 data/clip/ 的相关视频证据。
  3. 按顺序呈现 spec/questions.json 中的轮次。
  4. 在触发轮次到达时应用 data/updates/ 中的有效载荷。
  5. 对于 multi_choice 轮次,根据 eval.answer 对所选选项进行评分。
  6. 对于 exec_check 轮次,针对该轮次的最终工作区状态运行指定的检查器命令。

注意:该基准测试具有状态性,后续轮次可能依赖于先前编辑的文件,而更新可能改变工作区。不应在每轮前重置工作区。

许可与重分发

该数据集的许可证标识为 other,因为它结合了多个上游数据集的衍生场景文件、生成的基准元数据和视频源。在重新分发视频或此包的修改副本前,需检查相关来源桶的上游条款。

搜集汇总
数据集介绍
VisualClawArena 数据集图片
构建方式
VisualClawArena是一项专为多模态计算机使用代理设计的基准测试,囊括200个精细化场景。每个场景由视频片段、持久化工作区、动态环境更新、多轮指令及可执行验证器共同构成。数据集的构建根植于对代理综合能力的深度考量,要求其不仅具备静态视频问答能力,更需融合视频证据、工作区文件与后续环境变化进行推理与决策。数据来源涵盖indoor_vsi、egoschema与qvhighlights三大源桶,经精心编排形成5000个原创轮次,其中4885轮被释出,包含3500个可执行检查轮与1385个多选题轮,确保评测的全面性与挑战性。
特点
该数据集的核心特色在于其状态依赖性与动态交互机制。每个场景内嵌AGENTS.md、IDENTITY.md与USER.md等代理面向上文文件,明确任务规则与角色定位。工作区初始状态与后续更新文件共同构建了随时间演化的任务环境,评测轮次严格遵循顺序依赖性,禁止重置工作区,以还原真实代理交互场景。此外,数据集提供多层元数据,包括必需的模态标签、技能标签及证据类型标注,支持细粒度的能力分析与泄露探测研究。视频要求轮次与纯文本可解轮次的对比设计,为评估视觉证据的实际利用率提供了独特视角。
使用方法
使用VisualClawArena时,需遵循标准化的评测流程:首先部署工作区与视频证据,随后按序呈现问题轮次,并在指定轮次触发动态更新。对于多选题轮,直接比较代理选项与预设答案;对于可执行检查轮,则运行对应验证脚本检测工作区状态。Hugging Face用户可通过datasets库便捷加载场景与轮次清单,便于快速启动评测。研究论文中的核心指标已存储于summary_metrics文件中,支持直接复现分析。新模型可依循相同协议进行评估,但需注意避免向代理暴露构建笔记、验证脚本或未来轮次信息,以确保评测的公平性。
背景与挑战
背景概述
VisualClawArena是由加州大学圣克鲁兹分校视觉语言与自主学习实验室(UCSC-VLAA)于2026年创建的多模态计算机使用代理基准数据集。该数据集包含200个精心设计的测试场景,旨在评估代理在动态工作环境中利用视频证据、处理持久化工作空间文件并响应多轮指令的综合能力。与传统的静态视频问答基准不同,VisualClawArena要求代理在持续演变的交互环境中做出决策,突破了现有基准对代理长期上下文理解与自适应能力的评估局限。该基准的发布为多模态代理研究提供了更为严苛的评测标准,推动了视频理解与智能体系统从短时静态问答向长时动态交互的范式转变。
当前挑战
VisualClawArena所解决的核心挑战包括以下几个方面:1)领域问题层面,传统视频问答基准无法有效评估代理在动态环境中的持续决策能力,代理需在保留历史信息的同时应对不断变化的工作空间,这要求其具备长期记忆、多模态推理与执行非原子化任务的能力。2)构建过程中的挑战,数据集需将不同来源的视频片段(如EgoSchema、QVHighlights)统一整合为包含可执行检查脚本、多轮指令与动态更新的200个场景,每个场景的验证机制(包括可执行检查与多项选择)需精心设计以确保评估的客观性与可重复性。此外,为防止数据泄露,研究中需严格区分视频必须使用的轮次与纯文本可解的轮次,并标注每种轮次的证据类型,这增加了数据集构建的复杂性。
常用场景
经典使用场景
在视觉语言模型与自主智能体系统的交叉领域中,VisualClawArena作为一项精雕细琢的基准测评平台,其经典使用场景聚焦于评估多模态计算机使用智能体在动态工作环境中的综合能力。该数据集精心构建了200个复杂场景,每个场景配备视频片段、可持久化的工作空间、动态更新的环境状态以及多轮交互指令。研究者通过引导智能体依次完成一系列需要结合视觉证据、工作区文件与实时环境变化的任务,能够全景式地检验其视频理解、工具操控与多步推理的协同性能。这一设置突破了传统静态视频问答的局限,为构建真正具备环境适应能力的下一代多模态智能体提供了标准化的测试沙盘。
衍生相关工作
围绕VisualClawArena数据集的独特设计理念,学术界已衍生出多项富有启发性的经典工作。其中,基于其`evidence_type`标签的研究深入探讨了多模态智能体在不同信息条件下的决策行为,推动了视觉语言模型对视频时序信息的建模方法革新。受其`exec_check`交互式评估框架启发,一系列工作开始探索如何将可执行检查器融入智能体训练流程,形成闭环式自我优化机制。更进一步的探索则聚焦于利用`data/updates/`动态更新机制构造长期依赖任务,催生了关于环境状态推理与工作区记忆建模的新研究方向。这些衍生工作共同编织了以VisualClawArena为核心的多模态智能体研究网络,持续激发出该领域更深层次的理论与实践突破。
数据集最近研究
最新研究方向
VisualClawArena的发布标志着多模态计算机使用智能体评估从静态问答迈向动态、多轮交互的范式跃迁。该基准涵盖200个复杂场景,核心创新在于将视频证据、持久化工作区和环境动态更新融为一体,要求智能体不仅依赖视觉信息,还需实时操作文件、响应环境变更并完成可执行验证。这一设计直面当前大模型在长上下文理解和自主演化能力上的瓶颈,尤其针对智能体在真实办公、家居或专业领域中的工具使用、多步推理和状态跟踪等前沿难题。在具身智能与AI Agent社区高度聚焦自主决策的当下,VisualClawArena提供了首个兼顾视频理解与执行校验的标准化试验场,其对智能体技能图谱、证据类型泄漏探测及自我进化轨迹的精细化分析,正成为衡量下一代通用型计算机Agent能力的关键标尺。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务