遇见数据集

Act2Answer

收藏
github2026-07-02 更新2026-07-04 收录
官方服务:

资源简介:

Act2Answer是一个具身评估协议,用于测试视觉-语言-动作(VLA)模型在机器人适应后是否保留常识和世界知识。它将VLM风格的问题转化为简短的桌面操作片段:智能体读取自然语言指令,并通过在认为正确的图像瓦片上放置立方体来回答。该套件包含1,720个独特的二元问题和3,440个评估片段,覆盖从五个源基准改编的12个类别,专注于日常具身智能体相关的知识类别,如社会、物理、定量、时间、规范、文化和生物知识。

Act2Answer is an embodied evaluation protocol designed to test whether Vision-Language-Action (VLA) models retain common sense and world knowledge after robotic adaptation. It converts Vision-Language Model (VLM)-style questions into brief desktop manipulation scenarios: the agent reads natural language instructions and answers by placing a cube on the image tile it deems correct. This suite includes 1,720 unique binary questions and 3,440 evaluation segments, covering 12 categories adapted from five source benchmarks. It focuses on knowledge categories relevant to daily embodied agents, such as social, physical, quantitative, temporal, normative, cultural, and biological knowledge.

创建时间:
2026-06-17
原始信息汇总

数据集概述:Act2Answer

Act2Answer 是一个具身化评估协议,旨在测试视觉-语言-动作(VLA)模型在经历机器人适应后,是否仍保留常识和世界知识。该协议将每个 VLM 风格的问题转化为一个简短的桌面操作片段:智能体读取自然语言指令,并通过将方块放置在它认为正确的图像瓦片上来作答。

核心设计理念

  • 简化运动问题:刻意保持运动任务的简单性,使失败更能反映知识缺失、遗忘或无法通过动作访问的问题,而非长时程控制难度。
  • 二进制选择格式:将既有的 VLM 基准测试改编为具身化的二进制选择格式。每个任务包含一个简短的动作兼容指令、两个视觉答案选项,以及在仿真环境中的一个通用选择动作。

数据集规模与内容

  • 1,720 个独特的二进制问题,涵盖包括原始布局和交换布局在内的 3,440 个评估片段
  • 覆盖 12 个知识类别,这些类别改编自五个源基准测试,包括:社会、物理、定量、时间、规范、文化和生物知识。

评估维度

该基准测试聚焦于对日常具身智能体至关重要的知识类别:

  • 基础感知:颜色、形状
  • 丰富语义:情感、属性、状态、时间、计数、对称性、交通、公共信息、名人、生命世界

主要发现

  1. 基础感知保留较好:当前 VLA 模型通常能保留简单的感知区分,如颜色和形状。
  2. 语义理解困难:更丰富的语义类别(如情感、属性、时间、计数等)对许多模型来说仍接近随机水平。
  3. VLM-to-VLA 差距显著:强大的 VLM 基线模型在许多知识敏感类别上表现优于其 VLA 对应模型约 20-40 个百分点
  4. 中间层可恢复知识:逐层探测表明,答案相关信息通常可在骨干网络的中间层中恢复,但在用于动作预测的层附近会减弱。
  5. 持续视觉-语言监督有益:接受持续视觉-语言监督训练后的 VLA 模型,在知识敏感任务上通常优于主要依赖机器人数据训练的模型。
  6. 动作微调的双刃剑效应:下游动作微调可以改善控制,但同时也可能进一步削弱某些形式的知识敏感行为。

与相关工作的关系

技术实现与使用

  • 环境要求:Linux 系统、NVIDIA GPU 及 CUDA 驱动、Conda 或 Miniconda。
  • 支持的模型:pi0、Magma、OpenVLA、SpatialVLA、Xiaomi-Robotics-0、InternVLA-M1、MolmoAct2。
  • 评估资产:位于 ManiSkill/mani_skill/assets/carrot/<asset_name>/,包含 pairs.json、瓦片模型/纹理及元数据。
  • 输出:仅生成本地文件(视频和每轮 YAML 文件),不使用 wandb。

引用

若使用 Act2Answer,请引用论文: bibtex @misc{kachaev2026doesvlaknowbasics, title={Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models}, author={Nikita Kachaev and Andrey Moskalenko and Matvey Skripkin and Nikita Kurlaev and Daria Pugacheva and Albina Burlova and Mikhail Kolosov and Denis Shepelev and Andrey Kuznetsov and Elena Tutubalina and Aleksandr I. Panov and Alexey K. Kovalev and Vlad Shakhuro}, year={2026}, eprint={2606.19297}, archivePrefix={arXiv}, primaryClass={cs.LG}, url={https://arxiv.org/abs/2606.19297} }

搜集汇总
数据集介绍
Act2Answer 数据集图片
构建方式
在机器人学习领域,评估视觉-语言-动作(VLA)模型在适应具体任务后是否仍保留常识与世界知识,是一项关键挑战。Act2Answer数据集通过将传统视觉-语言基准测试改编为具身化的二选一格式来应对这一挑战。每个任务包含一条简短的、与动作兼容的自然语言指令,两个视觉答案选项,以及一个在仿真环境中通用的选择动作。数据集的构建流程涵盖了从五个源基准中筛选出的十二个知识类别,包括社会、物理、数量、时间、规范、文化和生物知识,最终生成了1,720道独特的二元问题和3,440个评估片段(含原始与交换布局)。
特点
Act2Answer的显著特点在于其精心设计的评估范式,它刻意简化了运动控制问题,使得模型失败的原因更能反映知识层面(而非长程操控难度)的缺失。基准涵盖了从简单的颜色与形状区分到更具语义深度的情感、属性、时间、计数、交通规则等丰富范畴。关键发现揭示了当前VLA模型在保留简单感知知识方面表现尚可,但在高阶语义类别上常徘徊于随机水平,且与强视觉-语言模型基线存在约20至40个百分点的显著差距,表明从视觉-语言到视觉-语言-动作的知识迁移存在显著鸿沟。
使用方法
使用Act2Answer进行评估前,需在配备NVIDIA GPU的Linux系统上,通过Conda配置所需环境。用户可从克隆代码仓库并运行外部模型仓库克隆脚本开始,随后依据目标模型(如SpatialVLA、OpenVLA等)执行对应的环境设置脚本。评估过程通过调用特定任务脚本并指定数据集切分(如ASSETS=test_colors)与测试数量(COUNT=6)来启动,支持单模型或批量运行。所有结果(包括视频和性能日志)均保存至本地目录,无需在线日志平台登录,确保了评估的便捷性与可复现性。
背景与挑战
背景概述
Act2Answer是由Nikita Kachaev及其来自多所机构的研究团队于2026年创建的一项具身化评估协议,旨在衡量视觉-语言-动作(VLA)模型在机器人适应性训练后保留常识与世界知识的能力。该数据集将传统的视觉-语言模型(VLM)问题转化为简短的桌面操作任务:代理通过将立方体放置在认为正确的图像瓦片上来回答自然语言指令。Act2Answer包含1,720个独特的二元问题和3,440个评估场景,涵盖社会、物理、量级、时间、规范、文化和生物学等12个知识类别,源于五个现有基准。其核心研究问题在于揭示VLA模型在知识保留方面的缺陷,为具身智能体中的知识遗忘提供诊断工具,对机器人学习与多模态模型交叉领域具有显著影响力。
当前挑战
Act2Answer所解决的领域问题在于VLA模型在适应机器人任务后常丢失文本模型中的常识与世界知识,形成一个知识鸿沟。当前挑战集中在:1) 尽管VLA能保留简单的感知区分如颜色和形状,但情感、属性、状态、时间、计数、对称性、交通、公共信息、名人和生物世界等丰富语义类别仍处于随机水平,表明知识敏感行为严重退化;2) 构建过程中面临将文本问题转化为具身任务的挑战,需确保动作简单以突出知识缺陷而非控制难度,同时保持评估的公平性和可复现性;3) 层探测试显示答案相关信息在中间骨干层可恢复,但在动作预测层附近减弱,表明知识在模型处理流中丢失,下游动作微调可能进一步削弱知识敏感行为。
常用场景
经典使用场景
在具身智能与机器人学交叉领域,Act2Answer被设计为一项开创性的具身评估协议,专门用于检验视觉-语言-动作(VLA)模型在经历机器人领域适配后,是否仍能保留其固有的常识与世界知识。该数据集将传统视觉-语言模型(VLM)基准测试中每一道文本形式的问答问题,巧妙转化为简短的桌面操作情节:机器人智能体接收自然语言指令后,通过将方块放置于它认为正确的图像格上来作答。这种设计刻意简化了运动控制问题难度,使得模型失败时所揭示的更多是关于缺失、遗忘或因行为表征而无法访问的知识,而非长时序控制的复杂性。Act2Answer包含1720道独特的二值化问题,覆盖12个知识类别,每个任务均配有一句简洁的动作兼容指令与两个视觉答案选项,在仿真环境中执行统一的选取动作,为评估VLA模型的知识保留能力提供了标准化且富有洞察力的平台。
解决学术问题
该数据集精准回应了具身智能领域一个核心却常被忽视的学术问题:VLA模型在经历以机器人数据为主的行动微调后,其内部承载的视觉-语言常识与世界知识是否遭到侵蚀或遗忘。传统评估多聚焦于任务成功率或运动控制精度,而Act2Answer首次系统性地将知识保留作为独立评估维度,通过颜色、形状、情感、时间、计数、对称性、交通、公共信息、名人、生命世界等丰富的知识类别,揭示了当前主流VLA模型普遍存在的严重知识丢失现象。研究发现,基础感知类知识如颜色和形状相对完好,但更高层次的语义知识表现往往仅接近随机水平,强VLM基线与VLA版本之间在多个知识敏感类别上的准确率差异可高达20至40个百分点。这一发现深刻改变了学界对VLA模型鲁棒性的认知,推动了研究重心从单纯追求操控精度的提升,转向关注如何构建既能执行物理动作又能有效维系世界知识的具身智能系统。
衍生相关工作
自Act2Answer提出以来,其新颖的评估理念和开放的协议设计已经催生了一系列具有影响力的衍生研究工作。研究者们借鉴其嵌入式知识探查范式,提出了针对特定知识类别的深度分析框架,例如利用层间探针技术在不同VLA骨干网络中追踪知识表征的动态变化,发现答案相关信息往往在中间骨干层仍可恢复,但在靠近动作预测层时显著衰减。这一发现直接启发了后续关于知识保护性微调策略的研究工作,旨在通过额外引入视觉-语言持续监督来减缓知识退化。此外,该数据集也促进了多类模型对比工具的涌现,包括以知识保留率为核心指标的模型选择系统、面向VLA的知识蒸馏方案,以及融合常识推理与动作生成的新型架构设计。Act2Answer本身作为开放基准,还支持了多个公开模型排行榜的建立,推动了学术界与工业界在具身模型知识鲁棒性方面的系统交流与竞争。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务