Act2Answer
收藏资源简介:
Act2Answer是一个具身评估协议,用于测试视觉-语言-动作(VLA)模型在机器人适应后是否保留常识和世界知识。它将VLM风格的问题转化为简短的桌面操作片段:智能体读取自然语言指令,并通过在认为正确的图像瓦片上放置立方体来回答。该套件包含1,720个独特的二元问题和3,440个评估片段,覆盖从五个源基准改编的12个类别,专注于日常具身智能体相关的知识类别,如社会、物理、定量、时间、规范、文化和生物知识。
Act2Answer is an embodied evaluation protocol designed to test whether Vision-Language-Action (VLA) models retain common sense and world knowledge after robotic adaptation. It converts Vision-Language Model (VLM)-style questions into brief desktop manipulation scenarios: the agent reads natural language instructions and answers by placing a cube on the image tile it deems correct. This suite includes 1,720 unique binary questions and 3,440 evaluation segments, covering 12 categories adapted from five source benchmarks. It focuses on knowledge categories relevant to daily embodied agents, such as social, physical, quantitative, temporal, normative, cultural, and biological knowledge.
数据集概述:Act2Answer
Act2Answer 是一个具身化评估协议,旨在测试视觉-语言-动作(VLA)模型在经历机器人适应后,是否仍保留常识和世界知识。该协议将每个 VLM 风格的问题转化为一个简短的桌面操作片段:智能体读取自然语言指令,并通过将方块放置在它认为正确的图像瓦片上来作答。
核心设计理念
- 简化运动问题:刻意保持运动任务的简单性,使失败更能反映知识缺失、遗忘或无法通过动作访问的问题,而非长时程控制难度。
- 二进制选择格式:将既有的 VLM 基准测试改编为具身化的二进制选择格式。每个任务包含一个简短的动作兼容指令、两个视觉答案选项,以及在仿真环境中的一个通用选择动作。
数据集规模与内容
- 1,720 个独特的二进制问题,涵盖包括原始布局和交换布局在内的 3,440 个评估片段。
- 覆盖 12 个知识类别,这些类别改编自五个源基准测试,包括:社会、物理、定量、时间、规范、文化和生物知识。
评估维度
该基准测试聚焦于对日常具身智能体至关重要的知识类别:
- 基础感知:颜色、形状
- 丰富语义:情感、属性、状态、时间、计数、对称性、交通、公共信息、名人、生命世界
主要发现
- 基础感知保留较好:当前 VLA 模型通常能保留简单的感知区分,如颜色和形状。
- 语义理解困难:更丰富的语义类别(如情感、属性、时间、计数等)对许多模型来说仍接近随机水平。
- VLM-to-VLA 差距显著:强大的 VLM 基线模型在许多知识敏感类别上表现优于其 VLA 对应模型约 20-40 个百分点。
- 中间层可恢复知识:逐层探测表明,答案相关信息通常可在骨干网络的中间层中恢复,但在用于动作预测的层附近会减弱。
- 持续视觉-语言监督有益:接受持续视觉-语言监督训练后的 VLA 模型,在知识敏感任务上通常优于主要依赖机器人数据训练的模型。
- 动作微调的双刃剑效应:下游动作微调可以改善控制,但同时也可能进一步削弱某些形式的知识敏感行为。
与相关工作的关系
- 构建于 SimplerEnv 和 ManiSkill 之上。
- 评估工具部分来自 RL4VLA。
- README 结构遵循 BlindVLA 项目风格。
技术实现与使用
- 环境要求:Linux 系统、NVIDIA GPU 及 CUDA 驱动、Conda 或 Miniconda。
- 支持的模型:pi0、Magma、OpenVLA、SpatialVLA、Xiaomi-Robotics-0、InternVLA-M1、MolmoAct2。
- 评估资产:位于
ManiSkill/mani_skill/assets/carrot/<asset_name>/,包含pairs.json、瓦片模型/纹理及元数据。 - 输出:仅生成本地文件(视频和每轮 YAML 文件),不使用 wandb。
引用
若使用 Act2Answer,请引用论文: bibtex @misc{kachaev2026doesvlaknowbasics, title={Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models}, author={Nikita Kachaev and Andrey Moskalenko and Matvey Skripkin and Nikita Kurlaev and Daria Pugacheva and Albina Burlova and Mikhail Kolosov and Denis Shepelev and Andrey Kuznetsov and Elena Tutubalina and Aleksandr I. Panov and Alexey K. Kovalev and Vlad Shakhuro}, year={2026}, eprint={2606.19297}, archivePrefix={arXiv}, primaryClass={cs.LG}, url={https://arxiv.org/abs/2606.19297} }




