RoboVista
收藏资源简介:
RoboVista是一个专家标注的、以机器人为中心的视觉问答基准,采用机器人问答(RQA)模块化框架构建,将机器人系统的真实决策点转化为基于视觉的问答。它包含474个多项选择题,涵盖6个机器人应用领域和39种任务类型,从农业、手术到工业自动化和自动驾驶。
RoboVista is an expert-annotated robot-centric visual question answering (VQA) benchmark built upon the modular Robot Question Answering (RQA) framework, which translates real decision-making points in robotic systems into vision-based question answering tasks. It contains 474 multiple-choice questions covering 6 robotic application domains and 39 task categories, ranging from agriculture, surgery, industrial automation to autonomous driving.
RoboVista:面向多样化机器人应用的视觉语言模型评估基准
RoboVista 是一个由专家标注的、以机器人为中心的视觉问答(VQA)基准测试,基于 机器人问答(RQA) 框架构建。该框架将机器人系统中的真实决策点转化为有据可依的 VQA 问题。基准包含 474 个多选题,覆盖 6 个机器人应用领域 和 39 种任务类型。当前最先进的视觉语言模型(VLM)在该基准上表现差距显著(最佳模型准确率仅为 56.5%),物理机器人实验证实 RoboVista 性能与真实世界任务执行高度相关。
基准构成
每题配有一张或多张以机器人为中心的图像、一个五选一选择题、正确答案以及详细的专家推理解释。视觉数据来自 18 篇经同行评审的出版物和开源机器人数据集(DROID、Open X-Embodiment、AgiBot)。所有标注者均为研究生及以上学历,其中超过半数持有机器人学博士学位。
| 项目 | 数量 |
|---|---|
| 专家标注的 VQA 问题 | 474 |
| 机器人应用领域 | 6 |
| 不同机器人任务类型 | 39 |
| 以机器人为中心的图像 | 730 |
领域分布
| 领域 | 问题数 | 描述 |
|---|---|---|
| 开放数据集 | 150 | 基于 DROID、Open X-Embodiment 和 AgiBot 轨迹,参考 Robo2VLM 框架提出 |
| 工业 | 144 | 1D/3D 柔性物体操作、装配、分拣、工厂产线缺陷检测 |
| 农业 | 62 | 机器人园艺、植物检测、遮挡和极端光照下的除草 |
| 家庭 | 52 | 家庭整理、衣物操作,场景光照良好、符合人尺度、结构化 |
| 手术 | 46 | 基于 da Vinci Research Kit (dVRK) 的长时序打结和清创 |
| 驾驶 | 20 | 来自 Mcity 自动驾驶挑战的决策点 |
问题覆盖模块化机器人系统的四个功能层级:感知(场景理解)、高层规划、动作感知(运动可行性)和鲁棒性(故障检测与恢复)。
结果
RoboVista 上的零样本准确率(%)。随机基线为 20%。
| 模型 | 总体 | 农业 | 驾驶 | 家庭 | 工业 | 手术 | 开放 |
|---|---|---|---|---|---|---|---|
| Gemini 2.5 Pro | 56.5 | 48.4 | 50.0 | 63.2 | 48.4 | 76.1 | 58.3 |
| Qwen3-235B-A22B | 51.3 | 46.8 | 60.0 | 53.9 | 37.3 | 69.6 | 56.9 |
| GPT-4o | 49.6 | 50.0 | 50.0 | 59.2 | 32.5 | 67.4 | 53.5 |
| Qwen3-VL-32B | 49.2 | 48.4 | 55.0 | 48.7 | 35.7 | 65.2 | 55.6 |
| GPT-5 | 48.1 | 38.7 | 55.0 | 46.1 | 35.7 | 63.0 | 58.3 |
| RoboBrain 2.5-8B | 45.8 | 37.1 | 55.0 | 51.3 | 36.5 | 56.5 | 50.0 |
| Qwen2.5-VL-72B | 44.3 | 43.5 | 35.0 | 40.8 | 31.7 | 69.6 | 50.7 |
| Robo2VLM-ER | 42.6 | 35.5 | 40.0 | 43.4 | 32.5 | 54.3 | 50.7 |
| Qwen3-8B(仅文本) | 25.1 | 27.4 | 30.0 | 30.8 | 22.2 | 26.1 | 24.0 |
主要发现
- RoboVista 具有挑战性 — 最佳模型总体准确率仅达 56.5%,每个领域均存在显著差距。
- 领域差异明显 — 家庭场景最容易;农业领域(细粒度植物形态、自遮挡、柔性结构)始终最难。
- 思维链(CoT)是双刃剑 — 通过过度思考使低层感知准确率下降最多 12%,但常能改善多步规划。
- 上下文学习适得其反 — 同领域示例使准确率降低 2.8–6.5%,校准误差最高增加 9.7%。
- 感知是瓶颈 — 错误识别是主要失败模式(占 30.2%);扩大模型规模可减轻但无法解决空间推理问题。
- 基准具有预测性 — RoboVista 得分与真实双臂对齐(ρ = −0.93)和物理机器人手术打结进展强相关。
数据集字段
| 字段 | 类型 | 描述 |
|---|---|---|
images |
图像列表 | 问题对应的一张或多张以机器人为中心的图像 |
question |
字符串 | 问题文本 |
choices |
字符串列表 | 答案选项 A–E |
correct_answer |
字符串 | 正确选项字母 |
reasoning |
字符串 | 答案的专家推理解释 |
domain |
字符串 | 应用领域(agriculture, driving, domestic, industrial, surgical, open datasets) |
task |
字符串 | 机器人任务类别(共 39 种) |
ability_type |
字符串 | 测试的功能层级(perception, planning, action awareness, robustness) |
ability_subcategory |
字符串 | 更细粒度的能力标签 |
publication_source |
字符串 | 图像来源的出版物或数据集 |
id |
字符串 | 唯一问题标识符 |
快速开始
加载数据集
python from datasets import load_dataset
ds = load_dataset("sy-xie/robovista", split="train") print(ds[0]["question"]) print(ds[0]["choices"]) print(ds[0]["correct_answer"]) ds[0]["images"][0].show() # PIL图像
本地浏览数据集
提供交互式画廊查看器,可按领域、任务和能力类型筛选:
bash pip install -r requirements.txt python viewer/app.py
打开 http://localhost:7860 即可使用。
评估模型
通过兼容 OpenAI API 的接口(OpenAI, vLLM, SGLang 等)评估任意视觉语言模型。支持 standard(仅输出字母)和 cot(思维链推理)两种提示配置。
引用
bibtex @inproceedings{xie2026robovista, title = {RoboVista: Evaluating Vision-Language Models for Diverse Robot Applications}, author = {Xie, Shuangyu and Chen, Kaiyuan and Chen, Ziyang and Adebola, Simeon and Huang, Yixuan and Ma, Zehan and Qiu, Tianshuang and Yuan, Wentao and Shah, Dhruv and Sanketi, Pannag R. and Goldberg, Ken}, booktitle = {Robotics: Science and Systems (RSS)}, year = {2026}, }



