遇见数据集

RoboVista

收藏
github2026-07-07 更新2026-07-09 收录
数据链接:
官方服务:

资源简介:

RoboVista是一个专家标注的、以机器人为中心的视觉问答基准,采用机器人问答(RQA)模块化框架构建,将机器人系统的真实决策点转化为基于视觉的问答。它包含474个多项选择题,涵盖6个机器人应用领域和39种任务类型,从农业、手术到工业自动化和自动驾驶。

RoboVista is an expert-annotated robot-centric visual question answering (VQA) benchmark built upon the modular Robot Question Answering (RQA) framework, which translates real decision-making points in robotic systems into vision-based question answering tasks. It contains 474 multiple-choice questions covering 6 robotic application domains and 39 task categories, ranging from agriculture, surgery, industrial automation to autonomous driving.

创建时间:
2026-07-07
原始信息汇总

RoboVista:面向多样化机器人应用的视觉语言模型评估基准

RoboVista 是一个由专家标注的、以机器人为中心的视觉问答(VQA)基准测试,基于 机器人问答(RQA) 框架构建。该框架将机器人系统中的真实决策点转化为有据可依的 VQA 问题。基准包含 474 个多选题,覆盖 6 个机器人应用领域39 种任务类型。当前最先进的视觉语言模型(VLM)在该基准上表现差距显著(最佳模型准确率仅为 56.5%),物理机器人实验证实 RoboVista 性能与真实世界任务执行高度相关。

基准构成

每题配有一张或多张以机器人为中心的图像、一个五选一选择题、正确答案以及详细的专家推理解释。视觉数据来自 18 篇经同行评审的出版物和开源机器人数据集(DROID、Open X-Embodiment、AgiBot)。所有标注者均为研究生及以上学历,其中超过半数持有机器人学博士学位。

项目 数量
专家标注的 VQA 问题 474
机器人应用领域 6
不同机器人任务类型 39
以机器人为中心的图像 730

领域分布

领域 问题数 描述
开放数据集 150 基于 DROID、Open X-Embodiment 和 AgiBot 轨迹,参考 Robo2VLM 框架提出
工业 144 1D/3D 柔性物体操作、装配、分拣、工厂产线缺陷检测
农业 62 机器人园艺、植物检测、遮挡和极端光照下的除草
家庭 52 家庭整理、衣物操作,场景光照良好、符合人尺度、结构化
手术 46 基于 da Vinci Research Kit (dVRK) 的长时序打结和清创
驾驶 20 来自 Mcity 自动驾驶挑战的决策点

问题覆盖模块化机器人系统的四个功能层级:感知(场景理解)、高层规划动作感知(运动可行性)和鲁棒性(故障检测与恢复)。

结果

RoboVista 上的零样本准确率(%)。随机基线为 20%。

模型 总体 农业 驾驶 家庭 工业 手术 开放
Gemini 2.5 Pro 56.5 48.4 50.0 63.2 48.4 76.1 58.3
Qwen3-235B-A22B 51.3 46.8 60.0 53.9 37.3 69.6 56.9
GPT-4o 49.6 50.0 50.0 59.2 32.5 67.4 53.5
Qwen3-VL-32B 49.2 48.4 55.0 48.7 35.7 65.2 55.6
GPT-5 48.1 38.7 55.0 46.1 35.7 63.0 58.3
RoboBrain 2.5-8B 45.8 37.1 55.0 51.3 36.5 56.5 50.0
Qwen2.5-VL-72B 44.3 43.5 35.0 40.8 31.7 69.6 50.7
Robo2VLM-ER 42.6 35.5 40.0 43.4 32.5 54.3 50.7
Qwen3-8B(仅文本) 25.1 27.4 30.0 30.8 22.2 26.1 24.0

主要发现

  • RoboVista 具有挑战性 — 最佳模型总体准确率仅达 56.5%,每个领域均存在显著差距。
  • 领域差异明显 — 家庭场景最容易;农业领域(细粒度植物形态、自遮挡、柔性结构)始终最难。
  • 思维链(CoT)是双刃剑 — 通过过度思考使低层感知准确率下降最多 12%,但常能改善多步规划。
  • 上下文学习适得其反 — 同领域示例使准确率降低 2.8–6.5%,校准误差最高增加 9.7%。
  • 感知是瓶颈 — 错误识别是主要失败模式(占 30.2%);扩大模型规模可减轻但无法解决空间推理问题。
  • 基准具有预测性 — RoboVista 得分与真实双臂对齐(ρ = −0.93)和物理机器人手术打结进展强相关。

数据集字段

字段 类型 描述
images 图像列表 问题对应的一张或多张以机器人为中心的图像
question 字符串 问题文本
choices 字符串列表 答案选项 A–E
correct_answer 字符串 正确选项字母
reasoning 字符串 答案的专家推理解释
domain 字符串 应用领域(agriculture, driving, domestic, industrial, surgical, open datasets)
task 字符串 机器人任务类别(共 39 种)
ability_type 字符串 测试的功能层级(perception, planning, action awareness, robustness)
ability_subcategory 字符串 更细粒度的能力标签
publication_source 字符串 图像来源的出版物或数据集
id 字符串 唯一问题标识符

快速开始

加载数据集

python from datasets import load_dataset

ds = load_dataset("sy-xie/robovista", split="train") print(ds[0]["question"]) print(ds[0]["choices"]) print(ds[0]["correct_answer"]) ds[0]["images"][0].show() # PIL图像

本地浏览数据集

提供交互式画廊查看器,可按领域、任务和能力类型筛选:

bash pip install -r requirements.txt python viewer/app.py

打开 http://localhost:7860 即可使用。

评估模型

通过兼容 OpenAI API 的接口(OpenAI, vLLM, SGLang 等)评估任意视觉语言模型。支持 standard(仅输出字母)和 cot(思维链推理)两种提示配置。

引用

bibtex @inproceedings{xie2026robovista, title = {RoboVista: Evaluating Vision-Language Models for Diverse Robot Applications}, author = {Xie, Shuangyu and Chen, Kaiyuan and Chen, Ziyang and Adebola, Simeon and Huang, Yixuan and Ma, Zehan and Qiu, Tianshuang and Yuan, Wentao and Shah, Dhruv and Sanketi, Pannag R. and Goldberg, Ken}, booktitle = {Robotics: Science and Systems (RSS)}, year = {2026}, }

搜集汇总
数据集介绍
构建方式
在机器人视觉-语言模型评估领域,现有基准往往缺乏对真实机器人决策场景的深度覆盖。RoboVista数据集应运而生,它采用创新的机器人问答(RQA)模块化框架,将机器人系统中的真实决策点转化为有依据的视觉问答任务。数据来源涵盖18篇经过同行评审的出版物以及DROID、Open X-Embodiment、AgiBot等开放机器人数据集,所有图像均围绕机器人视角精心筛选。每个问题配备一张或多张机器人中心图像、五个选项、正确答案及专家推理说明,标注团队均为研究生及以上学历,其中半数以上拥有机器人学博士学位,构建了474道高质量的多选题,横跨6个机器人应用领域和39种任务类型。
特点
RoboVista数据集展现出鲜明的多维特质。首先,它覆盖农业、工业、医疗手术、自动驾驶、家庭服务及开放数据集六大领域,问题按感知、高层规划、动作意识和鲁棒性四个功能层次精心分层,系统性考验模型的全面能力。其次,评价结果表明该基准极具挑战性,最强模型准确率仅达56.5%,农业领域因植物细微形态与自遮挡成为最难攻克的堡垒。更值得关注的是,实验证实RoboVista的性能评分与真实机器人任务执行成效高度相关,如双手对齐任务相关系数达-0.93,彰显其预测真实世界应用的卓越价值。
使用方法
研究人员可通过简洁的代码接口快速接入RoboVista数据集。使用Hugging Face的`datasets`库,调用`load_dataset("sy-xie/robovista", split="train")`即可获取完整数据,每个样本包含图像、问题、选项、正确答案及专家推理等丰富字段。本地提供交互式画廊浏览工具,支持按领域、任务和能力类型筛选查看。模型评估方面,基于OpenAI兼容API的评测脚本可一键运行,支持标准零样本和链式思维两种提示模式,具备自动断点续评功能,大幅提升大规模评测的效率与稳定性。
背景与挑战
背景概述
RoboVista是由加州大学伯克利分校、普林斯顿大学与谷歌DeepMind联合构建的专家标注视觉问答基准,于2026年发表于机器人顶会RSS。该数据集聚焦于机器人应用场景下的视语言模型评估,通过机器人问答框架将真实决策点转化为图文问题,涵盖农业、手术、工业自动化、自动驾驶等6大领域的474道五选一题目。其核心研究问题在于揭示当前最强视觉语言模型在具身智能任务中的局限性——即便顶级模型Gemini 2.5 Pro的准确率也仅达56.5%,远未达到实用水平。作为首个系统覆盖机器人系统四大功能层的基准,RoboVista填补了机器人视觉问答评估的空白,其与物理机器人实验的强相关性验证了评测有效性,为领域发展提供关键参照。
当前挑战
该基准面临的挑战包括:领域问题层面,机器人场景对视觉语言模型提出严苛要求,如农业中植物精细形态与自我遮挡识别、工业中一维/三维柔性物体操作推理,现有模型在感知阶段误判率高达30.2%,且空间推理能力随模型规模提升改善有限,专家-机器人认知鸿沟显著。构建过程中,团队需从18篇同行评审论文及多个开源机器人数据集中筛选730张任务导向图像,确保覆盖39种任务类型;标注团队由研究生以上专家组成,超半数具备机器人学博士学位,以保障474道题目的逻辑严谨性与推理深度;同时需设计多模态基准流程应对不同领域图像风格差异,平衡感知、规划、动作认知与鲁棒性四类能力的测试占比,实现全面评估。
常用场景
经典使用场景
在机器人学与视觉语言模型交叉领域,RoboVista被广泛用作评估视觉语言模型在真实机器人任务中感知与决策能力的基准测试平台。该数据集通过专家标注的474道多选题,覆盖农业、工业、手术、驾驶、家务及开放数据集六大应用领域,旨在衡量模型在感知、高层规划、动作意识和鲁棒性四个功能层上的表现。研究者通常采用零样本问答范式,评估模型对机器人中心场景图像的理解与多选答案的推理能力,从而揭示当前前沿视觉语言模型在具身智能任务中的实际表现局限。
实际应用
RoboVista的实际应用贯穿多元化机器人场景,从农业中的植物形态识别与杂草清除、工业中的变形物体操作与缺陷检测,到手术机器人中的长时程打结与清创操作,以及自动驾驶中的决策点判断。该数据集的设计使其能够直接服务于机器人系统的模块化开发与评估,帮助工程师和研究者快速定位视觉语言模型在特定功能层(如感知、计划、动作意识)上的性能短板。例如,在工业自动化领域,团队可利用RoboVista筛选适合缺陷扫描任务的高鲁棒性模型;在手术机器人领域,则可依据其评估结果优化模型的长期任务推理能力,从而推动跨领域机器人应用的智能化进程。
衍生相关工作
RoboVista的发布催生了多项相关研究工作,首当其冲的是其本身依托的Robo2VLM框架,该框架将机器人系统中的真实决策点转化为结构化视觉问答数据,为后续数据构建提供了可复现的方法论。此外,基于RoboVista的评测结果,研究者开发了专门的提示策略优化方案,如链式思维推理在提升复杂规划任务表现的同时被发现会降低低级感知准确率,而上下文学习则被证实会带来2.8-6.5%的准确率下降,这些发现直接引导了针对机器人场景的微调与适应方法创新。同时,该基准在物理机器人实验中的强预测性也启发了关于仿真与真实世界性能关联性建模的后续探索,推动了将离线基准评估作为在线部署前筛选工具的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务