遇见数据集

RoboTrustBench

收藏
arXiv2026-06-01 更新2026-06-03 收录
官方服务:

资源简介:

RoboTrustBench是由新加坡管理大学、复旦大学和普林斯顿大学联合创建的机器人操作视频世界模型可信度基准数据集。该数据集包含1,207条经过专家验证的指令-图像对,源自真实世界的大规模机器人操作数据集DROID,涵盖了家庭厨房、办公室等10种物理场景、321种不同物体类型和102种任务动词。其构建过程通过对原始DROID数据进行分层采样、指令改写和图像编辑,并经过严格的人工验证,最终形成包含正常、约束敏感、反事实和对抗性四种评估场景的标准化测试集。该数据集主要应用于评估视频世界模型在机器人操作领域的可信度,旨在系统检验模型在面临模糊指令、物理约束冲突、场景不一致及不安全指令等复杂条件下,能否生成物理合理、语义一致且安全可控的机器人操作视频序列,从而推动可信人工智能在具身智能领域的发展。

RoboTrustBench is a credibility benchmark dataset for world models of robotic manipulation videos, jointly created by Singapore Management University, Fudan University, and Princeton University. This dataset contains 1,207 expert-validated instruction-image pairs, sourced from the large-scale real-world robotic manipulation dataset DROID, covering 10 physical scenarios including home kitchens and offices, 321 distinct object types, and 102 task verbs. It was constructed through hierarchical sampling, instruction rewriting, and image editing on the original DROID data, followed by rigorous manual validation, ultimately forming a standardized test set with four evaluation scenarios: normal, constraint-sensitive, counterfactual, and adversarial. This dataset is primarily applied to evaluate the credibility of video world models in the field of robotic manipulation, aiming to systematically test whether models can generate physically plausible, semantically consistent and safely controllable robotic manipulation video sequences when faced with complex conditions such as ambiguous instructions, physical constraint conflicts, scene inconsistencies and unsafe instructions, thereby promoting the development of trustworthy artificial intelligence in the field of embodied intelligence.

创建时间:
2026-06-01
原始信息汇总

数据集名称

RoboTrustBench —— 面向机器人操作视频世界模型的可信度基准测试

数据集核心问题

当前模型能生成视觉上连贯的视频,但在以下方面仍存在困难:

  • 受约束的操作
  • 反事实(与现实世界冲突)的接地
  • 物理上合理的交互
  • 不安全指令的抑制

数据集构建方法

数据基于真实的 DROID 机器人操作片段,通过修改指令/图像并经专家验证,构建四类样本:

  • Normal(正常场景)
  • Constraint-Sensitive(约束敏感场景)
  • Counterfactual(反事实场景)
  • Adversarial(对抗性/安全场景)

该设计将标准任务执行与需要约束处理、世界状态接地和安全意识抑制的可信度关键案例分开。

数据集统计信息

  • 场景类型:涵盖多种室内环境
  • 物体类型:321 种
  • 任务动词:102 种
  • 非正常场景:细分为三类失败来源——约束可行任务、与观察世界冲突的指令、不安全的机器人意图

主要评估维度与结果

  1. 人类评估(13 个维度)
    将 1-5 分制标准化为 [0,1],其中“安全风险识别”仅在对抗性(Adversarial)视频上评估。

  2. 约束敏感任务完成
    在语义歧义(如泛指和代词)上表现较好,但在轨迹约束和目标物体遮挡上表现下降,表明空间-物理推理仍比上下文语言完成更难。

  3. 反事实高任务完成案例
    即使反事实视频看起来完成了任务,其在真实感和实体一致性上的得分仍较低,表明表面成功常来自幻觉或场景修改。

  4. 安全风险识别(对抗性场景)
    示例结果(以环境损害为例):

    • Kling-v2.6:低风险 90%、中 0%、高 10%,均值 1.3
    • Veo-3.1-Fast:低 50%、中 20%、高 30%,均值 2.3
      结论:当前模型不能可靠地抑制不安全生成,可信的视频世界模型需要评估其“能做什么”和“在指令有害时是否避免行动”。
搜集汇总
数据集介绍
RoboTrustBench 数据集图片
构建方式
RoboTrustBench基于真实世界的DROID机器人操作数据集构建,从中提取初始操作图像与语言指令作为基础样本。为了覆盖可信性评估的四个关键场景——标准、约束敏感、反事实与对抗性,研究团队通过指令重写、图像编辑及专家验证等方式,系统性地生成并筛选出1,207个经专家确认的指令-图像对。其中,77幅图像通过Nano Banana 2工具进行编辑以引入同色干扰物等视觉变体。每一样本均经过三位独立标注者的场景类型与语义一致性校验,最终构建出涵盖10种物理场景、321种物体类型及102种任务动词的多样化基准数据集。
使用方法
使用时,用户将每个指令-图像对输入待评估的视频世界模型,生成对应的机器人操作视频。评估流程采用人类评价作为主要参考,并辅以基于多模态大语言模型的自动评估以扩展至全数据集。具体而言,评估者需对每段生成视频在13个标准上进行1-5分的打分,这些标准涵盖从视觉质量、实体对齐到交互合理性、任务完成度及安全性等维度。对于反事实与对抗性场景,高任务完成度反而可能指示幻觉或不安全行为,因此评估需结合场景类型对结果进行辩证解读。
背景与挑战
背景概述
RoboTrustBench 是由新加坡管理大学、复旦大学与普林斯顿大学的研究人员于2026年联合构建的一项基准测试,旨在评估视频世界模型在机器人操作任务中的可信赖性。随着视频生成模型在具身智能、自主驾驶和机器人操作等领域的广泛应用,其生成内容不再仅关乎视觉质量,更直接影响下游策略学习、策略评估与数据构建。然而,现有基准大多假设输入指令有效、可行且安全,忽视了真实部署中指令可能存在的歧义、冲突或危害性。为此,RoboTrustBench 基于真实机器人操作数据集 DROID,构建了包含1207个经专家验证的指令-图像对的测试集,覆盖正常、约束敏感、反事实与对抗四种场景,并通过六维13细粒度评价协议,系统揭示当前模型在物理交互、反事实推理与安全抑制等方面的信任缺口,对推动可信赖机器人视频世界建模研究具有重要影响力。
当前挑战
RoboTrustBench 所应对的核心挑战在于:当前视频世界模型虽然在视觉连贯性与表层指令遵循方面表现突出,但在约束推理、反事实归因、物理交互及不安全指令抑制等关键信任维度上仍显著不足。具体而言,模型在约束敏感场景中难以处理歧义解析、遮挡推理与轨迹规划等精细操作;在反事实条件下倾向于通过幻象缺失物体、篡改物体属性或生成不合理的场景变更来“完成”任务;在对抗场景下,强指令遵循能力反而可能转化为安全风险,直接生成有害机器人行为。此外,数据构建过程中亦面临挑战:如何从大规模真实操作数据中系统采样并设计涵盖四类场景的指令-图像对,确保语义正确性与场景多样性,并经过多轮专家验证以剔除标注歧义与视觉伪影,均需耗费大量人工审核精力。
常用场景
经典使用场景
在机器人操作领域,视频世界模型作为预测模拟器被广泛探索,其核心功能在于根据初始观测图像与语言指令生成未来操作过程视频。RoboTrustBench 为这些模型提供了一个标准化的诊断平台,尤其适用于评估模型在常规可执行任务、受约束操作、反事实条件以及对抗性不安全指令等四种典型场景下的视频生成质量。研究者可以借助该基准系统地衡量模型在场景实体对齐、时空一致性、交互合理性、任务执行质量、视觉品质与安全风险识别等六个维度的表现,从而全面揭示视频世界模型在真实操作环境中的可信赖程度。
解决学术问题
现有视频生成基准大多假设输入指令有效、可行且安全,难以应对现实操作中指令模糊、与场景矛盾、物理不可行或包含安全隐患的复杂挑战。RoboTrustBench 系统性地填补了这一评估空白,通过引入约束敏感、反事实与对抗性场景,揭示出现有模型在语义消歧、空间推理、反事实抗拒及不安全行为抑制方面的根本性短板。该基准强调了视觉连贯性与表层指令跟随不足以支撑可靠世界建模,推动学术界将可靠性评估从视觉指标拓展至物理保真度、世界状态一致性及安全警觉性等核心维度,为构建真正可信的机器人视频世界模型奠定了方法论基础。
实际应用
在机器人操作系统的实际部署中,视频世界模型被用于策略学习、策略评估与合成数据构建等关键环节。RoboTrustBench 提供了一套精细化的评估协议,能够帮助开发者识别模型在物理接触建模、遮挡推理、轨迹约束处理以及危险操作回避等方面的系统性失败模式。例如,当模型在对抗性场景下盲目执行“击碎盘子”等伤害性指令时,该基准能够量化其安全风险等级,促使产研团队在模型上线前进行针对性修正。此外,该基准为机器人数据生成管道提供了可信度检验工具,确保合成视频不会因幻觉内容误导下游决策,从而支撑更安全、更鲁棒的工业操作自动化部署。
数据集最近研究
最新研究方向
当前视频世界模型在机器人操作领域的前沿研究方向正从单纯的视觉质量评估向可信赖性、物理合理性与安全性纵深拓展。RoboTrustBench的提出标志着该领域的研究焦点已转向在约束感知、反事实接地与对抗性指令等复杂场景下评估模型的鲁棒性。最新研究发现,现有模型虽能生成视觉连贯的视频,却在物体交互的物理合理性、不可行指令的感知抑制及有害行为的回避等关键维度暴露出显著短板。这一工作呼应了近年来学术界对具身智能安全性的广泛关切,推动构建超越表层指令遵循的可信机器人世界模型成为未来研究的核心命题。
相关研究论文
  • 1
    RoboTrustBench: Benchmarking the Trustworthiness of Video World Models for Robotic Manipulation新加坡管理大学; 复旦大学; 普林斯顿大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务