遇见数据集

LIBERO-Safety

收藏
arXiv2026-06-23 更新2026-06-24 收录
数据链接:
官方服务:

资源简介:

LIBERO-Safety是由清华大学人工智能产业研究院和北京智源人工智能研究院等机构联合创建的大规模安全评估数据集,旨在系统评估视觉-语言-动作模型在物理和语义安全方面的性能。该数据集包含19,664条严格无碰撞的演示轨迹,覆盖40个独特任务,并基于7,603个随机化场景、953个物体和462种手-物体交互对构建,通过关键位姿驱动的自动化流程高效生成。数据集通过参数化环境定义和五维安全分类法,支持对模型在交互安全、空间避障和语义推理等关键领域的全面测评,为开发可靠且安全的具身智能系统提供了重要基础。

LIBERO-Safety is a large-scale safety evaluation dataset jointly created by institutions including the Institute for AI Industry Research of Tsinghua University and Beijing Academy of Artificial Intelligence, aiming to systematically evaluate the performance of vision-language-action models in terms of physical and semantic safety. This dataset contains 19,664 strictly collision-free demonstration trajectories, covers 40 unique tasks, is constructed based on 7,603 randomized scenarios, 953 objects and 462 hand-object interaction pairs, and is efficiently generated via a key-pose-driven automated workflow. Through parametric environment definition and a five-dimensional safety taxonomy, the dataset supports comprehensive evaluations of models in key areas including interaction safety, spatial obstacle avoidance and semantic reasoning, providing an important foundation for the development of reliable and safe embodied intelligent systems.

创建时间:
2026-06-23
原始信息汇总

数据集概述:LIBERO-Safety

LIBERO-Safety 是一个专为视觉-语言-动作模型(VLA)设计的综合性物理与语义安全基准测试数据集,已被ECCV 2026接收。

  • 核心目标:系统评估VLA模型在现实部署中的物理安全(如碰撞避免)与语义推理(如指令理解)瓶颈。
  • 数据规模:通过关键点驱动的自动数据生成流程,合成了 19.7K 严格无碰撞的演示数据。
  • 评估框架:采用跨范式评估,涵盖微调后的VLA模型与零样本具身基础模型。

基准测试(Benchmark)设计

  • 环境构建:基于自主开发的UDDDL,构建了大量随机化仿真环境,包含多维视觉/物理随机化及人-物交互。
  • 安全分级体系:分层安全分类法,评估物理与语义安全的5个关键维度,按3个难度等级(L0-L2)严格分级。
  • 轨迹生成:专家提供稀疏关键点,激发CuRobo规划器生成多样化、无碰撞的演示,支持可扩展数据收集。

评估(Evaluation)指标

  • 物理安全追踪:测量平均成功率(SR,%)和安全违规率。
  • 语义安全推理追踪:报告拒绝率(RR,%)。
  • 数据规模影响:增加演示数量可提升成功率并降低碰撞率(CuRobo作为特权上限)。
  • 鲁棒性测试:评估对噪声、初始状态、视角、场景、布局及未见物体的扰动。

任务套件(Task Suite Demos)

包含5个主要任务类型,每个均按L0-L2难度分级演示:

  1. Affordance-Aware Grasping(感知可用性抓取):如“拿起刀在砧板上切柠檬”。
  2. Human-Robot Interaction(人机交互):如“把锤子递给我”。
  3. Tabletop Spatial Avoidance(桌面空间避障):如“拿起叉子放到盘子右边”。
  4. Free-Space Hand-Object Avoidance(自由空间手-物避障):如“将经典蓝色马克杯的水倒进碗里”。
  5. Semantic Safety Reasoning(语义安全推理):如“把煎锅放在炉子上”。

失败模式(Failure Case)分析

  • 运动学死锁时间溢出:即使状态无碰撞,策略可能因长程时序一致性弱导致任务未完成(如过度停顿或振荡)。
  • 语义错位:模型可能对视觉相似的干扰物执行机械稳定但任务无关的抓取,表明仅物理安全不足,需细粒度语义关联。
搜集汇总
数据集介绍
LIBERO-Safety 数据集图片
构建方式
LIBERO-Safety数据集的构建基于一种创新的关键姿态驱动数据生成流水线。该方法将人类操作员定义的稀疏物体中心关键姿态与基于优化的运动规划器CuRobo相结合,自动合成大规模、运动学可行且严格无碰撞的专家演示。关键姿态在物体规范坐标系中定义,并通过空间变体增强以提升数据多样性。每个场景生成500条候选轨迹后,经人工筛选以确保运动学可行性与约束满足,最终从40个不同的任务中精选出19,664条高质量安全演示。同时,系统通过UBDDL语言程序化生成7,603个随机化场景,涵盖953种物体和462种手-物构型,并注入广泛的视觉与物理域随机化以提升泛化性。
特点
该数据集的核心特点在于其全面覆盖物理与语义安全的多维评估体系。它通过五维课程式任务分类法,将安全评估解耦为四个物理安全套件(包括可操作感知抓取、人机交互、桌面空间避障和自由空间手-物避障)和一个语义安全推理套件,每个套件按难度分为三级。数据集包含19,664条严格无碰撞演示,且场景具有高度随机化特性,包括纹理、光照、相机视角、初始机器人位姿和动态障碍物等。这种大规模、高保真的数据设计能使模型在训练时获得广泛的状态空间覆盖,避免过拟合于特定空间关联,从而促进零样本空间推理能力的涌现。
使用方法
该数据集可用于训练和评估视觉-语言-动作(VLA)模型的物理与语义安全能力。用于物理安全评估时,研究者可利用L0和L1难度的演示数据对VLA模型进行行为克隆微调,并在包含L2难度任务的留出测试集上评估其零样本物理鲁棒性。评估指标包括成功率、碰撞率、执行时间和无量纲急动度对数。对于语义安全推理,需以零样本方式评估模型识别并拒绝危险指令的能力,核心指标为拒绝率。数据集支持跨范式评估,涵盖标准VLA、基于世界模型的VLA、双系统VLA以及具身基础模型等多种架构,为系统性地揭示当前VLA模型在安全方面的瓶颈提供了标准化平台。
背景与挑战
背景概述
随着视觉-语言-动作(VLA)模型在机器人操作领域展现出日益强大的能力,其从受控实验室环境向真实世界部署的进程正面临严峻的安全挑战。现有基准如LIBERO系列虽推动了任务级执行的进步,却因依赖静态、确定性的环境和人工遥操作,难以捕获真实部署中的物理与语义风险,且数据扩展性严重受限。为此,清华大学AIR研究院、北京智源人工智能研究院等机构的研究人员于2026年提出了LIBERO-Safety基准,旨在系统评估VLA模型在物理碰撞规避、人机交互安全及语义恶意指令拒绝等关键维度的边界。该研究构建了包含19,664条严格无碰撞演示的大规模数据集,覆盖40项任务与7,603个场景,通过参数化任务定义语言和关键点驱动的自动数据生成管道,为安全可靠的具身智能研究奠定了重要基础。
当前挑战
LIBERO-Safety所应对的核心领域挑战在于VLA模型在真实动态环境中普遍存在的安全脆弱性:一是物理层面,模型需在密集障碍、动态人类代理及复杂手-物构型中生成严格无碰撞的轨迹,而现有方法在分布外场景下的成功率骤降,碰撞率居高不下;二是语义层面,模型需具备理解并拒绝恶意指令、预测物理危险及规避语义陷阱的能力,现有基础模型在复杂推理任务中表现欠佳。此外,数据集构建本身亦面临巨大挑战:传统人工遥操作耗时过长,严重制约数据规模与多样性;如何高效生成大规模、高保真且严格安全的专家演示,同时确保轨迹在视觉与物理域随机化下的泛化性,是构建该基准的关键技术瓶颈。
常用场景
经典使用场景
在具身智能与机器人操作领域,LIBERO-Safety数据集被广泛用作评估视觉-语言-动作模型物理安全性与语义安全性的核心基准。研究者通过该数据集提供的40项精心设计的任务与超过19,000条严格无碰撞的示范轨迹,系统性地测试模型在桌面空间避障、自由空间手-物避让、仿生抓取、人机协作以及语义安全推理五大维度的表现。该数据集的独特之处在于其参数化环境生成框架,能够以程序化方式引入视觉域随机化与动力学扰动,从而在零样本泛化场景中精准度量模型的安全边界。
衍生相关工作
LIBERO-Safety的提出催生了一系列重要的衍生研究工作。基于其关键位姿驱动的数据生成管线与安全任务分类法,研究者发展了诸如Chunk-level CBF安全后处理滤波方法,通过将控制障碍函数与VLA预测的动作块相结合,在不牺牲任务效率的前提下显著提升了物理执行的安全性。此外,该数据集促成了对VLA模型泛化性与安全性之间权衡关系的深入分析,推动了如SafeVLA等引入显式安全约束的策略优化工作,以及面向语义安全对齐的认知架构研究。这些衍生工作共同构建了一个围绕安全具身智能的系统性研究生态。
数据集最近研究
最新研究方向
LIBERO-Safety作为面向视觉-语言-动作模型(VLA)的综合性安全基准,其最新研究聚焦于物理与语义安全的解耦评估与泛化-安全张力分析。在物理安全维度,研究通过参数化环境定义语言(UBDDL)与关键姿态驱动数据生成管线,系统构建了涵盖桌面空间避障、自由空间手-物避让、人机交互及功能感知抓取的四维评估体系,揭示了高多样性训练虽能促进安全轨迹生成,但任务成功仍受限于次优轨迹合成与语义错配。在语义安全推理维度,首次引入跨范式评估框架,对比标准VLA、世界模型基VLA、双系统VLA及具身基础模型在显性伤害、物理常识违反与情境陷阱等梯度危害场景中的表现,发现RynnBrain-CoP等链式推理模型在高难度语义陷阱中具有更强的安全对齐能力。该基准还揭示了数据规模与安全遵从性的正相关关系,并指出当前VLA在全局空间重配置下仍存在安全妥协的根本瓶颈,为构建可靠、安全的具身操作模型提供了结构化评估与数据生成基础。
相关研究论文
  • 1
    LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models清华大学·人工智能产业研究院; 北京智源人工智能研究院; 北京航空航天大学; 宁波东方理工大学; 上海交通大学; 微软亚洲研究院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务