LIBERO-Safety
收藏资源简介:
LIBERO-Safety是由清华大学人工智能产业研究院和北京智源人工智能研究院等机构联合创建的大规模安全评估数据集,旨在系统评估视觉-语言-动作模型在物理和语义安全方面的性能。该数据集包含19,664条严格无碰撞的演示轨迹,覆盖40个独特任务,并基于7,603个随机化场景、953个物体和462种手-物体交互对构建,通过关键位姿驱动的自动化流程高效生成。数据集通过参数化环境定义和五维安全分类法,支持对模型在交互安全、空间避障和语义推理等关键领域的全面测评,为开发可靠且安全的具身智能系统提供了重要基础。
LIBERO-Safety is a large-scale safety evaluation dataset jointly created by institutions including the Institute for AI Industry Research of Tsinghua University and Beijing Academy of Artificial Intelligence, aiming to systematically evaluate the performance of vision-language-action models in terms of physical and semantic safety. This dataset contains 19,664 strictly collision-free demonstration trajectories, covers 40 unique tasks, is constructed based on 7,603 randomized scenarios, 953 objects and 462 hand-object interaction pairs, and is efficiently generated via a key-pose-driven automated workflow. Through parametric environment definition and a five-dimensional safety taxonomy, the dataset supports comprehensive evaluations of models in key areas including interaction safety, spatial obstacle avoidance and semantic reasoning, providing an important foundation for the development of reliable and safe embodied intelligent systems.
数据集概述:LIBERO-Safety
LIBERO-Safety 是一个专为视觉-语言-动作模型(VLA)设计的综合性物理与语义安全基准测试数据集,已被ECCV 2026接收。
- 核心目标:系统评估VLA模型在现实部署中的物理安全(如碰撞避免)与语义推理(如指令理解)瓶颈。
- 数据规模:通过关键点驱动的自动数据生成流程,合成了 19.7K 严格无碰撞的演示数据。
- 评估框架:采用跨范式评估,涵盖微调后的VLA模型与零样本具身基础模型。
基准测试(Benchmark)设计
- 环境构建:基于自主开发的UDDDL,构建了大量随机化仿真环境,包含多维视觉/物理随机化及人-物交互。
- 安全分级体系:分层安全分类法,评估物理与语义安全的5个关键维度,按3个难度等级(L0-L2)严格分级。
- 轨迹生成:专家提供稀疏关键点,激发CuRobo规划器生成多样化、无碰撞的演示,支持可扩展数据收集。
评估(Evaluation)指标
- 物理安全追踪:测量平均成功率(SR,%)和安全违规率。
- 语义安全推理追踪:报告拒绝率(RR,%)。
- 数据规模影响:增加演示数量可提升成功率并降低碰撞率(CuRobo作为特权上限)。
- 鲁棒性测试:评估对噪声、初始状态、视角、场景、布局及未见物体的扰动。
任务套件(Task Suite Demos)
包含5个主要任务类型,每个均按L0-L2难度分级演示:
- Affordance-Aware Grasping(感知可用性抓取):如“拿起刀在砧板上切柠檬”。
- Human-Robot Interaction(人机交互):如“把锤子递给我”。
- Tabletop Spatial Avoidance(桌面空间避障):如“拿起叉子放到盘子右边”。
- Free-Space Hand-Object Avoidance(自由空间手-物避障):如“将经典蓝色马克杯的水倒进碗里”。
- Semantic Safety Reasoning(语义安全推理):如“把煎锅放在炉子上”。
失败模式(Failure Case)分析
- 运动学死锁与时间溢出:即使状态无碰撞,策略可能因长程时序一致性弱导致任务未完成(如过度停顿或振荡)。
- 语义错位:模型可能对视觉相似的干扰物执行机械稳定但任务无关的抓取,表明仅物理安全不足,需细粒度语义关联。

- 1LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models清华大学·人工智能产业研究院; 北京智源人工智能研究院; 北京航空航天大学; 宁波东方理工大学; 上海交通大学; 微软亚洲研究院 · 2026年



