EmbodimentSemantic
收藏资源简介:
EmbodimentSemantic是一个空间场景图数据集和基准,旨在评估视觉语言模型在具身操作轨迹中恢复精确对象-关系-对象三元组的能力,并测试将这些三元组注入现有VLA策略是否能改善下游控制。数据集包含两个部分:LIBERO基准(500个模拟器演示,涉及10个LIBERO-Spatial任务,具有自动生成的场景图)和SO101真实机器人数据集(257个远程操作片段,涉及5个桌面碗放置任务)。
EmbodimentSemantic is a spatial scene graph dataset and benchmark aimed at evaluating the ability of vision-language models (VLMs) to recover precise object-relation-object triples from embodied manipulation trajectories, and testing whether injecting these triples into existing vision-language actor (VLA) policies can improve downstream control. The dataset consists of two components: the LIBERO benchmark (500 simulator demonstrations covering 10 LIBERO-Spatial tasks with automatically generated scene graphs) and the SO101 real-world robotic dataset (257 teleoperation segments involving 5 tabletop bowl placement tasks).
EmbodimentSemantic: 具身操作轨迹的空间场景图数据集与基准
数据集概述
EmbodimentSemantic 是一个用于评估视觉-语言-动作(VLA)系统空间接地能力的统一框架,包含两个核心组件:
- LIBERO 基准:500 个仿真演示,涵盖 10 个 LIBERO-Spatial 任务,包含 62,250 个时间步(124,500 张 RGB 帧)。场景图通过 MuJoCo 几何、世界坐标和相机投影自动生成,提供精确的三元组级监督。
- SO101 真实机器人数据集:257 个遥操作回合,涵盖 5 个桌上碗放置任务,使用低成本 SO101 机械臂采集,包含外部相机、腕部相机和深度流,格式为 LeRobot。
数据集统计
LIBERO 仿真基准
| 属性 | 数值 |
|---|---|
| 任务数 | 10 |
| 演示数 | 500(每任务 50 个) |
| 每相机记录帧数 | 62,250 |
| 总记录帧数(双相机) | 124,500 |
| 每演示帧数范围 | 75–197(均值 124.5) |
| 相机 | 2(agentview、eye_in_hand) |
| RGB 分辨率 | 128 × 128 |
| 规范物体 | 7 个 |
| 有向关系 | 8 种 |
| 每帧平均三元组数(agentview) | 42.0 |
| 每帧平均三元组数(eye_in_hand) | 16.73 |
SO101 真实机器人数据集
| 属性 | 数值 |
|---|---|
| 任务数 | 5 |
| 演示数 | 257(每任务 47–53 个) |
| 总记录帧数(双相机) | 240,598 |
| 每相机记录帧数 | 120,299 |
| VLM 评估使用帧数(双相机) | 8,252 |
| VLM 评估每相机帧数 | 4,126 |
| 相机 | 2(agent_view、wrist) |
| 帧率 | 30 FPS(采样间隔 30,即 1 帧/秒) |
| 规范物体 | 5 个 |
| 格式 | LeRobot |
LIBERO-Spatial 任务列表
| 任务 ID | akita_black_bowl_1 的初始空间上下文 |
|---|---|
| T0 | 盘子和烤碗之间 |
| T1 | 桌子中央 |
| T2 | 木柜顶部抽屉内 |
| T3 | 饼干盒旁边 |
| T4 | 盘子旁边 |
| T5 | 烤碗旁边 |
| T6 | 饼干盒上 |
| T7 | 烤碗上 |
| T8 | 灶台上 |
| T9 | 木柜上 |
物体与关系本体
物体:akita_black_bowl_1(操作碗)、akita_black_bowl_2(干扰碗)、cookies_1(饼干盒)、glazed_rim_porcelain_ramekin_1(烤碗参考物体)、plate_1(目标放置物体)、wooden_cabinet_1(柜子/抽屉)、flat_stove_1(灶台参考面)
有向关系:
is_left_of/is_right_of(横向世界坐标排序)is_in_front_of/is_behind(深度世界坐标排序)is_on_top_of/is_below_of(垂直支撑/堆叠)is_inside/contains(包含关系)
VLM 基准
评估视觉-语言模型是否能从机器人相机观测中恢复有向空间场景图。模型被提供 RGB 帧、任务描述、物体词汇表和固定关系集,预测结果在精确三元组级别与仿真器生成的真实值进行评分。
报告指标
| 指标 | 描述 |
|---|---|
| 每任务平均 F1 | 主要评分——每个任务权重相等 |
| 宏观 F1 | 每帧 F1 的均值 |
| 微观 F1 | 所有帧的合并 TP/FP/FN |
| 每关系 F1 | 每种关系类型的精确率/召回率/F1 |
| 覆盖率 | 预测中出现真实关系类型的比例 |
| 幻觉率 | FP / (TP + FP) |
| 方向一致性 | 逆向对两者都预测正确的比例 |
| 每物体召回率 | 每个物体在所有帧中的召回率 |
VLM 基准结果
| 模型 | agentview mF1 | eye_in_hand mF1 |
|---|---|---|
| gemini-3.1-pro | 0.5674 | 0.3773 |
| InternVL3-78B | 0.3519 | 0.2101 |
| Qwen3-VL-8B-Instruct | 0.2837 | 0.2108 |
| InternVL3_5-14B | 0.2561 | 0.1265 |
| gemma-4-E4B-it | 0.2209 | 0.1472 |
| Molmo2-8B | 0.1888 | 0.1459 |
| InternVL3_5-8B | 0.1769 | 0.1465 |
| nemotron-nano-12b-v2-vl | 0.1599 | 0.1270 |
| Qwen2.5-VL-7B-Instruct | 0.1405 | 0.1147 |
| MomaGraph-R1 | 0.1023 | 0.0926 |
关键发现:模型能达到较高的关系类型覆盖率(最高 0.98),但精确三元组 F1 较低,表明当前 VLM 常能生成看似合理的空间谓词,却未能将其绑定到正确的有序物体对。深度、支撑和包含关系系统性比横向关系更难。
VLA 基准
评估将实时空间场景图注入现有微调策略是否能改善下游机器人控制——无需重新训练或修改架构。测试两种策略:Pi0 和 Pi05,均在 LIBERO-Spatial 上微调。
场景扰动类型
- 物体移除:在环境加载前移除干扰物体
- 提示覆盖:替换任务描述字符串,但保持相同 BDDL 目标条件
- 相机覆盖:切换到分布外视角
- 位姿交换与移动:每回合重置前重新排列物体位置
VLA 结果
场景图注入在不重新训练的情况下改善了几项 Pi05 任务表现:
| 任务 | Pi05 标准 | Pi05 + 场景图 | 变化 |
|---|---|---|---|
| T0 | 100.0% | 100.0% | +0.0 |
| T4 | 46.0% | 76.0% | +30.0 |
| T7 | 8.0% | 16.0% | +8.0 |
| T2 | 0.0% | 0.0% | +0.0 |
| T8 | 44.0% | 24.0% | −20.0 |
最大提升为 T4 的 +30 百分点;T8 下降 20 百分点,表明关系上下文在与策略学习的提示表征冲突时可能产生干扰。
离线场景图生成
LIBERO_Semantic_Generation.ipynb 记录了从 LIBERO HDF5 文件生成帧级场景图的完整流程,包括:
- 提取 MuJoCo 物体几何信息并通过针孔模型投影到相机视图
- 检查 2D 边界框重叠以分配垂直和包含关系
- 回退到主导轴世界坐标排序以分配横向和深度关系
- 将标注写回 HDF5 文件
实时版本(libero_live_semantic_context.py)在策略评估时执行相同逻辑。




