遇见数据集

EmbodimentSemantic

收藏
github2026-06-07 更新2026-06-18 收录
官方服务:

资源简介:

EmbodimentSemantic是一个空间场景图数据集和基准,旨在评估视觉语言模型在具身操作轨迹中恢复精确对象-关系-对象三元组的能力,并测试将这些三元组注入现有VLA策略是否能改善下游控制。数据集包含两个部分:LIBERO基准(500个模拟器演示,涉及10个LIBERO-Spatial任务,具有自动生成的场景图)和SO101真实机器人数据集(257个远程操作片段,涉及5个桌面碗放置任务)。

EmbodimentSemantic is a spatial scene graph dataset and benchmark aimed at evaluating the ability of vision-language models (VLMs) to recover precise object-relation-object triples from embodied manipulation trajectories, and testing whether injecting these triples into existing vision-language actor (VLA) policies can improve downstream control. The dataset consists of two components: the LIBERO benchmark (500 simulator demonstrations covering 10 LIBERO-Spatial tasks with automatically generated scene graphs) and the SO101 real-world robotic dataset (257 teleoperation segments involving 5 tabletop bowl placement tasks).

创建时间:
2026-06-03
原始信息汇总

EmbodimentSemantic: 具身操作轨迹的空间场景图数据集与基准

数据集概述

EmbodimentSemantic 是一个用于评估视觉-语言-动作(VLA)系统空间接地能力的统一框架,包含两个核心组件:

  • LIBERO 基准:500 个仿真演示,涵盖 10 个 LIBERO-Spatial 任务,包含 62,250 个时间步(124,500 张 RGB 帧)。场景图通过 MuJoCo 几何、世界坐标和相机投影自动生成,提供精确的三元组级监督。
  • SO101 真实机器人数据集:257 个遥操作回合,涵盖 5 个桌上碗放置任务,使用低成本 SO101 机械臂采集,包含外部相机、腕部相机和深度流,格式为 LeRobot。

数据集统计

LIBERO 仿真基准

属性 数值
任务数 10
演示数 500(每任务 50 个)
每相机记录帧数 62,250
总记录帧数(双相机) 124,500
每演示帧数范围 75–197(均值 124.5)
相机 2(agentvieweye_in_hand
RGB 分辨率 128 × 128
规范物体 7 个
有向关系 8 种
每帧平均三元组数(agentview) 42.0
每帧平均三元组数(eye_in_hand) 16.73

SO101 真实机器人数据集

属性 数值
任务数 5
演示数 257(每任务 47–53 个)
总记录帧数(双相机) 240,598
每相机记录帧数 120,299
VLM 评估使用帧数(双相机) 8,252
VLM 评估每相机帧数 4,126
相机 2(agent_viewwrist
帧率 30 FPS(采样间隔 30,即 1 帧/秒)
规范物体 5 个
格式 LeRobot

LIBERO-Spatial 任务列表

任务 ID akita_black_bowl_1 的初始空间上下文
T0 盘子和烤碗之间
T1 桌子中央
T2 木柜顶部抽屉内
T3 饼干盒旁边
T4 盘子旁边
T5 烤碗旁边
T6 饼干盒上
T7 烤碗上
T8 灶台上
T9 木柜上

物体与关系本体

物体akita_black_bowl_1(操作碗)、akita_black_bowl_2(干扰碗)、cookies_1(饼干盒)、glazed_rim_porcelain_ramekin_1(烤碗参考物体)、plate_1(目标放置物体)、wooden_cabinet_1(柜子/抽屉)、flat_stove_1(灶台参考面)

有向关系

  • is_left_of / is_right_of(横向世界坐标排序)
  • is_in_front_of / is_behind(深度世界坐标排序)
  • is_on_top_of / is_below_of(垂直支撑/堆叠)
  • is_inside / contains(包含关系)

VLM 基准

评估视觉-语言模型是否能从机器人相机观测中恢复有向空间场景图。模型被提供 RGB 帧、任务描述、物体词汇表和固定关系集,预测结果在精确三元组级别与仿真器生成的真实值进行评分。

报告指标

指标 描述
每任务平均 F1 主要评分——每个任务权重相等
宏观 F1 每帧 F1 的均值
微观 F1 所有帧的合并 TP/FP/FN
每关系 F1 每种关系类型的精确率/召回率/F1
覆盖率 预测中出现真实关系类型的比例
幻觉率 FP / (TP + FP)
方向一致性 逆向对两者都预测正确的比例
每物体召回率 每个物体在所有帧中的召回率

VLM 基准结果

模型 agentview mF1 eye_in_hand mF1
gemini-3.1-pro 0.5674 0.3773
InternVL3-78B 0.3519 0.2101
Qwen3-VL-8B-Instruct 0.2837 0.2108
InternVL3_5-14B 0.2561 0.1265
gemma-4-E4B-it 0.2209 0.1472
Molmo2-8B 0.1888 0.1459
InternVL3_5-8B 0.1769 0.1465
nemotron-nano-12b-v2-vl 0.1599 0.1270
Qwen2.5-VL-7B-Instruct 0.1405 0.1147
MomaGraph-R1 0.1023 0.0926

关键发现:模型能达到较高的关系类型覆盖率(最高 0.98),但精确三元组 F1 较低,表明当前 VLM 常能生成看似合理的空间谓词,却未能将其绑定到正确的有序物体对。深度、支撑和包含关系系统性比横向关系更难。

VLA 基准

评估将实时空间场景图注入现有微调策略是否能改善下游机器人控制——无需重新训练或修改架构。测试两种策略:Pi0Pi05,均在 LIBERO-Spatial 上微调。

场景扰动类型

  1. 物体移除:在环境加载前移除干扰物体
  2. 提示覆盖:替换任务描述字符串,但保持相同 BDDL 目标条件
  3. 相机覆盖:切换到分布外视角
  4. 位姿交换与移动:每回合重置前重新排列物体位置

VLA 结果

场景图注入在不重新训练的情况下改善了几项 Pi05 任务表现:

任务 Pi05 标准 Pi05 + 场景图 变化
T0 100.0% 100.0% +0.0
T4 46.0% 76.0% +30.0
T7 8.0% 16.0% +8.0
T2 0.0% 0.0% +0.0
T8 44.0% 24.0% −20.0

最大提升为 T4 的 +30 百分点;T8 下降 20 百分点,表明关系上下文在与策略学习的提示表征冲突时可能产生干扰。

离线场景图生成

LIBERO_Semantic_Generation.ipynb 记录了从 LIBERO HDF5 文件生成帧级场景图的完整流程,包括:

  1. 提取 MuJoCo 物体几何信息并通过针孔模型投影到相机视图
  2. 检查 2D 边界框重叠以分配垂直和包含关系
  3. 回退到主导轴世界坐标排序以分配横向和深度关系
  4. 将标注写回 HDF5 文件

实时版本(libero_live_semantic_context.py)在策略评估时执行相同逻辑。

搜集汇总
数据集介绍
EmbodimentSemantic 数据集图片
构建方式
EmbodimentSemantic数据集旨在系统性地诊断视觉-语言-动作系统在空间场景理解上的局限性。其构建方式独具匠心,融合了模拟与真实两大数据来源。对于LIBERO模拟器基准,依托于500个机器人演示任务,通过MuJoCo物理引擎自动解析物体几何属性、世界坐标系及相机投影,为每一帧精确生成包含物体-关系-物体三元组的场景图,无需人工标注。而对于SO101真实机器人数据集,则通过遥操作采集257个桌面碗放置任务,同步记录外部与腕部相机的RGB-D图像流,构建了包含240,598帧的丰富数据资源。
特点
该数据集的核心特色在于其多层次、精细化的空间关系标注体系。数据集定义了11类规范物体与8种有向空间关系,囊括了水平、深度、垂直及包含关系等全方位空间语义,为评估模型的空间感知能力提供了严谨的基准。尤为突出的是,针对LIBERO模拟器数据,每帧平均包含42个(agentview视角)与16.73个(手部视角)三元组,数据密度极高。此外,数据集首次将场景图注入与下游VLA策略结合,通过对比实验揭示当前VLMs在精确三元组绑定上的显著短板,即关系类型覆盖率虽高,但精确匹配的F1分数仍然较低。
使用方法
使用EmbodimentSemantic进行VLM评测时,研究人员将RGB图像、任务描述、物体词典与固定关系集合输入模型,预测结果在与模拟器导出的真实场景图进行精确三元组级别比对。评估支持vLLM、HuggingFace Transformers及Gemini、OpenAI等多种API后端。VLA评测则通过环境变量控制,支持标准提示与场景图增强提示两种模式,并设计了物体移除、提示覆盖、相机视角切换与位置扰动四类场景扰动,以全面测试策略的鲁棒性,无需任何重新训练即可评估注入场景图带来的性能增益。
背景与挑战
背景概述
EmbodimentSemantic数据集由Politecnico di Torino、华为诺亚方舟实验室及伦敦大学学院的研究人员于2025年联合创建,旨在系统性地诊断视觉-语言-动作(VLA)模型在空间感知领域的根本性缺陷。该数据集的核心理念在于构建一个统一的评估框架,通过从机器人操作轨迹中提取精确的物体-关系-物体三元组,检验视觉语言模型的空间理解能力,并探索将结构化场景图注入现有VLA策略对下游控制任务的增益。数据集包含LIBERO仿真基准与SO101真实机器人两大组件,前者基于500条示范数据自动生成62,250个时序步的精确场景图,后者则包含257条遥操作轨迹并提供多视角视觉流。该工作为空间关系推理在具身智能中的规范化评估树立了新标杆。
当前挑战
EmbodimentSemantic所解决的领域挑战在于VLA系统对空间关系的精确绑定能力不足——当前最先进的视觉语言模型在场景图恢复任务中仅能实现0.5674的平均F1分数,充分暴露了模型在生成精确有序实体对上的系统性缺陷,尤其在支撑、包含等深度关系上表现远弱于横向关系。构建过程中面临的核心挑战包括:从MuJoCo仿真引擎中自动解析精确的物体几何属性并映射至二维相机平面,同时处理物体间复杂的遮挡与叠放关系;设计一套无需人工标注即可生成场景图的自动化管线,将八组有向关系通过边界框重叠度分析与世界坐标主次轴排序予以编码;确保在真实机器人数据采集中,多视角视觉流的时间同步与空间标定精度能够满足三元组级别的评估要求。
常用场景
经典使用场景
EmbodimentSemantic数据集最经典的使用场景在于系统性地评估视觉-语言模型对具身操控轨迹中空间场景图的理解能力。该数据集通过构建LIBERO仿真环境中的500条演示轨迹与SO101真实机器人平台上的257段遥操作数据,提供了62,250个带精确三元组标注的时间步,使得研究者能够量化分析模型在物体-关系-物体三元组恢复任务上的表现。其双层评估框架既支持离线VLM基准测试,也支持在线VLA策略注入实验,为空间关系理解与机器人操控的交叉研究提供了标准化测试平台。
衍生相关工作
围绕EmbodimentSemantic已衍生出一系列具有影响力的研究工作。其提出的场景扰动评估范式催生了对策略鲁棒性的系统性研究,包括物体移除、提示覆盖、视角切换和位姿交换等四种干扰条件的标准化测试。数据集配套的在线场景图生成管线被后继工作广泛采用,用于改进实时空间感知模块。此外,三元组级评估指标的提出为后续的空间图神经网络、关系推理模块和语义感知策略设计提供了统一的评估基准,推动了一批将显式空间知识融入端到端学习框架的创新性工作。
数据集最近研究
最新研究方向
当前具身智能领域的研究前沿正聚焦于视觉-语言-动作(VLA)模型的空间语义理解与底层操控能力的解耦诊断。EmbodimentSemantic数据集的问世,为这一关键瓶颈提供了系统性的评估框架,通过构建高精度的场景图三元组,揭示出现有VLM模型虽能生成合理的空间关系谓词,却难以将其精确绑定到正确的对象对之上,这一发现触及了多模态大模型在物理世界中进行符号落地(symbol grounding)的本质缺陷。研究进一步创新性地将场景图作为可注入的结构化语境,在不改动模型架构的前提下,通过特征级上下文融合策略,实现了对Pi0等策略在特定操控任务上的显著性能跃升,最高提升达30个百分点。这一突破性进展不仅为具身智能体的空间推理能力提供了可量化的评估基准,更开创了结构化语义信息与端到端策略模型有机融合的新范式,对于推动机器人从仿真环境向真实世界场景的迁移具有里程碑式的重要意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务