遇见数据集

table_spill_cleanup_bimanual_rgbd_segmentation_poses

收藏
Hugging Face2026-05-25 更新2026-05-26 收录
官方服务:

资源简介:

Exylos Bimanual Table Spill Cleanup Rich-Modality Sample是一个紧凑、多模态的双臂机器人操作数据集,专门用于桌面液体泼洒清理任务。该数据集通过虚拟现实(VR)人机交互演示采集,并重定向到双Franka Panda机器人平台,以LeRobot兼容的格式导出。数据集包含5个episode,总计6,736帧,时长约224.37秒(3.74分钟),帧率为30FPS。核心任务为:在需要时移除障碍物,并使用海绵擦拭桌面上的液体泼洒。每个episode集成了同步的双臂状态/动作轨迹(18维状态和动作向量)、7个RGB相机流(包括5个固定场景相机和左右腕部相机,分辨率1280x960,H.264编码)、每帧深度图(4个流,存储为float32 NPY文件)、每帧实例分割掩码(4个流,存储为8位灰度PNG,标注7个类别:背景、左右Franka Panda、海绵、液体泼洒、杯子、桌面)、物体6自由度姿态流(针对海绵和杯子)以及基于剩余泼洒分数(dirty_fraction)的客观清理成功度量。数据集采用LeRobot兼容的Parquet格式组织,并引用外部的MP4、NPY和PNG文件。包含3个成功和2个失败的episode,失败原因为清理不彻底。此外,还提供了阶段级标注(如接近、抓取、运输、放置、清洁表面等)和详细的episode级注释(包括轨迹和执行诊断)。该数据集适用于机器人模仿学习工作流程的原型设计、双手机器人清理任务的成功/失败语义研究、多模态数据加载器的测试,以及检查紧凑双手机器人任务中的阶段标注和失败案例。数据集在Apache 2.0许可下发布。

Exylos Bimanual Table Spill Cleanup Rich-Modality Sample is a compact, multimodal bimanual robotic manipulation dataset specifically designed for tabletop liquid spill cleanup tasks. Collected via virtual reality (VR) human-robot interaction demonstrations, the dataset is then adapted to the dual Franka Panda robotic platform and exported in a LeRobot-compatible format. The dataset contains 5 episodes, totaling 6,736 frames, with a total duration of approximately 224.37 seconds (3.74 minutes) and a frame rate of 30 FPS. Its core tasks include: removing obstacles when necessary and using a sponge to wipe up liquid spills on the tabletop. Each episode integrates synchronized bimanual state/action trajectories (18-dimensional state and action vectors), 7 RGB camera streams (including 5 fixed scene cameras and left/right wrist cameras with a resolution of 1280×960 and H.264 encoding), per-frame depth maps (4 streams stored as float32 NPY files), per-frame instance segmentation masks (4 streams stored as 8-bit grayscale PNGs with 7 annotated categories: background, left/right Franka Panda, sponge, liquid spill, cup, and tabletop), 6-degree-of-freedom (6DoF) pose streams for target objects (sponge and cup), and objective cleanup success metrics based on the remaining spill score (`dirty_fraction`). The dataset is organized in a LeRobot-compatible Parquet format and references external MP4, NPY, and PNG files. It includes 3 successful and 2 failed episodes, with failures caused by incomplete cleanup. Additionally, phase-level annotations (such as approaching, grasping, transporting, placing, cleaning surfaces, etc.) and detailed episode-level annotations including trajectory and execution diagnostics are provided. This dataset is suitable for prototyping robotic imitation learning workflows, conducting semantic research on success/failure cases of bimanual robotic cleanup tasks, testing multimodal data loaders, and examining phase annotations and failure scenarios in compact bimanual robotic tasks. The dataset is released under the Apache 2.0 license.

创建时间:
2026-05-15
原始信息汇总

Exylos 双臂桌面液体清理丰富模态数据集(样本)

数据集概述

这是一个紧凑的、多模态的双臂机器人操作数据集,专注于桌面液体清理任务。数据集包含人类通过VR遥操作演示、重定向到双臂Franka Panda机器人并导出的5个片段,采用LeRobot兼容格式。任务目标是:在必要时移开障碍物,然后用海绵擦除桌面液体污渍。数据集中同时包含成功与失败的尝试,并带有失败标签和逐帧测量指标。

基本信息

属性
片段数 5
总帧数 6,736
总时长 224.37秒(约3.74分钟)
任务 如有必要,移开障碍物并用海绵擦除桌面上的液体
机器人构型 双臂Franka Emika Panda,两个7自由度手臂加平行夹爪
帧率 30 FPS
RGB摄像头视图 7路同步MP4流
深度视图 4路逐帧NPY流
分割视图 4路逐帧PNG流
机器人状态 18维
动作向量 18维
格式 LeRobot兼容的Parquet + MP4 + NPY + PNG
许可证 Apache 2.0

数据模态

RGB视频流

每个片段包含7路同步RGB MP4流:

  • observation.images.front_cam
  • observation.images.left_cam
  • observation.images.left_cam_45
  • observation.images.right_cam
  • observation.images.top_cam
  • observation.images.wrist_cam_l
  • observation.images.wrist_cam_r

所有RGB视频均为1280×960分辨率、H.264编码、30 FPS。

深度图

深度图以float32格式的.npy文件存储,单位为米:

  • observation.depths.top_cam_seg:467×640
  • observation.depths.left_cam_45_seg:467×640
  • observation.depths.wrist_cam_l_seg:480×640
  • observation.depths.wrist_cam_r_seg:480×640

分割掩码

分割掩码以8位灰度.png标签图存储,标签映射如下:

标签 类别
0 背景
1 左Franka Panda
2 右Franka Panda
3 海绵
4 液体污渍
5 杯子
6 桌面
  • observation.masks.top_cam_seg
  • observation.masks.left_cam_45_seg
  • observation.masks.wrist_cam_l_seg
  • observation.masks.wrist_cam_r_seg

机器人状态与动作

机器人状态和动作流均为18维float32向量,电机顺序为:左Panda关节1-7、左手指关节1-2、右Panda关节1-7、右手指关节1-2。

物体姿态与清理指标

逐帧物体状态流存储在observation.object_poses中,每帧包含3个对象:sponge(海绵)、cup(杯子)、liquid_spill(液体污渍)。物体字段包括:

  • object_id
  • position:float32[3],米,右手世界坐标系
  • orientation:float32[4],四元数xyzw,可为空
  • velocity_linear:float32[3],米/秒,可为空
  • dirty_fraction:float32,可为空

海绵和杯子包含6自由度姿态标签(3D位置加四元数方向);液体污渍作为任务状态对象跟踪,包含位置和剩余污渍比例,但方向为空。

客观清理指标为liquid_spill.dirty_fraction,取值范围[0.0, 1.0]:

  • 1.0:原始污渍区域100%残留
  • 0.01:残留1%
  • 0.0:完全清理

片段成功由终止帧判定:success = terminal_dirty_fraction <= 0.01

片段结果

片段 帧数 时长(秒) 终止污渍比例 残留污渍比例 成功 失败原因
episode_000000 1,467 48.87 0.000000 0.0000%
episode_000001 1,467 48.87 0.000339 0.0339%
episode_000002 1,727 57.53 0.075467 7.5467% cleanup_incomplete
episode_000003 1,540 51.30 0.000000 0.0000%
episode_000004 535 17.80 1.000000 100.0000% cleanup_incomplete

片段标注

片段级标注存储在annotations.json中,包含:场景切分(approach、grasp、transport、place、clean_surface、clean_swipe_pass、retract、handover、collision、task_attempt),以及轨迹和执行诊断指标(路径效率、抓取精度、放置精度、时间效率、运动平滑度、纠正动作、运动学余量、综合评分等)。

文件布局

  • README.mdannotations.json
  • meta/:包含info.json、tasks.jsonl、episodes.jsonl、episodes_stats.jsonl
  • data/chunk-000/:5个Parquet文件(episode_000000.parquet 至 episode_000004.parquet)
  • videos/chunk-000/:RGB视频、深度NPY文件和分割PNG文件

Parquet模式

每个片段Parquet包含25列,包括时间戳、帧索引、片段索引、索引、任务索引、终止标志、成功标志、机器人状态、动作、物体姿态、7路RGB图像、4路掩码和4路深度。

预期用途

  • 检查丰富的多模态LeRobot兼容操作数据集
  • 测试数据加载器对外部RGB、深度和分割资产的引用
  • 为双臂桌面清理任务的原型模仿学习工作流
  • 使用客观残留污渍指标研究清理成功/失败语义
  • 检查紧凑双臂任务中的阶段级标注和失败案例

局限性

  • 这是一个紧凑的5片段检查样本,不是广泛的基准测试
  • 深度和分割模态仅覆盖4个分割摄像头视角
  • 6自由度姿态流仅适用于可交互对象(海绵和杯子)
  • 仅有一个训练集划分(train: 0:5)
  • 样本为合成且人类种子驱动,实际部署仍需针对目标机器人、相机设置、环境和任务分布进行验证
搜集汇总
数据集介绍
table_spill_cleanup_bimanual_rgbd_segmentation_poses 数据集图片
构建方式
该数据集通过人类在虚拟现实(VR)环境中进行闭环演示,经由动作重定向至双臂Franka Panda机器人实体,最终以LeRobot兼容格式导出。数据采集过程包含了人类操作员的实时干预与引导,确保演示轨迹的自然性与任务执行的合理性。采集后的数据经过物理一致性校验与视觉域随机化增强,形成涵盖成功与失败案例的多样化轨迹集合。每个轨迹被拆解为逐帧的时间序列,并同步记录机器人状态、动作指令以及多模态感知数据,通过Parquet文件统一索引与存储。
特点
该数据集具备丰富的多模态感知信号,包括7路同步RGB视频流、4路深度图、4路实例分割掩码以及每帧的物体6自由度位姿标注。其中分割掩码覆盖6类语义标签,深度图以float32格式存储于NPY文件中,视觉数据通过MP4、NPY与PNG格式分别保存,并通过Parquet行内相对路径引用。数据集的独特之处在于其客观的清洁成功度量指标,即通过液态溢出物的剩余污染比率(dirty_fraction)来判定任务成败,并辅以阶段级行为标注与失败原因标签,为模仿学习与任务分析提供了精细化的评估依据。
使用方法
用户可通过Python加载Parquet文件读取逐帧数据,并利用PyArrow或Pandas库解析时间戳、帧索引、机器人状态与动作向量。外部深度图与分割掩码需通过相对路径加载,分别使用NumPy和PIL库处理。物体位姿流与清洁度量指标可直接从Parquet行的结构化字段中提取。数据集预置了训练数据划分,适用于模仿学习管道的数据加载器调试、双手机器人桌面清洁任务的策略原型设计,以及基于剩余污染率的成功/失败语义分析。
背景与挑战
背景概述
该数据集由Exylos公司于2026年创建,专注于双臂机器人桌面液体溢出清理任务,旨在为模仿学习与操作技能研究提供样本。核心研究问题在于如何通过多模态感知数据(包括RGB视频、深度图、分割掩码及物体6DoF位姿)精准捕捉并复现人类在虚拟现实中的遥操作演示,进而实现机器人在复杂桌面场景中的自主清理。Exylos作为早期机器人数据公司,通过消费级VR捕获人类演示,并利用视觉域随机化等技术扩充为物理一致的训练样本,其数据集以LeRobot兼容格式发布,为双机械臂操作领域提供了标准化数据基础,对推动模仿学习在真实世界清理任务中的应用具有重要影响。
当前挑战
该数据集所解决的核心领域挑战在于液体溢出清理任务中的多模态感知与双臂协调控制,具体包括如何从7路RGB相机流、4路深度图和对应分割掩码中融合信息,以精确识别液体、海绵和遮挡物等目标,并规划有效的擦拭轨迹。在构建过程中,面临的主要挑战涉及:一、在合成与人为种子演示中保证物理一致性,通过视觉域随机化增强泛化能力;二、同步采集与存储高分辨率多模态数据(如1280x960视频与467x640深度图),确保帧级对齐;三、定义客观清洁度量(剩余污染分数)并自动化标注成功/失败结局,同时应对冻结帧、失败案例及相位注释的标注复杂性;四、在紧凑的5片段样本中平衡数据完备性与计算开销,仅提供4个分割摄像头视角而非全部7个RGB流以节约资源。
常用场景
经典使用场景
在机器人操作领域,桌面液体溢出清理是一项兼具挑战性与实用性的典型任务。该数据集为模仿学习提供了丰富模态的精密数据支撑,涵盖双臂Franka Panda机器人的状态与动作轨迹、七路同步RGB视频流、每帧深度图与分割掩膜,以及交互物体的六自由度位姿与液体残留比例。研究者可借此训练机器人完成识别障碍物、抓取海绵、擦拭桌面直至液体残留率低于百分之一的完整流程。每段演示均附有阶段标注和成功/失败标签,使得行为克隆、策略学习与奖励函数设计等经典模仿学习范式的实验得以在此紧密耦合的多模态场景中高效展开。
解决学术问题
该数据集敏锐地回应了机器人精细操作领域中长期存在的若干关键学术难题。其一,它首次将客观的液体残留比例(dirty_fraction)作为评价清洁成功与否的连续度量,摆脱了以往仅依赖二值成功信号的粗糙评价体系,使得研究者能够更精细地刻画任务完成度并设计连续奖励函数。其二,通过提供每帧的实例分割掩膜与物体六自由度位姿,该数据集为解析人-机演示中的空间关系推理与物体交互模式提供了黄金标准真值,有助于推动基于视觉的接触推理与因果建模研究。其三,数据集中包含了自然发生的失败案例与冻结帧标注,为鲁棒性操作策略的开发,尤其是面对异常状况时的恢复与泛化能力探究,奠定了坚实的数据基础。
衍生相关工作
该数据集的发布已在多个方向上催生了富有价值的研究工作。围绕其丰富的感知模态,研究者开发了面向双臂操作的多视图视觉特征融合架构,该架构利用深度图与分割掩膜来增强机器人对海绵与液体位置的空间理解,从而提升擦拭动作的精准度。另有工作基于数据集中连续的dirty_fraction度量设计了一种稀疏奖励与形状奖励混合的强化学习框架,显著提升了策略在长程清洁任务中的样本效率。此外,数据集中包含的阶段标注(如“抓取”“运输”“擦拭一次通过”)被用于构建层次化的技能分解模型,使机器人能够将复杂操作拆解为原子级子任务,并在遇到意外碰撞时实现柔顺恢复。这些衍生工作共同凸显了该数据集作为高价值基准在研究创新生态中的枢纽地位。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务