遇见数据集

droid_dataset_segmentation_mask

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

DROID SAM 3.1 Segmentation Masks 是一个从原始 DROID RLDS 数据集(droid_101/0.0.1)生成的掩码侧车数据集,专注于机器人领域的图像分割任务。该数据集仅包含分割掩码,不包含原始图像或动作数据,因此不重新分发 DROID 的原始图像和动作。掩码基于三个摄像头视角生成:exterior_image_1_left、exterior_image_2_left 和 wrist_image_left,对应的提示词分别为 robot manipulator、robot manipulator 和 end-effector。每个掩码是每步的语义联合,以压缩的 COCO RLE 字典形式存储(包含 size 和 ASCII 编码的 counts)。数据集以 800 帧的独立块处理 episode。数据格式为 Parquet,包含一个 default 配置,训练分割数据位于 data/*.parquet。此外,数据集提供了一个映射文件 lerobot_to_rlds_episode_mapping.parquet(共 95,658 行),用于将 LeRobot 中的 episode 索引(hf_episode_index)与 RLDS 的 episode 索引(rlds_episode_id)进行对应。该映射基于 float32 动作关节位置序列的精确相等性验证,其中 95,466 个映射是唯一的,其余 192 行形成 96 个重复等价组。数据集还包含了 SAM 源修订版本、权重集、夹爪检测器等信息,并提供了使用示例代码,展示了如何通过 episode_id 进行双向查找。该数据集适用于机器人操作场景中的分割掩码研究,尤其是与 DROID 和 LeRobot 数据集结合使用时。

DROID SAM 3.1 Segmentation Masks is a mask sidetrack dataset generated from the original DROID RLDS dataset (droid_101/0.0.1), focusing on image segmentation tasks in robotics. The dataset contains only segmentation masks, not original images or action data, thus it does not redistribute DROIDs original images and actions. Masks are generated from three camera views: exterior_image_1_left, exterior_image_2_left, and wrist_image_left, with corresponding prompt words robot manipulator, robot manipulator, and end-effector. Each mask is a semantic union per step, stored as a compressed COCO RLE dictionary (containing size and ASCII-encoded counts). The dataset processes episodes in independent chunks of 800 frames. Data format is Parquet, with a default configuration, and training segmentation data is located at data/*.parquet. Additionally, the dataset provides a mapping file lerobot_to_rlds_episode_mapping.parquet (95,658 rows) to map LeRobot episode indices (hf_episode_index) to RLDS episode indices (rlds_episode_id). The mapping is verified by exact equality of float32 action joint position sequences, with 95,466 unique mappings and the remaining 192 rows forming 96 duplicate equivalence groups. The dataset also includes SAM source revision, weight set, gripper detector, and usage example code showing bidirectional lookup by episode_id. This dataset is suitable for segmentation mask research in robotic manipulation scenarios, especially when combined with DROID and LeRobot datasets.

创建时间:
2026-08-01
原始信息汇总

DROID SAM 3.1 分割掩码数据集

概述

该数据集是基于原始 droid_101/0.0.1 RLDS 发布版本生成的掩码辅助数据集(sidecar),仅包含分割掩码,不重新分发 DROID 图像或动作数据。其 episode_index 遵循 RLDS 剧集顺序。

任务类型

  • 图像分割(image-segmentation)

标签

  • 机器人(robotics)
  • RLDS
  • DROID
  • SAM3

提示词(Prompts)

  • exterior_image_1_left(外部左侧相机1):机器人操作器
  • exterior_image_2_left(外部左侧相机2):机器人操作器
  • wrist_image_left(腕部左侧相机):末端执行器

掩码格式

掩码按步骤生成语义并集,编码为压缩的 COCO RLE 字典,包含 size 和 ASCII counts 字段。剧集按独立块处理,每块 800 帧(0 表示完整剧集)。

技术细节

  • 源 TFDS 子分割201
  • SAM 源修订版本46957e47805eaa273f4aa7bbbd25a88bca9108ce
  • 权重集gripper_universal
  • SAM 检查点修订版本daa63191845a41281374e725f4c9e51c7a824460
  • 夹爪检测器仓库sazirarrwth99/sam3.1-gripper-universal
  • 夹爪检测器修订版本be4e08e989a673511b11b7214fb135639dc5132a

与 LeRobot 的剧集映射

映射文件

lerobot_to_rlds_episode_mapping.parquet 提供了 LeRobot 与 RLDS 之间的剧集对应关系。

映射规模与质量

  • 95,658 行,对应每个 LeRobot hf_episode_index
  • 所有剧集均成功映射,零未匹配或未解决的剧集
  • 通过完整 float32 action.joint_position 序列的精确相等性验证
  • 95,466 个映射唯一;其余 192 行形成 96 个重复等价组(RLDS 源中含同一录制的不可区分副本)

关键字段

  • LeRobot 侧字段hf_episode_indexhf_lengthhf_data_pathhf_dataset_from_indexhf_dataset_to_index
  • RLDS 侧字段rlds_shard_indexrlds_record_indexrlds_shard_major_indexrlds_tfrecord_pathrlds_byte_offsetrlds_file_pathrlds_recording_folderpathrlds_episode_id

重要提示

  • 本数据集的 episode_indexrlds_shard_major_index 均为位置计数器,非稳定标识符,不可直接用作索引
  • 应始终通过 episode_id(本数据集列)与 rlds_episode_id(映射文件列)进行连接,二者基于内容寻址且跨行序稳定

其他信息

  • 文件 SHA-2567548f287fb4f2d62c642e4e89a8b7a5ac50d278d18b1d2ff0b042e4c7309eb5a
  • 由 DROID 分割标注流程生成
  • 原始 DROID 数据集与 SAM 检查点仍受其各自许可证和条款约束
搜集汇总
数据集介绍
droid_dataset_segmentation_mask 数据集图片
构建方式
该数据集作为DROID机器人操作数据的辅助标注资源,源自原始RLDS格式发布,仅提供分割掩码,不附带原始图像与动作数据。掩码以压缩COCO RLE字典形式存储,依据SAM 3.1模型与通用夹爪检测器对三种视角(外部左右相机及腕部相机)的语义分割结果进行逐帧语义并集处理。构建过程采用独立数据块处理机制,每块包含800帧,并遵循源数据集的子分割划分。为保障数据溯源与关联性,数据集提供了与LeRobot版本的映射文件,该映射基于动作序列的精确匹配,确保所有95,658个片段均完成对应且无遗漏。
特点
数据集的核心特性在于其纯掩码的独立设计,有效规避了原始图像与动作的再分发问题,同时通过稳定的内容寻址标识符(episode_id)支持精确关联。其掩码覆盖机器人操作中关键的三个视角,统一使用语义联合表示,便于下游任务直接应用。映射文件不仅包含LeRobot与RLDS的对应关系,还详细记录了数据来源、字节偏移等验证信息,并附带重复记录的等价分组与候选标注,显著提升了数据使用的透明度与可靠性。SHA-256校验和进一步保障数据集完整性。
使用方法
使用该数据集时,需通过映射文件将LeRobot的episode索引与RLDS的episode_id进行关联,避免直接使用位置计数器。示例代码展示了双向查询流程:利用pyarrow读取映射表,并通过datasets库加载掩码数据,即可按episode_id定位对应的掩码行或反向获取LeRobot索引。建议联合HuggingFace的LeRobot DROID数据集使用,以掩码作为分割标注,配合图像与动作执行机器人学习任务,如视觉运动策略训练,并注意遵守原始DROID数据的许可协议。
背景与挑战
背景概述
该数据集名为droid_dataset_segmentation_mask,是DROID机器人数据集的一个语义分割掩码附属集,由EpicPinkPenguin团队基于DROID RLDS原始版本生成,并采用了最新的SAM 3.1模型进行标注。DROID数据集由Google等机构于2023年发布,旨在提供大规模的机器人操作数据,涵盖多任务、多场景的遥操作演示,是机器人学习领域的重要基准。本数据集专注于为DROID中的视觉观测提供高质量的语义分割掩码,以支持机器人操作中的场景理解与物体识别。其出现填补了机器人数据缺乏精细分割标注的空白,为下游任务如抓取规划、动态避障等提供了关键视觉信息,在机器人学习与计算机视觉交叉领域具有广泛的应用前景。
当前挑战
该数据集面临的挑战主要体现在领域问题与构建过程两方面。领域层面,机器人操作场景复杂多变,光照、遮挡及物体多样性导致分割精度要求高,且实时性需求与模型计算开销存在矛盾。构建层面,原始DROID数据规模庞大,包含数万集多视角视频,需要处理海量数据并保证掩码一致性;同时,采用SAM 3.1模型时需适配特定硬件,并解决跨数据集索引映射的难题——由于LeRobot与RLDS的episode顺序不同,必须通过内容寻址的episode_id建立稳定对应关系,而重复录制导致的部分副本无法恢复,进一步增加了数据管理和验证的复杂度,这对数据管道的可靠性和可复现性提出了严苛要求。
常用场景
经典使用场景
在机器人学习与计算机视觉的交叉领域中,droid_dataset_segmentation_mask数据集作为DROID大规模机器人数据集的辅助标注,为研究者提供了高质量的语义分割掩码。该数据集聚焦于机械臂操作场景,针对外部相机与腕部相机采集的图像,分别标注了机器人操作器与末端执行器。其经典使用场景是作为视觉语言动作模型训练时的感知基础,通过将原始图像与分割掩码联合输入,模型能够更精准地理解场景中的关键物体与操作目标,从而提升策略学习的空间感知能力。此外,该数据集亦常见于多模态融合研究,用于探究视觉分割信息对机器人控制策略泛化性能的增益影响。
衍生相关工作
该数据集的衍生工作集中于利用分割掩码强化视觉表征学习与策略泛化。受其启发,研究者已探索将掩码预测作为辅助任务融入Transformer架构的动作生成模型,通过多任务学习提升策略对环境变化的适应力。另一类相关工作则依托其提供的LeRobot-RLDS映射,构建跨数据集的可迁移基准,用于比较不同感知模块在DROID及后续数据集上的性能。此外,该数据集还推动了无监督分割与特征解耦研究,例如借助生成掩码训练以对象为中心的表示模型,使机器人系统能够更高效地进行动作规划与因果推理。这些衍生工作共同将分割信息从单纯的标注产物演变为机器人学习中的核心结构线索,拓展了具身智能的研究疆界。
数据集最近研究
最新研究方向
该数据集聚焦于机器人操作领域的大规模视觉分割研究,其前沿方向在于利用基础分割模型(如SAM 3.1)为DROID等具身智能数据集提供高质量、跨视角的语义掩码,以支撑机器人感知与操控任务的精细化建模。当前研究热点包括构建与强化学习数据(RLDS)及LeRobot等框架的跨数据集映射机制,通过内容寻址的稳定标识符打破异构数据格式间的壁垒,促进多源数据融合与高效检索。此数据集的价值在于其轻量化、仅含掩码的“sidecar”设计,既规避了原始图像与动作的版权再分发问题,又为大规模策略学习提供了可复用的语义监督信号,对推动机器人操作中的泛化、灵巧抓取及多任务模仿学习具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务