遇见数据集

droid_3d

收藏
Hugging Face2026-06-22 更新2026-06-23 收录
官方服务:

资源简介:

droid_3d 是一个使用 DROID 数据收集平台采集的大规模机器人操作数据集,旨在训练视觉-语言-动作模型和具有3D感知能力的机器人策略。它包含多视角的 RGB 视频、深度视频、点云、机器人动作以及自然语言任务描述。数据集规模庞大,总计包含 58,201 个交互片段(episodes),共 18,083,626 帧图像,以 15 FPS 的帧率录制,覆盖了 23,858 个不同的任务。数据采集使用了多摄像头系统,包括一个腕部相机和两个外部相机。每个帧提供来自这三个视角的以下数据:分辨率为 224×398 的 RGB 视频(使用 AV1 编码)、相同分辨率的深度视频(使用 H.265 编码,深度范围为 2000 毫米)、以及每个相机对应的点云(最多 2048 个点,其 XYZ 坐标被量化到指定范围)。此外,每个时间步包含一个 8 维的浮点型机器人动作向量,以及每个交互片段最多 3 条描述任务的文本标注。数据集遵循 LeRobot v3.0 格式组织,总大小约为 1.3 TB,目前仅包含训练集划分。它适用于机器人抓取、任务规划、多模态表示学习等研究领域。

droid_3d is a large-scale robot manipulation dataset collected using the DROID data collection platform. It aims to train vision-language-action models and robot policies with 3D perception capabilities. The dataset includes multi-view RGB videos, depth videos, point clouds, robot actions, and natural language task descriptions. It is extensive, containing a total of 58,201 episodes with 18,083,626 frames recorded at 15 FPS, covering 23,858 distinct tasks. Data collection utilized a multi-camera system comprising a wrist camera and two external cameras. Each frame provides data from these three perspectives: RGB videos at 224×398 resolution (encoded with AV1), depth videos at the same resolution (encoded with H.265, with a depth range of 2000 mm), and point clouds per camera (up to 2048 points, with XYZ coordinates quantized to a specified range). Additionally, each timestep includes an 8-dimensional floating-point robot action vector, and each episode has up to 3 text annotations describing tasks. The dataset is organized following the LeRobot v3.0 format, with a total size of approximately 1.3 TB, and currently includes only the training split. It is suitable for research in robot grasping, task planning, multimodal representation learning, and related fields.

创建时间:
2026-06-18
原始信息汇总

数据集总览

droid_3d 是一个大规模机器人操作数据集,基于 DROID 数据采集平台构建。数据集包含多视角 RGB 视频、深度视频、点云、机器人动作和自然语言任务描述,专为训练视觉-语言-动作模型和 3D 感知机器人策略设计。

数据集规模与统计

  • 总片段数: 58,201 (episodes)
  • 总帧数: 18,083,626 (frames)
  • 总任务数: 23,858 (distinct tasks)
  • 帧率: 15 FPS

数据集划分

划分 片段数 帧数
train 58,201 18,083,626

注意: 该数据集仅包含训练集,无评估集。

数据特征与格式

数据集遵循 LeRobot v3.0 格式,每个帧包含以下特征:

特征名称 数据类型 形状 详细信息
observation.images.wrist video (224, 398, 3) 腕部 RGB 视频,AV1 编码,15 FPS
observation.images.external_0 video (224, 398, 3) 外部相机 0 RGB 视频,AV1 编码,15 FPS
observation.images.external_1 video (224, 398, 3) 外部相机 1 RGB 视频,AV1 编码,15 FPS
observation.depth.wrist depth_video (224, 398, 1) 腕部深度视频,H.265 (uint12) 编码,深度范围 2000mm
observation.depth.external_0 depth_video (224, 398, 1) 外部相机 0 深度视频,H.265 (uint12) 编码,深度范围 2000mm
observation.depth.external_1 depth_video (224, 398, 1) 外部相机 1 深度视频,H.265 (uint12) 编码,深度范围 2000mm
observation.pointcloud.wrist pointcloud (2048, 3) 腕部点云,量化 XYZ 坐标,范围: x∈[−1,1], y∈[−1,1], z∈[0,1.6]
observation.pointcloud.external_0 pointcloud (2048, 3) 外部相机 0 点云,量化 XYZ 坐标,范围同前
observation.pointcloud.external_1 pointcloud (2048, 3) 外部相机 1 点云,量化 XYZ 坐标,范围同前
action float32 (8,) 8 维机器人动作向量
language_1 string (1,) 第一条自然语言任务描述
language_2 string (1,) 第二条自然语言任务描述
language_3 string (1,) 第三条自然语言任务描述
timestamp float32 (1,) 帧的时间戳
frame_index int64 (1,) 帧在片段内的索引
episode_index int64 (1,) 片段标识符
index int64 (1,) 全局帧索引
task_index int64 (1,) 任务标识符

数据存储结构

数据集目录布局如下:

droid_3d/ ├── data/ # Parquet 格式的动作和元数据 (636 MB) │ └── chunk-000/ │ └── file-{000-999}.parquet ├── videos/ │ ├── observation.images.wrist/ # 腕部 RGB 视频 (AV1) │ ├── observation.images.external_0/ # 外部相机 0 RGB 视频 (AV1) │ ├── observation.images.external_1/ # 外部相机 1 RGB 视频 (AV1) │ ├── observation.depth.wrist/ # 腕部深度视频 (H.265) │ ├── observation.depth.external_0/ # 外部相机 0 深度视频 (H.265) │ └── observation.depth.external_1/ # 外部相机 1 深度视频 (H.265) ├── pointclouds/ │ ├── observation.pointcloud.wrist/ # 腕部点云 (Parquet) │ ├── observation.pointcloud.external_0/ # 外部相机 0 点云 (Parquet) │ └── observation.pointcloud.external_1/ # 外部相机 1 点云 (Parquet) ├── meta/ │ ├── info.json # 数据集元数据 │ ├── stats.json # 数据集统计 │ ├── tasks.parquet # 任务定义 │ └── episodes/ # 片段元数据 └── README.md

  • 视频数据: 823 GB
  • 点云数据: 461 GB
  • Parquet 数据: 636 MB

使用说明

重要提示: 标准 LeRobot (huggingface/lerobot) 不支持深度视频或点云加载。必须使用修改后的代码库 ZibinDong/lerobotdataset3d 来加载此数据集。

安装: bash pip install git+https://github.com/ZibinDong/lerobotdataset3d.git

加载数据集示例: python from lerobotdataset3d import LeRobotDatasetDepthPointcloud

dataset = LeRobotDatasetDepthPointcloud( repo_id="ZibinDong/droid_3d", root="/local_path/to/droid_3d", )

item = dataset[0]

RGB 视频帧: (3, H, W) float32, 范围 [0, 255]

深度帧: (1, H, W) float32, 单位米

点云: (max_points, 3) float32, 单位米

动作: torch.Size([8])

语言描述: string

时间窗口采样示例: python dataset = LeRobotDatasetDepthPointcloud( repo_id="ZibinDong/droid_3d", root="/local_path/to/droid_3d", delta_timestamps={ "observation.images.wrist": [-0.1, 0.0, 0.1], "action": [-0.1, 0.0, 0.1, 0.2, 0.3], }, )

引用

bibtex @article{dong2025embodiedmae, title = {EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation}, author = {Dong, Zibin and Ni, Fei and Yuan, Yifu and Li, Yinchuan and Hao, Jianye}, journal = {arXiv preprint arXiv:2505.10105}, year = {2025} }

搜集汇总
数据集介绍
droid_3d 数据集图片
构建方式
在机器人操作领域,三维视觉感知与语言指令的融合日益成为研究焦点。droid_3d数据集基于DROID数据采集平台构建,利用多摄像头设置(腕部相机及两个外部相机)以15帧每秒的速率记录完整的操作过程。数据经过精心处理,将RGB视频编码为AV1格式,深度视频采用H.265(uint12)编码,点云则通过量化XYZ坐标生成,每个视角最多包含2048个点。每个片段均配备8维动作向量和多达3条自然语言任务描述,最终汇集为58,201个片段、逾1800万帧的大规模资源,数据总量约1.3 TB。
使用方法
由于标准LeRobot库尚未支持深度视频与点云的解码,使用前必须安装定制的lerobotdataset3d代码库。通过pip命令从GitHub仓库直接安装后,可调用LeRobotDatasetDepthPointcloud类加载数据集。加载时需指定数据集的HuggingFace仓库标识与本地存储路径,随后通过索引访问具体帧。数据类型涵盖三维RGB图像、单通道深度图、点云坐标、动作向量及语言描述等,支持灵活的时间窗口采样策略,为机器人策略训练和多模态模型研发提供了便捷的数据接口。
背景与挑战
背景概述
droid_3d数据集由研究者Zibin Dong等人于2025年创建,源自EmbodiedMAE项目,旨在为机器人操作领域提供大规模三维多模态数据支撑。该数据集依托DROID采集平台,收录了超过58,000个操作片段、逾1,800万帧多视角RGB与深度视频、点云及精细动作向量,并附有密集的自然语言任务标注。其核心研究问题在于如何融合视觉、深度与三维几何信息,以训练更鲁棒的视觉-语言-动作模型和三维感知策略,推动具身智能从二维表征向三维空间认知的跨越,对机器人学习与操作任务具有显著的基础性贡献。
当前挑战
该数据集首先致力于解决机器人操作中深度信息与三维结构缺失导致的策略泛化难题——传统方法依赖二维RGB图像,难以应对物体遮挡、空间位姿变化及复杂环境交互;droid_3d通过整合点云与深度视频,为模型提供了更丰富的几何线索。在构建过程中,数据规模庞大(总约1.3TB),且标准LeRobot框架不支持深度视频与点云解码,需专门修改代码库方可加载,显著增加了数据预处理与存储管理的复杂性。此外,多视角传感器同步、海量任务标注的语义一致性与量化点云的精度平衡亦构成严峻挑战。
常用场景
经典使用场景
在机器人操作领域,droid_3d数据集为训练视觉-语言-动作模型提供了多模态的丰富素材。该数据集包含了多视角的RGB视频、深度视频、点云数据以及机器人动作序列,并配以自然语言任务描述。研究者可以利用这些数据构建能够理解三维空间结构和语义指令的机器人策略,例如通过融合视觉与点云信息来提升机械臂抓取与放置的精准度。经典使用方式包括利用时间窗口采样进行行为克隆,或是作为预训练数据来初始化具身智能体的感知模块,从而解决从观测到动作映射的端到端学习问题。
解决学术问题
droid_3d数据集解决了机器人领域长期存在的三个关键学术难题:其一是多模态感知数据的对齐与融合,传统数据集往往只提供RGB图像或深度图,而该数据集同时包含点云与深度视频,有助于研究三维几何特征与视觉外观的协同表示;其二是大规模任务泛化问题,涵盖超过两万种不同的操作任务,使得模型可以摆脱单一场景的过拟合,探索任务无关的通用操作技能;其三是语言条件化的行为学习,通过每段轨迹附带的三种自然语言描述,推动了从抽象指令到具体动作序列的语义推理研究。这些贡献极大地促进了机器人基础模型向更高层自主决策能力的演进。
实际应用
在实际部署中,droid_3d数据集支撑了多种工业与服务机器人场景的落地。例如,在仓库分拣任务里,机械臂可以利用点云数据实时感知包裹的几何形状,结合深度信息进行自适应抓取策略执行。在家庭服务机器人领域,通过自然语言指令(如“从桌子上拿起红色杯子”)与视觉观测的联合编码,机器人能够理解空间语义并完成长序列操作。此外,该数据集的多视角设计使得仿真到现实的迁移更加鲁棒,降低了真实环境中部署策略所需的调参成本,为自动驾驶中的灵巧操作和人机协作提供了可迁移的解决方案。
数据集最近研究
最新研究方向
在机器人操作领域,三维多模态感知与语言引导的端到端决策正成为前沿热点,尤其是大尺度、高保真的数据底座对视觉-语言-动作模型(VLA)的泛化能力至关重要。droid_3d数据集凭借其58,201个高质量操作片段、三视角RGB-D视频与量化点云,以及超过23,000种自然语言指令标注,为构建具备三维空间理解力的机器人策略提供了前所未有的训练基石。该数据集紧密关联EmbodiedMAE等统一三维多模态表征研究工作,通过引入深度视频与稀疏点云编码,推动了从二维图像理解向三维具身推理的范式跃迁,显著增强了机器人在非结构化环境中执行精密抓取与任务规划的鲁棒性与迁移性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务