遇见数据集

droid_1.0.1_v30

收藏
Hugging Face2026-07-12 更新2026-07-13 收录
官方服务:

资源简介:

该数据集是一个使用LeRobot框架创建的机器人演示数据集,专门用于机器人学习任务。数据集采集自Franka机器人,包含大量机器人执行任务的交互数据,总计95,658个任务片段(episodes),27,630,375帧数据,涵盖49,630个不同的任务。数据以Parquet文件格式存储,并附带MP4格式视频文件(帧率15fps)。数据集仅包含训练集。内容涵盖多模态信息:状态观测(如夹爪位置、笛卡尔位置和关节位置)、视觉观测(三个视角的RGB视频流,分辨率180x320)、动作数据(包括夹爪和笛卡尔的位置/速度)、语言指令(最多三个自然语言指令)、元数据(任务类别、采集信息等)、强化学习信号(奖励和折扣因子)以及索引信息。适用于机器人模仿学习、强化学习、视觉语言动作模型训练,特别是多模态机器人策略学习研究。

This dataset is a robot demonstration dataset created using the LeRobot framework, specifically designed for robot learning tasks. It is collected from a Franka robot and contains extensive interaction data from robot task executions, totaling 95,658 episodes, 27,630,375 frames, and covering 49,630 distinct tasks. The data is stored in Parquet format along with corresponding MP4 video files at 15fps. The dataset includes only a training set. It features rich multimodal information: state observations (such as gripper position, Cartesian position, and joint positions), visual observations (three RGB video streams from different viewpoints with 180x320 resolution), action data (including gripper and Cartesian position/velocity), language instructions (up to three natural language descriptions), metadata (task categories, collection details, etc.), reinforcement learning signals (rewards and discount factors), and indexing information. It is suitable for research in robot imitation learning, reinforcement learning, vision-language-action model training, particularly for multimodal robot policy learning tasks.

创建时间:
2026-07-11
原始信息汇总

数据集概述

  • 数据集名称: muacha/droid_1.0.1_v30
  • 许可协议: Apache-2.0
  • 任务类别: 机器人学 (robotics)
  • 标签: LeRobot
  • 创建工具: LeRobot

数据集规模

  • 总片段数 (episodes): 95,658
  • 总帧数 (frames): 27,630,375
  • 总任务数 (tasks): 49,630
  • 数据块大小 (chunks size): 1,000
  • 数据文件总大小: 100 MB
  • 视频文件总大小: 500 MB
  • 帧率 (fps): 15
  • 训练集划分: train (0:95658)

机器人类型

  • 机器人型号: Franka

数据集结构

  • 数据路径: data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频路径: videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

特征字段

状态观测 (observation.state)

字段 数据类型 形状 说明
observation.state.gripper_position float32 (1,) 夹爪位置
observation.state.cartesian_position float32 (6,) 笛卡尔位置 (x, y, z, roll, pitch, yaw)
observation.state.joint_position float32 (7,) 关节位置 (joint_0 到 joint_6)
observation.state float32 (8,) 综合状态 (joint_0 到 joint_6 + gripper)

图像观测 (observation.images)

字段 分辨率 编码 帧率
observation.images.wrist_left 180×320×3 AV1 (yuv420p) 15 fps
observation.images.exterior_1_left 180×320×3 AV1 (yuv420p) 15 fps
observation.images.exterior_2_left 180×320×3 AV1 (yuv420p) 15 fps

动作 (action)

字段 数据类型 形状 说明
action.gripper_position float32 (1,) 夹爪位置动作
action.gripper_velocity float32 (1,) 夹爪速度动作
action.cartesian_position float32 (6,) 笛卡尔位置动作 (x, y, z, roll, pitch, yaw)
action.cartesian_velocity float32 (6,) 笛卡尔速度动作 (x, y, z, roll, pitch, yaw)
action.joint_position float32 (7,) 关节位置动作 (joint_0 到 joint_6)
action.joint_velocity float32 (7,) 关节速度动作 (joint_0 到 joint_6)
action.original float32 (7,) 原始动作 (x, y, z, roll, pitch, yaw, gripper)
action float32 (8,) 综合动作 (joint_0 到 joint_6 + gripper)

其他特征

字段 数据类型 说明
is_first bool 是否为片段首帧
is_last bool 是否为片段末帧
is_terminal bool 是否为终止帧
language_instruction string 语言指令
language_instruction_2 string 第二条语言指令
language_instruction_3 string 第三条语言指令
discount float32 折扣因子
reward float32 奖励值
task_category string 任务类别
building string 建筑或场景信息
collector_id string 数据收集者ID
date string 数据采集日期
camera_extrinsics.wrist_left float32 腕部左相机外参 (6-DoF)
camera_extrinsics.exterior_1_left float32 外部左相机1外参 (6-DoF)
camera_extrinsics.exterior_2_left float32 外部左相机2外参 (6-DoF)
is_episode_successful bool 片段是否成功
timestamp float32 时间戳
frame_index int64 帧索引
episode_index int64 片段索引
index int64 全局索引
task_index int64 任务索引

引用

bibtex [More Information Needed]

搜集汇总
数据集介绍
droid_1.0.1_v30 数据集图片
构建方式
在机器人学习领域,大规模、高质量的演示数据集是推动技能习得与策略泛化的核心基石。droid_1.0.1_v30数据集由LeRobot框架构建,采集自Franka机器人平台,汇聚了95658个演示片段与27630375帧时序数据,涵盖49630个迥异的操作任务。该数据集将原始数据以Parquet格式存储于分块文件中,而视觉观测则以AV1编码的MP4视频文件单独保存。数据集的元信息通过结构化的info.json文件定义,明确划分了训练集(占据全部片段),并为每个特征字段指定了数据类型、维度及语义标签,构建出一个完备且可复现的机器人操作行为数据库。
特点
该数据集在特征设计上展现出卓越的精细度与多模态融合特性。观测层面同时包含关节、笛卡尔空间及夹爪状态,辅以腕部与外部双视角的低分辨率视频流(180×320像素),形成对机器人操作场景的立体感知。动作空间则覆盖位置、速度及原始指令的多重表征,支持不同层次的控制策略学习。此外,每段演示均附加了三条语言指令描述、采集者标识、任务类别与建筑环境信息,并特别标记了成功片段,极大便利了基于语言的条件化模仿学习与跨环境泛化研究。
使用方法
研究者可借助LeRobot工具链高效调用此数据集。数据加载需首先解析info.json文件以获得分块索引与特征规范,随后使用Parquet库逐块加载状态、动作与元数据,并利用视频解码器读取同步的视觉帧。为适配深度学习框架,建议将各数据类型对齐至统一的时间序列结构,并根据任务需求对多组语言指令与相机外参进行编码。该数据集预置了从原始分块到训练批次的标准转换流程,便于快速开展模仿学习、行为克隆或视觉运动策略的模型训练与评估。
背景与挑战
背景概述
droid_1.0.1_v30数据集由Hugging Face基于LeRobot框架构建,专注于机器人操控领域的大规模多任务学习,创建于2024年。该数据集由Franka机械臂收集,包含95658个演示回合、27630375帧数据,覆盖49630种不同任务,是迄今为止规模最大、任务最多样的开源机器人数据集之一。核心研究问题在于如何利用大规模异构演示数据,训练出具备泛化能力的机器人操控模型,从而推动机器人从特定任务执行向通用技能习得迈进。该数据集以Apache-2.0许可证发布,为全球研究人员提供了统一的数据基准,显著促进了模仿学习、行为克隆及多任务强化学习等领域的研究进展。
当前挑战
该数据集面临的挑战主要体现在两个方面。领域问题方面,机器人操控面临环境多样性、任务复杂性及感知不确定性,传统方法难以从有限数据中学习鲁棒策略;droid_1.0.1_v30虽规模宏大,但任务类别间数据分布不均,模型需克服对特定任务过拟合的风险,实现跨任务泛化。构建过程中,挑战包括数据采集时机械臂状态与视觉观测的同步校准、多视角视频(腕部及外部摄像头)的一致性管理,以及高达2763万帧数据的高效存储与预处理;此外,需要确保奖励与成功标签的准确标注,以支持后续基于奖惩信号的算法训练。
常用场景
经典使用场景
在机器人学习与操控领域,droid_1.0.1_v30数据集凭借其海量的遥操作演示数据,成为训练视觉运动策略的经典基准。该数据集包含近十万条成功执行的任务片段,覆盖近五万种不同的任务场景,并提供了来自腕部及外部多个视角的视觉观测、机器人关节与笛卡尔空间状态、以及对应的语言指令描述。研究者可基于此构建端到端的模仿学习模型,通过行为克隆或逆强化学习等方法,使机器人学会从视觉输入直接映射到精确的动作输出,实现复杂环境下的灵巧操作。
衍生相关工作
基于该数据集,学术界已衍生出多项具有影响力的工作。例如,研究者利用其多视角视觉与动作信息,探索基于扩散模型的机器人动作生成策略,显著提升了动作序列的平滑性与成功率。此外,结合大规模语言模型,衍生工作尝试构建语言条件化的操作策略,实现零样本任务泛化。数据集还被用于训练通用的视觉-动作表征模型,通过预训练-微调范式,将在该数据上学到的知识迁移至未见过的机器人平台或任务中,引领了机器人基础模型的研究热潮。
数据集最近研究
最新研究方向
在机器人学习领域,droid_1.0.1_v30数据集凭借其海量的遥操作数据(涵盖近十万条任务片段与两千七百万帧观测)为模仿学习与行为克隆的跨场景泛化提供了关键基石。当前前沿研究聚焦于利用该数据集训练视觉-语言-动作联合模型,通过多视角视觉输入(腕部及外部两个摄像头)和冗余动作表征(关节空间与笛卡尔空间的位置/速度信息),探索在大规模、多任务示范下实现零样本或少量样本的任务迁移。同时,数据集内嵌的丰富元数据(如语言指令、任务类别、采集环境标识)正推动着语言条件策略与领域随机化方法的革新,使机器人能够理解复杂指令并适应变化的物理环境。这一资源不仅加速了机器人基础模型(如RT-2、Octo)的迭代,更通过Apache-2.0许可促进了工业与学术界的协同创新,为迈向通用具身智能体树立了数据密集型研究的新范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务