遇见数据集

yongjincho/d3il_sorting_6

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人学数据集,使用LeRobot工具创建,专注于模仿学习任务。数据集包含1661个总集数,846405个总帧数,帧率为29 fps。机器人类型为franka_panda,数据以parquet格式存储,视频文件以mp4格式存储。数据集特征包括观察状态(22维浮点数)、动作(2维浮点数)、两个摄像头图像(bp_cam和inhand_cam,均为96x96x3的视频数据),以及时间戳、帧索引、集索引、索引和任务索引等元数据。数据集仅包含一个任务,用于训练目的,并遵循MIT许可证。

This dataset is a robotics dataset created using the LeRobot tool, focusing on imitation learning tasks. It contains a total of 1661 episodes, 846405 frames, with a frame rate of 29 fps. The robot type is franka_panda, and the data is stored in parquet format, with video files in mp4 format. Dataset features include observation state (22-dimensional float), action (2-dimensional float), two camera images (bp_cam and inhand_cam, both video data of size 96x96x3), and metadata such as timestamp, frame index, episode index, index, and task index. The dataset includes only one task, intended for training purposes, and is licensed under MIT.

提供机构:
yongjincho
搜集汇总
数据集介绍
yongjincho/d3il_sorting_6 数据集图片
构建方式
d3il_sorting_6数据集是基于LeRobot框架构建的机器人模仿学习数据集,旨在为机器人分拣任务提供标准化训练数据。该数据集通过Franka Panda机械臂在真实环境中执行分拣操作,收集了1661个示范片段,共计846405帧数据。数据以Parquet格式存储,并采用分块方式组织为多个chunk文件,同时包含了来自bp_cam和inhand_cam两个视角的H.264编码视频,分辨率为96x96像素。示范频率设定为29帧每秒,确保动作序列的高时间分辨率。
特点
该数据集的核心特点在于其丰富的多模态信息与精细的状态表征。每个样本包含22维的机器人状态观测数据(涵盖关节角度、末端执行器位姿等关键参数)以及2维的驱动动作指令。双摄像头视觉输入(基础视角与手部视角)为模仿学习提供了环境与操作细节的双重观测通道。数据集的压缩存储策略高效,总视频文件约200MB,数值数据约100MB,同时设置1000帧的chunk_size以支持大规模流式训练。训练集涵盖全部1661个片段,无额外验证集划分。
使用方法
使用该数据集时,研究者可通过LeRobot库加载Parquet数据与同步视频帧,构建模仿学习或离线强化学习范式。数据特征字段包括'observation.state'(状态)、'action'(动作)及'observation.images'(视觉观测),可直接映射为策略网络的输入-输出对。建议首先解压数据文件并利用LeRobot的dataset接口建立DataLoader,按episode_index索引完整的示范轨迹。视频数据需解码为张量格式,与状态信息对齐后用于训练基于视觉的动作生成模型,例如行为克隆或扩散策略算法。
背景与挑战
背景概述
在机器人学习领域,模仿学习通过在专家演示中提取行为策略,已成为赋予机器人复杂操作能力的重要途径。由Yongjin Cho等人创建的d3il_sorting_6数据集,依托LeRobot框架于近年发布,聚焦于利用Franka Panda机械臂执行物体分类与摆放任务。该数据集包含1661个演示片段与超过84万帧的观测数据,通过双视角视觉输入(基座相机与手部相机)和22维状态信息,为从多模态感知到精准动作映射的研究提供了标准化基准。其以MIT许可协议开放,推动了模仿学习在工业分拣场景中的可重复性研究,对机器人操作技能的泛化性探索具有奠基意义。
当前挑战
该数据集旨在解决机器人执行物体分类与排序操作时的核心难题,即如何从高维视觉与状态信息中学习稳健的闭环控制策略。其领域挑战在于应对非结构化环境中物体姿态的多样性、光照变化以及抓取点的不确定性,同时需在仅有2维低层动作空间(如夹爪位移)下实现毫秒级决策。构建过程中,数据采集面临专家演示质量的标准化难题,包括机械臂23个关节角与末端执行器状态的一致性标注,以及多视角视频流与力觉、触觉信号的同步校准。此外,96×96像素的低分辨率图像虽降低存储开销,却加剧了特征提取与细粒度操作认知之间的权衡,对后续策略的鲁棒性提出考验。
常用场景
经典使用场景
在机器人学习与模仿学习的研究疆域中,d3il_sorting_6数据集承载着对精细操作技能的深度探索。该数据集以Franka Panda机械臂为执行载体,精心采集了1661个关于物体分类与整理任务的演示轨迹,每个轨迹均融合了双视角视觉观测(基线摄像头与手部摄像头)以及22维度的机器人状态信息。其最经典的使用场景在于训练基于视觉的模仿学习模型,使机器人能够习得从高维感知到精准动作的映射关系,为灵巧操作研究提供了标准化的训练与评估基准。
衍生相关工作
d3il_sorting_6数据集作为d3il系列的重要组成部分,已催生了一系列富有影响力的研究工作。其中最引人注目的是基于扩散策略的模仿学习框架,该框架利用数据集中丰富的视觉与状态序列,生成了高保真度的动作轨迹。此外,数据集中多视角视觉信息的引入,促使研究者开发了跨视角特征对齐与信息融合算法,显著提升了策略对视角变化的鲁棒性。这些衍生工作不仅验证了数据集在物理机器人操作任务中的有效性,也为后续的跨任务迁移学习与多机器人协作研究奠定了坚实的数据基础。
数据集最近研究
最新研究方向
在机器人学习领域,d3il_sorting_6数据集为模仿学习与灵巧操作研究提供了高质量的基准资源。该数据集基于Franka Panda机器人平台,采集了1661个轨迹片段与超过84万帧视觉-动作序列,涵盖物件分类与摆放的精细化操作任务。当前前沿方向聚焦于利用此类多模态数据训练通用操作策略,提升机器人在非结构化环境中的泛化与鲁棒性。通过与LeRobot框架深度集成,研究者可便捷地进行行为克隆、逆强化学习及离线强化学习的算法验证,推动具身智能从模拟向真实世界迁移的进程。该数据集的高采样频率与双视角视觉输入,尤其适合探索视触融合、时序一致性建模及高精度控制等关键挑战,对实现工业生产中的自动化分拣与柔性装配具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务