task10-move-to-beaker-storage-shelf
收藏官方服务:
资源简介:
该数据集是一个机器人操作数据集,使用LeRobot工具创建,包含1177个训练情节,总计300,605帧数据,帧率为30 fps。数据以分块形式存储,每个分块包含1000个样本,数据文件总大小约100 MB,关联的视频文件总大小约200 MB,专为移动AI机器人(mobileai_robot)设计,适用于机器人学习任务。核心特征包括:动作(16维浮点数组编码左右机械臂各6个关节的位置、左右滑车关节位置,以及机器人在x方向和旋转方向的速度)、状态观测(与动作结构相同的16维浮点数组,记录机器人自身关节状态)、视觉观测(三个视角的RGB视频流,分辨率均为640x480,来自高位摄像头、左腕摄像头和右腕摄像头)、元数据(时间戳、帧索引、情节索引、全局索引和任务索引)。该数据集的结构化多模态数据适用于机器人模仿学习、强化学习、行为克隆等研究领域,旨在促进机器人操作技能的端到端学习,采用Apache-2.0许可协议。
创建时间:
2026-07-10
原始信息汇总
数据集概述:gistailab/task10-move-to-beaker-storage-shelf
- 许可证:Apache-2.0
- 任务类别:机器人学 (robotics)
- 标签:LeRobot
- 创建工具:LeRobot
数据集结构
| 属性 | 值 |
|---|---|
| 代码库版本 | v3.0 |
| 机器人类型 | mobileai_robot |
| 总 episode 数 | 1,177 |
| 总帧数 | 300,605 |
| 总任务数 | 1 |
| 分块大小 | 1,000 |
| 数据文件大小 | 100 MB |
| 视频文件大小 | 200 MB |
| 帧率 (FPS) | 30 |
| 划分 | 训练集:0:1177(全部数据用于训练) |
特征
- 动作 (action):
- 类型:float32
- 维度:16
- 包含:左右各6个关节位置、左右各1个 carriage 关节位置、线速度 (x.vel)、角速度 (theta.vel)
- 观察状态 (observation.state):
- 类型:float32
- 维度:16
- 结构与 action 相同
- 观察图像 (observation.images):
cam_high:高度480、宽度640、3通道,H.264编码,30 FPScam_left_wrist:高度480、宽度640、3通道,H.264编码,30 FPScam_right_wrist:高度480、宽度640、3通道,H.264编码,30 FPS
- 时间戳 (timestamp):float32,维度1
- 帧索引 (frame_index):int64,维度1
- episode 索引 (episode_index):int64,维度1
- 索引 (index):int64,维度1
- 任务索引 (task_index):int64,维度1
数据路径
- 数据文件:
data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet - 视频文件:
videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4
可视化
- 使用 LeRobot 可视化空间 查看数据集。
引用
- BibTeX:[需要更多信息]
搜集汇总
数据集介绍

构建方式
在机器人学习领域,精细化的操作数据集是推动模仿学习与强化学习发展的关键基石。该数据集基于LeRobot框架构建,旨在记录移动机械臂执行“将烧杯转移至存储架”这一特定任务的完整过程。数据集共包含1177个演示回合,总计300605帧数据,所有数据均以30帧每秒的速率采集。数据存储采用分块Parquet格式,其中元数据信息由`info.json`文件统一管理,明确标注了机器人类型(mobileai_robot)及训练集划分(全部数据用于训练)。此外,同步记录的还有来自三个视角的H.264编码视频流,覆盖了高清俯视相机以及左右手腕相机,从而为多模态感知研究提供了丰富素材。
使用方法
使用者可通过Hugging Face的`datasets`库直接加载该数据集,并结合LeRobot生态进行模型训练。加载时需指定`task10-move-to-beaker-storage-shelf`名称,并利用其预定义的数据结构便捷地分离动作、观测状态及图像帧。为便于快速评估,数据集已提供可视化工具链接,允许用户直观预览演示片段。在模型开发中,推荐将该数据集的全部1177个回合作为训练集,依据其Parquet分区索引进行高效的数据流式读取。图像数据需通过视频解码转换为张量后输入策略网络,而16维的动作与状态向量则可直接用于基于状态或视觉的运动规划模型训练。
背景与挑战
背景概述
该数据集由gistailab团队基于LeRobot框架创建,专为机器人操作任务设计,核心研究问题聚焦于使机器人学会将烧杯移动到存储架上的精细操作。数据集创建于2024年左右,共有1177个演示片段和超过30万帧数据,每帧包含16维动作和状态信息,以及三个视角的视觉图像。这一数据集填补了机器人领域在特定实验室操作任务上的数据空白,为模仿学习与强化学习算法提供了标准化训练基础,推动了机器人技能泛化与自主执行能力的发展。
当前挑战
面临的领域挑战在于机器人精细化操作中的运动规划与感知融合,如多关节协同控制、物体识别与定位误差的补偿。构建过程中,挑战包括数据采集环境的非结构化造成演示质量不均衡,视频与状态数据需精确同步,以及高帧率(30fps)下多通道数据(16维动作、三个摄像头)的存储与标定。此外,不同机器人实体间视角与运动学的差异,使得数据集迁移至新平台时面临领域适应难题,且系统缺少元数据(如无关联论文),增大了研究复现与实验对比的难度。
常用场景
经典使用场景
在机器人操作领域,task10-move-to-beaker-storage-shelf数据集为模仿学习与行为克隆范式提供了高保真的训练素材。该数据集记录了移动机械臂在仓储环境中执行“抓取烧杯并放置至置物架”任务的完整流程,涵盖1177条示范轨迹,每条轨迹包含16维关节空间动作、状态信息以及三视角高清视觉观测。研究者可基于该数据训练端到端或层次化的策略网络,使机器人学会从视觉输入直接映射到精确的关节控制指令,尤其适用于研究多指灵巧手与移动底盘协同操作的任务场景。
解决学术问题
该数据集核心解决了机器人领域中复杂长程操作任务的示范学习难题。传统方法依赖手工设计的奖励函数或昂贵的运动规划,难以泛化至多变的物体摆放场景。此数据集通过大规模人工示教数据,为研究如何从有限样本中提取可迁移的操作技能提供了基准。其意义在于推动了无模型模仿学习在真实机器人上的应用,使学术社区能够系统性地对比不同网络架构、数据增强策略以及多模态融合方法在精细操作任务上的表现,加速了机器人物体操纵理论的发展。
实际应用
在智能制造与仓储物流场景中,该数据集训练的策略可直接部署于自动化产线的拣选与放置环节。例如,移动机械臂在接收到“将某规格烧杯转移至指定货架”的指令后,能自主完成环境感知、路径规划与精准释放。此外,该技术可延伸至实验室自动化领域,协助完成样品盛放器具的标准化归位操作,降低人工重复劳动的强度。结合多视角视觉系统,其鲁棒性足以应对光照变化与部分遮挡等实际挑战,具备较高的工程转化价值。
数据集最近研究
最新研究方向
在具身智能与机器人操作领域,高质量示范数据集正成为推动模仿学习与行为克隆算法突破的关键驱动力。该数据集聚焦于'将物品移至柜架'这一精细操作任务,依托LeRobot框架采集了超千条、逾三十万帧的多视角视觉-运动联合序列,涵盖了双机械臂的16维关节与速度控制指令。其研究前沿紧密关联到基于视觉语言模型的泛化操作策略,尤其是利用大规模同构数据集进行跨任务迁移学习,以应对仓储物流中的非结构化场景。此类密集状态-动作对的公开资源,为探索机器人从示范中理解空间关系、抓取姿态与轨迹规划的因果逻辑提供了坚实基底,有望加速自主学习系统在复杂工业环境中的部署与泛化落地。
以上内容由遇见数据集搜集并总结生成



