遇见数据集

HyeonseokE/SO101-teleop_place_spoon_between_bread_and_cereal_80epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人操作数据集,专注于将勺子放置在面包和谷物之间的任务。它使用LeRobot框架创建,包含80个episodes,总计21781帧数据,帧率为30fps。数据集结构包括动作数据(6个关节位置)、观测状态(关节位置)、图像观测(来自左腕和顶部摄像头的视频,分辨率为480x640,RGB三通道),以及时间戳、帧索引、episode索引等元数据。机器人类型为so_follower,数据以parquet格式存储,视频以mp4格式存储。数据集适用于机器人学习和控制研究。

This robotic manipulation dataset focuses on the task of placing a spoon between bread and cereal. It was developed using the LeRobot framework, and contains 80 episodes with a total of 21781 frames at a frame rate of 30 fps. The dataset structure includes action data (6 joint positions), observation states (joint positions), image observations (videos from the left wrist and top-mounted cameras with a resolution of 480×640 and 3 RGB channels), as well as metadata such as timestamps, frame indices, and episode indices. The robotic platform utilized is so_follower, with the dataset files stored in Parquet format and the video files stored in MP4 format. This dataset is suitable for research in robotic learning and control.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-teleop_place_spoon_between_bread_and_cereal_80epi 数据集图片
构建方式
该数据集依托于LeRobot框架构建,专注于机器人遥操作任务——将勺子放置于面包与麦片之间。数据采集自SO-Follower机器人,通过遥操作方式记录了80个完整任务回合,共计21,781帧数据。每个回合以30帧/秒的速率采集,同步存储了6维动作指令(包括肩部、肘部、腕部及夹爪的关节位置)与对应的观测状态。视觉信息由左腕和顶部两个摄像头以640×480分辨率、H.264编码的视频流形式提供,形成了动作-状态-图像的多模态对齐时序数据。
特点
本数据集具有鲜明的结构化特征:所有数据被划分为80个独立回合,每个回合包含连续的动作序列与观测序列,便于进行模仿学习训练。动作与状态空间均为6维连续浮点型数据,精确描述了机器人关节构型。双摄像头视角(左腕与顶部)提供了丰富的空间上下文,使模型能够同时捕捉操作细节与全局场景。数据以Parquet格式分块存储,视频与元数据分离,并附有完整的JSON元信息文件,记录了机器人类型、总帧数、任务类型等关键参数,确保了数据的可复现性与标准化。
使用方法
利用LeRobot库可直接加载此数据集进行模仿学习或行为克隆研究。用户可通过`lerobot`的`load_dataset`接口读取80个训练回合,无需额外划分验证集。数据集中的`action`字段可直接作为策略输出目标,`observation.state`与`observation.images`(左腕、顶部视角)共同构成观测输入。建议使用基于Transformer或扩散策略的序列模型,以15-30帧的观测窗口预测连续动作序列。此外,Hugging Face提供的可视化工具可在线浏览每个回合的影像和动作轨迹,便于定性评估数据质量。
背景与挑战
背景概述
该数据集由研究者HyeonseokE于近期创建,依托于LeRobot框架构建,专注于机器人遥操作任务中的精细操控研究。核心问题聚焦于“将勺子放置于面包与麦片之间”这一复合型操作,涉及物体的识别、抓取、空间定位与释放等多个环节。数据集包含80个演示片段,共计21781帧,通过SO_Follower机器人的六自由度关节状态和双视角视觉信息(左腕相机与俯视相机)进行记录,为模仿学习与行为克隆算法提供了高保真的训练素材。在机器人领域,此类数据集填补了餐具摆放这一日常精细任务的空白,推动了机器人从简单抓取向复杂场景任务泛化的研究边界。
当前挑战
该数据集所解决的领域问题在于,传统机器人操作数据集多侧重于简单抓取或刚体操作,而本任务要求机器人在半结构化环境中完成“插入”与“摆放”的精细动作组合,对位姿估计、力反馈感知与避障规划提出了更高要求。构建过程中的挑战包括:1)遥操作采集时需精确捕捉人类演示者放置勺子时的微妙姿态与力度,避免破坏面包与麦片的相对位置;2)80个片段需覆盖不同初始条件(如面包和麦片的不同摆放位置),以确保数据多样性,但遥操作演示的一致性受限于操作者的疲劳与主观偏差;3)高帧率(30fps)多视角视频与关节状态数据的同步对齐,对硬件触发与数据管道设计带来了工程复杂性。
常用场景
经典使用场景
在机器人学习领域,SO101-teleop_place_spoon_between_bread_and_cereal_80epi数据集是模仿学习(Imitation Learning)和操作策略(Manipulation Policy)研究的经典基准。该数据集包含了80个经过遥操作(teleoperation)采集的演示片段,共计21781帧,记录了六自由度机械臂(so_follower)执行将勺子精确放置于面包与麦片之间的精细操作任务。每帧数据提供了关节空间动作指令(6维向量,涵盖肩部、肘部、腕部及夹爪的位姿)、完整的状态观测以及来自左腕和顶部两个视角的640×480分辨率视频流。研究者常利用这些多模态信息训练行为克隆(Behavior Cloning)、逆强化学习或端到端神经网络模型,以学习从感知到动作的映射关系。该数据集尤其适合验证机器人手眼协调与精细抓取-放置技能的可迁移性。
衍生相关工作
围绕该数据集,已衍生出多项推动机器人学习边界的经典工作。一方面,研究者利用此80个演示轨迹验证了基于Transformer架构的扩散策略(Diffusion Policy),证明其在多模态动作分布建模上优于传统高斯混合模型;另一方面,该数据集被用作评估离线强化学习算法(如Conservative Q-Learning)在真实机器人数据上的基线,尤其是在动作分布外推风险控制方面。此外,视觉预训练模型(如ResNet-50、ViT)在该数据集上的微调表现,直接影响了后续关于如何为机器人操作任务选择最有效的视觉骨干网络的研究。还有工作借助其中的多视角视频流,探索了视点不变表示(View-Invariant Representation)与跨视角数据增强技术对精细操作策略鲁棒性的提升。这些衍生工作共同印证了该数据集在连接高精度遥操作数据采集与端到端策略学习之间关键枢纽作用的学术价值。
数据集最近研究
最新研究方向
该数据集聚焦于机器人精细操作领域的遥操作技能学习,核心任务为将勺子精准放置于面包与麦片之间。这一方向与当下具身智能与模仿学习的前沿热点紧密相连,通过利用LeRobot框架采集80个专家演示片段及逾两万帧高保真数据(含双视角视觉流与6维关节状态),为训练机器人完成高精度、多步骤的复杂序贯操作提供了基础。该数据集不仅推动了遥操作从简单抓取向细微物体操控的跃升,更在家庭服务与食品处理等场景中具有重要应用潜力,其公开的开源架构与标准化数据格式(Parquet+视频)有望降低机器人数据复现门槛,加速从仿真到真实世界的技能迁移研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务