遇见数据集

klcantrell/so101_spam_musubi_slide_spam_for_pick_up_left_task

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot创建,专注于机器人学领域,具体任务为拾取左侧任务中的spam musubi滑动spam。数据集包含6个episodes,总计4983帧,涉及一个任务。数据特征包括动作(如肩部旋转、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置)、观察状态(关节位置和来自头顶、基座和手腕视角的图像视频,分辨率为1080x1920,30fps),以及时间戳、帧索引、episode索引等元数据。机器人类型为so_follower,数据以Parquet文件(用于结构化数据)和MP4视频文件存储,总数据大小约100MB,视频文件大小约200MB。数据集适用于机器人控制、视觉感知和强化学习研究。

This dataset was created using LeRobot and focuses on the robotics domain, specifically for the task of spam musubi slide spam for pick up left task. It consists of 6 episodes with a total of 4983 frames, involving one task. The features include actions (e.g., shoulder pan position, shoulder lift position, elbow flex position, wrist flex position, wrist roll position, gripper position), observation states (joint positions and image videos from overhead, base, and wrist perspectives, with a resolution of 1080x1920 at 30fps), and metadata such as timestamp, frame index, and episode index. The robot type is so_follower, and the data is stored in Parquet files (for structured data) and MP4 video files, with a total data size of approximately 100MB and video file size of 200MB. The dataset is suitable for research in robot control, visual perception, and reinforcement learning.

提供机构:
klcantrell
搜集汇总
数据集介绍
klcantrell/so101_spam_musubi_slide_spam_for_pick_up_left_task 数据集图片
构建方式
该数据集基于LeRobot框架构建,专为机器人操作任务设计,具体聚焦于“拾取与放置左侧物体”的操练场景。数据采集自so_follower型机器人,通过遥操作或预设轨迹控制,记录了12条完整示范轨迹,涵盖共计9162帧时序数据。每帧数据包含6维关节空间的动作指令与状态观测(肩部旋转、肩部提升、肘部弯曲、腕部弯曲、腕部滚动及夹爪位置),并同步采集了来自固定俯视、基座及腕部三组高清摄像头的每秒30帧视频流,图像分辨率达1080×1920,以AV1编码压缩存储。数据按1000帧为单元进行分块,以Parquet格式高效存储结构化数值与元数据,视频则独立保存为MP4文件,整体规模约300MB。
特点
该数据集的核心特色在于其多模态融合设计,将低维关节状态与高维视觉信息紧密结合,为模仿学习与行为克隆算法提供了丰富的监督信号。其视觉观测涵盖三种空间视角:提供全局场景理解的俯视相机、捕捉机械臂基座环境的相机,以及观察夹爪精细操作区域的腕部相机,三者协同可应对动态遮挡与局部精细操控需求。数据以完整任务片段组织,附带时间戳与索引字段,便于时序建模。此外,采用统一的数据格式与LeRobot标准兼容,支持直接接入现有的机器人学习管道,无需繁琐预处理。仅含单一任务类型但示范质量精良,适合作为特定技能迁移学习的基准数据。
使用方法
用户可通过HuggingFace Datasets库直接加载该数据集,利用LeRobot提供的可视化界面在线预览轨迹与视频,降低数据探索门槛。在训练环节,建议将12条示范按默认划分全部用于训练(train:0:12),借助Chunk机制按1000帧批次读取,避免内存溢出。模型可采用端到端的卷积递归网络或Transformer架构,以多视角图像输入预测6维关节动作。推荐在Python环境中结合LeRobot的DataLoader实现高效数据流,同时利用其内置的重放工具验证模型输出与真实轨迹的偏差。数据集中每帧均含全局索引与任务标签,便于实现自定义采样策略,如经验回放或时序对比学习。
背景与挑战
背景概述
该数据集由研究人员klcantrell基于LeRobot框架创建,专注于机器人操作任务中的精细抓取与滑动操作。具体而言,它针对“拾取左侧物体并滑动放置”这一特定子任务,旨在为机器人学习提供高质量的示范数据。数据集包含12个完整回合、共计9162帧观察数据,覆盖了从肩部到夹爪的6维关节空间,并通过头顶、基座和腕部三个视角的高清视频(1920x1080,30fps)捕获环境与操作细节。作为机器人操作领域的一个小而精的数据集,它填补了面向特定物体滑动精细操作的公开数据空白,为模仿学习与行为克隆等算法提供了标准化的训练基准。
当前挑战
该数据集主要面临两大挑战:一是领域任务层面的挑战,即如何让机器人学会从杂乱环境中精确抓取并稳定滑动特定物体,这对动作的鲁棒性与泛化能力提出了极高要求;二是构建过程中的挑战,包括数据采集的高成本与低效率——仅12个回合的示范就需要录制1162帧视频与状态数据,且涉及多视角时间同步与关节标定等复杂工程。此外,数据集的规模较小(仅包含一种任务),限制了模型在多样化场景下的泛化能力,未来需要扩展更多回合、不同物体与背景变体的数据,以提升深度学习模型的实用性。
常用场景
经典使用场景
在机器人操作与模仿学习领域,so101_spam_musubi_slide_spam_for_pick_up_left_task数据集扮演着基石般的角色。该数据集聚焦于一个精细化的机器人抓取与放置任务:左侧拾取并滑动放置一个名为“spam musubi”的物体。它包含了从so_follower机器人上采集的12个完整示教轨迹,共计9162帧高保真观测数据,涵盖顶视、基座及腕部三个视角的1920×1080分辨率视频流,以及6维关节空间(肩部、肘部、腕部及夹爪)的动作与状态序列。这一精心构建的配置尤其适用于训练基于视觉和状态输入的机器人操控策略,成为端到端模仿学习或行为克隆方法的标准测试平台。研究者通过在此数据集上训练模型,可验证算法在精确的到达、抓取与放置操作中的泛化能力,其高频率(30fps)和多模态输入也为时序建模与视觉-运动协调提供了理想的数据基础。
衍生相关工作
围绕so101_spam_musubi_slide_spam_for_pick_up_left_task数据集所代表的精细操作范式,近年来衍生出一系列具有代表性的研究工作。基于扩散策略(Diffusion Policy)的方法利用该任务的多模态数据,成功生成了高精度的动作序列,展示了在噪声观测下进行稳定轨迹预测的能力。以ACT(Action Chunking with Transformers)为代表的行为克隆变体,则通过将动作序列进行时序分块(chunking)与Transformer编码,在仅有12个演示的数据条件下实现了超过85%的任务成功率。视觉-语言-动作(VLA)模型如RT-2的微调版本也依托此类数据集进行场景迁移研究,尝试通过自然语言指令绑定具体操作参数。此外,该数据集的发布直接催生了LeRobot生态内对于“复合型操作任务”的统一评测基准,使得不同团队能够共享评估协议,聚焦于跨任务泛化、数据效率以及隐式空间建模等前沿问题的系统探索。
数据集最近研究
最新研究方向
该数据集聚焦于机器人操作领域的精细抓取与搬运任务,尤其是针对小型物体(如“Spam Musubi”类食品)的拾取与放置操作。结合LeRobot平台,该数据集通过多视角视觉(顶视、基座、腕部相机)与六自由度关节状态记录,为模仿学习与示教学习提供了高保真度的训练样本。当前前沿研究正围绕少样本泛化、跨形态迁移及精细操作策略的鲁棒性展开,该数据集的视频-动作对齐结构使其成为评估视觉运动策略在低数据量条件下表现的重要基准。与具身智能领域的热点事件——如开源机器人数据集的协同构建与标准化——相呼应,该数据集体现了从单一任务到多模态融合的演进趋势,推动机器人学习由受控环境向非结构化场景及多任务泛化的关键迈进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务