遇见数据集

klcantrell/so101_spam_musubi_pick_and_place_spam_left_task

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人操作数据集,专注于拾放任务,具体任务为spam_musubi_pick_and_place_spam_left_task。它使用so_follower机器人类型,包含6个episodes,总计5380帧,帧率为30fps。数据以parquet格式存储,包括动作数据(如肩部、肘部、腕部和夹爪的位置)、状态观测(与动作相同的关节位置)、以及来自三个摄像头视角的视频观测(overhead、base和wrist,每个视频分辨率为1080x1920,3通道,编码为av1)。此外,数据集还包含时间戳、帧索引、episode索引等元数据。该数据集适用于机器人学习、模仿学习或强化学习任务。

This dataset is a robotics manipulation dataset focused on a pick and place task, specifically the spam_musubi_pick_and_place_spam_left_task. It uses the so_follower robot type and contains 6 episodes with a total of 5380 frames at 30fps. The data is stored in parquet format and includes action data (e.g., positions of shoulder, elbow, wrist, and gripper), state observations (joint positions identical to actions), and video observations from three camera views (overhead, base, and wrist, each with 1080x1920 resolution, 3 channels, encoded in av1). Additionally, the dataset includes metadata such as timestamps, frame indices, and episode indices. It is suitable for robotics learning, imitation learning, or reinforcement learning tasks.

提供机构:
klcantrell
搜集汇总
数据集介绍
klcantrell/so101_spam_musubi_pick_and_place_spam_left_task 数据集图片
构建方式
该数据集依托LeRobot框架构建,针对SO-101型机器人执行午餐肉饭团抓取与放置任务(左侧)的场景进行数据采集。数据集包含12个演示片段,总计10114帧画面,以30帧/秒的采样频率记录。每个片段均涵盖6维关节角度动作序列(肩部旋转、肩部抬升、肘部弯曲、腕部弯曲、腕部转动及夹爪开合)与对应的本体感知状态,并同步捕获顶置、基座和腕部三个视角的高清视频流(1080×1920分辨率,AV1编码)。元数据以JSON格式存储于info.json中,运动数据以Parquet格式分块存储,视频则以MP4格式独立归档。
特点
该数据集在机器人操作学习领域展现出鲜明特色。其一,多模态感知数据的高度协同——六维状态向量与三路高清视觉流在时间轴上严格对齐,为模仿学习与行为克隆算法提供了完整的观测空间。其二,单人单任务专注性设计,仅聚焦于午餐肉饭团在左侧工作区的拾取与放置操作,每个动作序列精确标注了关节空间轨迹,剔除了无关干扰。其三,视频数据采用AV1编码压缩,在保持高画质的同时大幅降低存储开销,而Parquet格式的运动数据则便于高效的批量读取与处理。
使用方法
研究者可通过LeRobot生态工具直接加载该数据集,调用可视化界面(部署于HuggingFace Spaces)对每一帧的机器人状态与相机视角进行实时回放。在模型训练时,可将action字段作为策略学习的目标输出,observation.state与observation.images特征作为输入,构建端到端的机器人操控模型。数据集采用单任务训练集拆分(第0至11个片段),便于快速验证算法性能。此外,关节名称(如shoulder_pan.pos)与传感器参数均以元数据形式明确提供,降低了数据预处理门槛,利于研究工作的复现与扩展。
背景与挑战
背景概述
在机器人学习领域,灵巧操作任务(如抓取与放置)一直是研究的热点与难点,其核心在于如何通过有限的数据驱动模型实现精准、鲁棒的物体交互。so101_spam_musubi_pick_and_place_spam_left_task数据集由研究人员klcantrell于近期创建,基于LeRobot框架构建,专门针对“左手抓取与放置午餐肉饭团”这一细粒度操作任务。该数据集包含12个演示片段、共计10114帧的高频(30fps)多视角视觉与运动状态数据,涵盖顶视、基座及腕部三路高清视频流以及六维关节位姿序列,为模仿学习与强化学习算法提供了标准化的物理动作空间基准。其发布填补了食品类柔性物体精细化操作场景中公开数据集的空白,推动了机器人从结构化抓取向非结构化日常任务泛化的研究进程。
当前挑战
该数据集所应对的领域核心挑战在于:食品类柔性物体(如饭团)在抓取过程中形态易变、粘附性强,传统刚性夹爪或力学模型难以模拟其与环境的非线性交互,导致成功率与一致性极低;同时,单任务、单机械臂(so_follower)的场景设计限制了模型对多任务或跨构型泛化的能力。在构建过程中,研究者需克服数据采集的重复性与随机性矛盾——即为保证12个演示片段覆盖足够的状态多样性,需人工调整初始摆放姿态与机器人轨迹;此外,多模态传感器同步、30fps高频视频录制下的存储压力、以及使用AV1编解码对实时解析效率的潜在影响,均是实际部署中的工程挑战。
常用场景
经典使用场景
在机器人操作领域,so101_spam_musubi_pick_and_place_spam_left_task数据集专为模仿学习与示教任务设计,其经典使用场景集中于抓取与放置操作。该数据集记录了12个完整示教回合,包含超过一万帧高帧率(30fps)动作序列,涵盖肩部、肘部、腕部及夹爪的六维连续动作空间。借助多视角视觉输入(包括顶部、基座和腕部三个摄像头),研究者能够训练机器人从状态到动作的映射模型,实现从人类示教中自主习得精准的拾取与放置技能。
实际应用
在实际工业与家庭服务场景中,此数据集训练的机器人可胜任流水线物料分拣或厨房食物摆放等精细操作任务。通过示教学习,机械臂能够理解“拿起”与“放置”之间的物理约束,例如调整夹爪力度以避免损坏易碎物品,或依据视觉反馈修正动作轨迹。这一能力对于电子元件装配、医疗用品处理乃至老年人辅助生活等对精度和安全性要求极高的应用领域具有重要价值,显著降低了传统示教编程的复杂度和部署时间。
衍生相关工作
基于该数据集,研究者已衍生出多项开创性工作,例如利用扩散策略模型生成平滑的动作概率分布,以及结合Transformer架构的模仿学习框架来捕捉长程任务依赖。此外,该数据集常被用于验证数据增强方法对机器人泛化性能的提升效果,或作为基准在对比强化学习与行为克隆算法时使用。这些工作不仅推动了LeRobot开源生态的发展,也为构建统一机器人学习基准库奠定了坚实的数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务