遇见数据集

HyeonseokE/SO101-cap_place_spoon_between_bread_and_cereal_20epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人操作数据集,使用LeRobot框架创建,专门针对SO101型机器人(follower版本)设计。数据集包含20个完整的情节(episodes),总计6776帧数据,聚焦于单一任务:将勺子放置在面包和麦片之间。数据以Parquet文件格式存储,并包含视频文件(MP4格式),帧率为10 FPS。数据集结构丰富,包括机器人的状态观察(如关节位置、末端执行器位置、夹爪状态)、动作指令、多视角图像观察(如顶部摄像头和左腕摄像头视频),以及技能相关的自然语言描述、验证问题、目标位置等信息。这些特征支持机器人学习任务,如模仿学习或强化学习,适用于机器人控制研究。

This dataset is a robotics manipulation dataset created using the LeRobot framework, specifically designed for the SO101 robot (follower version). It contains 20 complete episodes, totaling 6776 frames, and focuses on a single task: placing a spoon between bread and cereal. The data is stored in Parquet format and includes video files (MP4 format) with a frame rate of 10 FPS. The dataset has a rich structure, encompassing robot state observations (e.g., joint positions, end-effector positions, gripper status), action commands, multi-view image observations (e.g., videos from a top camera and a left wrist camera), and skill-related information such as natural language descriptions, verification questions, and goal positions. These features support robot learning tasks, such as imitation learning or reinforcement learning, making it suitable for robotics control research.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-cap_place_spoon_between_bread_and_cereal_20epi 数据集图片
构建方式
在机器人操作任务日益复杂的背景下,本数据集专为模仿学习研究而构建,聚焦于将勺子精确放置于面包与谷物之间的精细操作。数据集利用SO101型跟随机器人进行数据采集,共记录20个完整操作回合(episode),包含6776帧连续状态与动作序列。通过LeRobot框架完成标准化处理,数据以Parquet格式分块存储于1000帧大小的枚举文件中,同时将机器人顶部与左腕视角的640×480分辨率视频以H.264编码同步录制,形成多模态观测与动作指令的精细对齐数据流。
特点
数据集最显著的特征在于其高保真的状态-动作空间表征。观测状态包含6维关节位置(肩部旋转、举升、肘部弯曲、腕部屈伸、腕部旋转及夹爪开合)以及6维末端执行器位姿(XYZ坐标与欧拉角),动作指令与状态维度完全一致,便于直接学习操作策略。此外,数据还配备了结构化元信息,包括自然语言技能描述(如'将勺子放在面包与谷物之间')、子任务目标位置、验证问题及技能进度,为多模态任务分解与推理研究提供了丰富注释。
使用方法
数据集已完全兼容LeRobot框架,用户可通过HuggingFace Dataset库直接加载。训练时建议将全部20个回合作为训练集,利用提供的图像与状态特征进行视觉-运动策略学习。视频数据以10FPS的固定帧率存储,需注意使用H.264编解码器读取。对于细粒度分析,可借助chunks_size参数控制分块加载大小,并利用skill.natural_language和subtask.natural_language字段进行语义条件化策略训练或任务验证问答场景的构建。
背景与挑战
背景概述
该数据集由HyeonseokE等人于近期创建,依托于LeRobot开源框架,专注于细粒度机器人操作技能的学习与迁移。其核心研究问题在于如何通过多模态感知数据(包括高分辨率视觉图像与六维关节状态信息)使机器人精确执行“将勺子放置在面包与麦片之间”这类结构化桌面任务。数据集包含20个演示回合、6776帧时序数据及6725条自然语言指令标注,为模仿学习与技能分解提供了标准化基准。作为面向实体操作(SO101)场景的首批公开数据集之一,它在机器人行为克隆、多任务泛化以及细粒度技能理解领域具有重要推动价值,尤其在探索如何将语言指令与低层级运动控制有效对齐方面提供了关键数据支撑。
当前挑战
该数据集所处的领域挑战集中于两大层面。在任务层面,机器人需在复杂背景中区分面包、麦片、勺子等精细物体,并完成在三维空间中将勺子精确置于两者间隙的连续动作,这对视觉语义理解、抓取规划与柔性轨迹控制提出严苛要求。在构建层面,数据采集需应对同步多相机流(顶部与左腕视角)、六维关节序列与自然语言标签的高精度对齐难题,同时确保20个回合中动作策略的一致性与系统抗干扰能力。此外,元信息中仅划分了训练集而未含验证集,使得模型在有限样本下的泛化性能评估与过拟合规避成为后续研究的关键瓶颈。
常用场景
经典使用场景
在机器人学习与操控领域,SO101-cap_place_spoon_between_bread_and_cereal_20epi数据集为模仿学习与行为克隆提供了极具价值的基准资源。其经典使用场景聚焦于教导机械臂执行精细的餐具放置任务——将勺子精准插入面包与麦片之间的特定位置。数据集包含20个完整演示片段,共计6776帧高保真状态-动作序列,涵盖六自由度关节位置、末端执行器姿态、夹爪状态以及来自顶部和左手腕的双视角视觉信息,为训练端到端操控策略奠定了坚实的数据基础。
解决学术问题
该数据集精准回应了机器人领域中长期困扰学界的小样本泛化与复杂接触操作难题。通过提供结构化的多模态数据——包括关节空间状态、笛卡尔空间位姿以及高分辨率视觉观测,研究者得以系统探索如何利用有限的专家演示学习鲁棒的操控策略。数据集尤其推动了对于非刚性物体交互(如面包与麦片这类可变形物质)以及精确位姿估计方法的研究进展,为从人类示教到机器人技能迁移的理论框架提供了宝贵的实验验证平台。
衍生相关工作
围绕此数据集衍生了一系列具有影响力的研究工作,包括基于扩散模型的机器人动作生成、多视角一致性学习以及技能解耦与组合方法。特别是,LeRobot框架依托此类数据推动了模仿学习的高效基准测试,催生了如基于行为克隆的端到端策略架构改进、利用语言条件进行任务泛化以及通过子任务分解实现长时域操控等开创性成果。这些工作共同构建了从数据采集、策略学习到实际部署的完整技术生态体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务