遇见数据集

HyeonseokE/SO101-cap_place_spoon_between_bread_and_cereal_80epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人领域的数据集,专门用于机器人技能学习和任务执行研究。它基于LeRobot框架创建,包含80个完整的episodes,总计27102帧数据。数据集针对一个具体任务:cap_place_spoon_between_bread_and_cereal(将勺子放置在面包和谷物之间),使用SO101 follower机器人类型进行数据采集。数据以10 FPS的速率记录,包括观察数据(如机器人关节状态、顶部和左腕摄像头视频、末端执行器位置、夹爪状态)、动作数据(关节控制命令)、技能信息(自然语言描述、验证问题、类型、进度、目标位置)和子任务信息(自然语言描述、对象名称、目标位置)。数据集结构包含训练分割,数据以Parquet文件格式存储,视频文件以MP4格式存储,总数据大小为100 MB,视频大小为200 MB。

This dataset is a robotics dataset designed for robot skill learning and task execution research. It was created using the LeRobot framework and consists of 80 total episodes with 27,102 frames. The dataset focuses on a specific task: cap_place_spoon_between_bread_and_cereal, involving placing a spoon between bread and cereal, and uses the SO101 follower robot type for data collection. Data is recorded at 10 FPS and includes observations (such as robot joint states, video from top and left wrist cameras, end-effector position, gripper state), actions (joint control commands), skill information (natural language descriptions, verification questions, type, progress, goal positions), and subtask information (natural language descriptions, object names, target positions). The dataset structure includes a training split, with data stored in Parquet files and video files in MP4 format, totaling 100 MB for data and 200 MB for videos.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-cap_place_spoon_between_bread_and_cereal_80epi 数据集图片
构建方式
该数据集采用LeRobot框架构建,专注于机器人操作任务的精细记录。通过SO101跟随式机器人执行“将勺子放置于面包与谷物之间”这一特定技能,共采集80个完整轨迹片段,总计27102帧数据。数据以Parquet格式存储,视频采用H.264编码,分辨率为480×640像素,帧率为10FPS。构建过程中,系统同步记录六维关节状态(包括肩部、肘部、腕部及夹爪位置)、末端执行器位姿、夹爪二进制状态、技能描述语言及子目标位置等多元信息,形成结构化、多模态的机器人演示数据集。
特点
数据集的核心特点在于其精细的层次化标注体系。除基础的状态-动作对(6维关节控制指令)外,还包含自然语言技能描述、验证问题、技能类型及进度指示符。子任务层面提供语言描述、物体名称及三维目标位置。这种融合原始传感数据(顶部与左手腕摄像头图像)、机器人本体状态与高层语义标签的设计,使得数据既可用于模仿学习中的低级控制策略训练,也可支持基于语言指令的任务规划研究,总数据量约300MB,全部80个片段划分至训练集。
使用方法
数据集可通过LeRobot库直接加载使用。用户安装LeRobot后,使用`load_dataset`接口指定路径为HuggingFace上的`HyeonseokE/SO101-cap_place_spoon_between_bread_and_cereal_80epi`即可获取数据。返回的数据字典包含`observation.state`(6维关节角)、`action`(对应关节控制)、`observation.images.top`与`observation.images.left_wrist`(视频帧序列)等多类型特征,支持批处理与迭代采样。特别适用于基于视觉-语言-动作联合建模的机器人操作技能学习,可配合HuggingFace Space可视化工具直观浏览各轨迹片段。
背景与挑战
背景概述
在机器人操作领域,模仿学习依赖于高质量、结构化的演示数据集来训练模型执行精细操作任务。由HyeonseokE等人于近期创建的SO101-cap_place_spoon_between_bread_and_cereal_80epi数据集,基于LeRobot框架构建,专注于厨房场景中的餐具放置任务——将勺子精准置于面包与麦片之间。该数据集包含80个专家演示片段,总计27102帧,通过6自由度机械臂SO101的视角,采集了顶部与左腕双路视觉信息(640×480分辨率,10fps)及关节状态、末端执行器位姿等物理量,并标注了自然语言技能描述与验证问题。其发布为细粒度物体交互任务提供了标准化数据基准,推动了机器人对复杂空间关系的理解与模仿泛化能力研究。
当前挑战
该数据集的核心挑战在于解决精细操作中的空间一致性难题:勺子需在面包与麦片两类松散物体间实现稳定放置,这对机械臂的力控精度与视觉推理提出了严苛要求。构建层面,80个片段需在非结构化厨房场景中反复标定,确保动作轨迹的语义一致性;同时,多模态数据(RGB视频、关节角、位姿)的时序对齐与标注(如子任务目标位置、自然语言描述)需要高成本人工校验。此外,数据集仅含单一任务,模型泛化至不同餐具、器皿或布局时可能面临显著性能衰退,这暴露了当前数据规模与多样性在复杂环境下的局限性。
常用场景
经典使用场景
在机器人学习与灵巧操作领域,SO101-cap_place_spoon_between_bread_and_cereal_80epi数据集为模仿学习和行为克隆研究提供了精密的基准。该数据集聚焦于将勺子放置于面包与麦片之间的精细餐具摆放任务,包含80个演示片段、2.7万余帧的多模态数据,涵盖6维关节状态、末端执行器位姿、双目视觉图像以及语言指令等特征。研究者可利用其丰富的状态-动作对训练机器人策略,探索在环境受限下的高精度物体空间关系推理,尤其适用于细粒度操作技能的迁移与泛化研究。
实际应用
在实际应用中,该数据集训练出的策略模型可用于家用服务机器人执行备餐场景中的餐具整理任务,例如在早餐桌面上精确摆放餐具以避免食物堆叠混乱。其多视角视觉信息与关节级动作标签使得机器人能够在动态家庭环境中,辨识面包与麦片碗等常见物品的空间关系,可靠完成精细的物料插入操作。此外,技能的自然语言标注也为通过口语指令直接驱动机器人执行复杂家庭任务提供了技术铺垫,加速了服务型机器人从实验室走向日常生活的落地进程。
衍生相关工作
围绕该数据集,衍生出一系列重要研究工作:基于行为克隆(BC)与扩散策略的动作预测模型利用其多模态特征实现了高成功率的长时序操作;结合分层模仿学习架构,研究者进一步将复杂任务拆解为子技能序列进行独立训练与组合;同时,数据集中的语言指令标签被用于探索视觉-语言-动作联合预训练范式,推动了机器人多模态大模型的发展。这些工作共同验证了该数据集在通用操作技能学习与跨场景泛化评估中的基准价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务