遇见数据集

HyeonseokE/SO101-PlaceSpoon_Ours_40epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人学习数据集,使用LeRobot创建,专门用于机器人任务(如放置勺子)。数据集包含40个episodes,总计14197帧,针对一个任务(total_tasks: 1)。机器人类型为so101_follower。数据以parquet文件和视频文件形式存储,总数据大小为100MB,视频大小为200MB,帧率为10fps。数据集仅包含训练集(splits: train)。特征包括:机器人状态观测(6个关节位置:肩部平移、肩部升降、肘部弯曲、腕部弯曲、腕部旋转、夹爪位置)、动作(6个关节位置,与状态观测相同)、来自顶部和左腕摄像头的图像观测(480x640分辨率,RGB视频,编码为h264)、末端执行器位置(XYZRPY坐标)、夹爪二进制状态、技能自然语言描述、技能验证问题、技能类型、技能进度、技能目标位置(关节和XYZRPY坐标)、子任务自然语言描述、子任务对象名称、子任务目标位置(XYZ坐标),以及时间戳、帧索引、episode索引等元数据。数据集适用于机器人控制、模仿学习或强化学习研究。

This dataset is a robotics learning dataset created using LeRobot, specifically for robot tasks (e.g., placing a spoon). It contains 40 episodes, totaling 14197 frames, for one task (total_tasks: 1). The robot type is so101_follower. Data is stored in parquet files and video files, with a total data size of 100MB and video size of 200MB, at a frame rate of 10fps. The dataset includes only a training set (splits: train). Features include: robot state observation (6 joint positions: shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, gripper), action (6 joint positions, same as state observation), image observations from top and left wrist cameras (480x640 resolution, RGB video, encoded as h264), end-effector position (XYZRPY coordinates), gripper binary state, skill natural language description, skill verification question, skill type, skill progress, skill goal position (joint and XYZRPY coordinates), subtask natural language description, subtask object name, subtask target position (XYZ coordinates), and metadata such as timestamp, frame index, episode index, etc. The dataset is suitable for robotics control, imitation learning, or reinforcement learning research.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-PlaceSpoon_Ours_40epi 数据集图片
构建方式
SO101-PlaceSpoon_Ours_40epi数据集是面向机器人操作任务的高质量示范数据集,依托LeRobot框架采集与构建。数据源自SO101型跟随机器人执行“放置勺子”单一任务,共包含40个完整示教轨迹,总计14197帧状态-动作序列。每条轨迹以10帧/秒的速率记录,涵盖机器人6自由度关节位置、末端执行器位姿、夹爪状态及多视角视觉观测。数据以Parquet格式存储结构化信息,视频以H.264编码的MP4文件保存,并依据元信息中的chunk与file索引进行组织,确保数据的高效存取与可复现性。
特点
该数据集的核心特征在于其多层次、多模态的标注体系。除常规的状态与动作外,还包含自然语言描述的子任务与技能、验证问题、技能进展、目标关节位置与末端位姿等语义化信息。视觉模态由顶置480×640像素RGB相机与左腕部相机同步提供,形成丰富的环境感知。数据特征维度统一为6维动作空间与6维状态空间,利于模仿学习算法直接使用。所有轨迹均标注了完整的帧索引、任务索引及时间戳,支持细粒度的时序分析与重放。
使用方法
数据集可通过Hugging Face的LeRobot库直接加载与可视化,无需额外预处理。用户可利用`lerobot`提供的API按指定配置(config_name='default')读取Parquet格式的示范数据与视频流。数据已按0:40的比例划分为训练集,适用于行为克隆、逆强化学习等离线模仿学习方法。建议在训练前将观测图像缩放到模型输入尺寸,并将6维动作标准化为零均值单位方差。同时,借助技能与子任务的自然语言标注,可进一步探索语言条件策略或多任务学习范式。
背景与挑战
背景概述
该数据集由韩国科学技术院(KAIST)的研究人员HyeonseokE等人于近期创建,旨在推动机器人精细操作技能的学习与泛化。基于LeRobot框架构建,数据集聚焦于“放置勺子”(PlaceSpoon)这一典型的家务操作任务,通过SO101协作型机器人采集了40个示范回合,包含14,197帧多模态数据。其核心研究问题在于探索如何从有限的人类示范中高效学习可迁移的机器人操作策略,为机器人技能学习领域提供了高保真的基准资源,尤其对模仿学习与行为克隆方法的发展具有重要参考价值。
当前挑战
当前机器人操作技能学习面临两大核心挑战:一是精确操控的领域难题,如放置勺子这类任务需协调6自由度关节运动与夹爪控制,对姿态估计与细粒度动作复现要求极高;二是数据构建的实践困境,包括多视角视频(顶部与左腕)的同步采集、自然语言标注与子任务分解的标准化,以及小样本条件下(仅40回合)如何保证策略鲁棒性。此外,数据中隐含的skill与subtask分层结构,对模型理解长期任务时序依赖的能力提出了更高要求。
常用场景
经典使用场景
SO101-PlaceSpoon_Ours_40epi数据集专为机器人操作领域的模仿学习研究而设计,聚焦于‘放置勺子’这一精细的抓取与放置任务。该数据集包含了40个完整的演示回合,共计超过14000帧的高频状态与动作序列,记录了从观测到执行的完整闭环流程。其经典应用在于训练基于视觉和状态输入的策略网络,通过行为克隆或逆强化学习等方法,使机器人能够学习泛化性的操作策略,精准完成将勺子放置于目标位置的复杂任务。
实际应用
在工业与生活服务场景中,该数据集可能直接赋能协作型机械臂完成诸如餐具摆放、物料分拣等标准化放置任务。其内置的视觉与力位混合反馈机制,使得机器人能够在非结构化环境中实现自适应柔顺操作,例如在厨房台面上精准定位并放置餐具。此外,数据集中包含的子任务与技能标注信息,为开发可解释的、具备序贯推理能力的智能装配系统提供了宝贵的数据基础,加速了机器人从定点演示迈向动态作业的产业化进程。
衍生相关工作
围绕此数据集衍生出一系列创新性的学术工作,例如基于扩散策略的高频动作生成模型,以及利用对比学习增强状态表示泛化能力的算法。研究者们还基于该数据集的技能标注信息,探索了层次化模仿学习框架,将复杂的放置任务拆解为‘抓取—移动—释放’等原子技能,并验证了跨任务技能迁移的可能性。同时,结合LeRobot平台的多机器人兼容性,该数据集亦被用于验证解耦表征的交叉具身迁移学习,推动了操作技能从单一机器人向多形态平台的泛化研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务