遇见数据集

HyeonseokE/SO101-PlaceSpoon_Ours_20epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人操作数据集,使用LeRobot框架创建。数据集专注于“放置勺子”任务,包含20个完整的情节(episodes),总计7102帧数据,帧率为10fps。数据采用多模态格式,包括机器人状态观察(6维关节位置、末端执行器位姿、夹爪二进制状态)、动作(6维关节控制)、来自顶部摄像头和左腕摄像头的图像视频(分辨率480x640,RGB格式),以及技能和子任务的自然语言描述、验证问题、目标位置等信息。数据集适用于机器人学习研究,特别是模仿学习、强化学习和多任务学习。数据以parquet文件格式存储,视频以mp4格式存储,许可证为Apache-2.0。

This dataset is a robotic manipulation dataset created using the LeRobot framework. It focuses on the Place Spoon task, containing 20 complete episodes with a total of 7102 frames at 10fps. The data is multimodal, including robot state observations (6D joint positions, end-effector pose, gripper binary state), actions (6D joint control), image videos from a top camera and a left wrist camera (resolution 480x640, RGB format), as well as natural language descriptions for skills and subtasks, verification questions, goal positions, and more. The dataset is suitable for robotics learning research, particularly imitation learning, reinforcement learning, and multi-task learning. Data is stored in parquet file format, videos in mp4 format, and is licensed under Apache-2.0.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-PlaceSpoon_Ours_20epi 数据集图片
构建方式
SO101-PlaceSpoon_Ours_20epi数据集依托于LeRobot框架构建,专注于机器人操作领域的技能学习。该数据集通过实际机器人演示采集而成,共包含20个演示片段(episodes),总计7102帧时序数据,以10帧/秒的频率记录。数据以Parquet格式存储结构化信息,并辅以H.264编码的视频文件,分别记录来自顶部和左腕部两个视角的视觉观测。每个片段均标注了机器人关节状态、末端执行器位姿、夹爪状态、动作序列以及技能相关的自然语言指令与验证问题,形成多模态、结构化的学习样本。数据集默认划分为训练集,全部20个片段均用于模型训练,为模仿学习提供充分的示范素材。
特点
该数据集的显著特征在于其丰富的多模态信息整合与精细化的任务标注体系。除了常规的关节角度与动作指令(均为6维浮点向量),数据还包含机器人末端执行器的三维位置与欧拉角(xyzrpy)、夹爪二进制状态,以及从自然语言层面描述技能类型、子任务对象与目标位置的语义标签。尤其值得关注的是,数据集中引入了技能进度(skill.progress)与验证问题(skill.verification_question),使得每个时间步不仅具备状态-动作配对,还能反映操作阶段的完成度与可验证性,从而支撑更高级的机器人学习范式,如分层模仿学习与基于语言的任务规划。
使用方法
使用该数据集时,建议研究者利用LeRobot库中的实用工具进行加载与预处理。数据以Parquet分块文件存储(每块1000帧)并对应同名MP4视频片段,可通过指定chunk_index和file_index索引访问。特征字段中,observation.state与action均为6维向量,可直接用于训练残差策略或行为克隆模型。视觉观测均为480×640分辨率的RGB图像,可用于端到端视觉运动控制。若需利用语言能力,可提取skill.natural_language和subtask.natural_language等字段作为条件输入,配合skill.goal_position实现目标导向的力位混合控制。数据集可方便地接入Hugging Face的Visualize Dataset工具进行交互式预览。
背景与挑战
背景概述
SO101-PlaceSpoon_Ours_20epi数据集由HyeonseokE研究团队于近期创建,依托LeRobot开源框架构建,专注于机器人精细化操作领域中的放置任务。该数据集以SO101型跟随机器人为载体,通过20个演示片段、超过7100帧的高频数据(10 FPS),记录了将勺子精准放置于指定位置的全过程,核心研究问题在于如何通过模仿学习实现机器人对柔性物体的灵巧操控。数据集包含多视角视觉观测、六维关节状态、末端执行器位姿及自然语言技能描述等多模态信息,为细粒度机器人技能学习提供了标准化基准,对推动家庭服务机器人、工业装配等场景的自主化操作具有重要影响。
当前挑战
在领域问题层面,该数据集着力解决机器人精准放置任务中的关键挑战:柔性物体(如勺子)的抓取与释放姿态控制、多模态感知融合下的轨迹规划,以及从少量演示中泛化至不同初始状态的模仿学习难题。在构建过程中,团队面临数据采集一致性维护的困难——需确保20个episode内机器人运动策略的可重复性、视觉传感器标定的精度,以及自然语言标签与物理动作的语义对齐。此外,仅包含单任务且样本量偏小的特性,对模型在真实场景中的零样本迁移能力构成了严峻考验。
常用场景
经典使用场景
SO101-PlaceSpoon_Ours_20epi数据集是面向机器人精细操控领域而构建的,专注于“放置勺子”这一具体任务。通过记录SO101机械臂在20个示范轨迹中的关节状态、末端执行器位姿、夹爪开合度以及多视角视觉信息(顶部和左腕相机),该数据集为模仿学习与行为克隆提供了高质量的专家演示。经典使用场景包括利用视觉-运动联合表征训练机器人策略网络,使模型从高维图像和低维状态中学习如何将勺子精准放置于目标位置,从而在特定场景下复现人类演示的操控技能。
衍生相关工作
该数据集推动了若干前沿研究工作的涌现。基于其视频-动作配对特性,衍生出利用扩散模型生成机器人轨迹的研究思路,如引入条件噪声预测以合成符合物理约束的动作序列。此外,数据集支持的多模态特征(语言指令、图像、状态)启发研究者构建统一的视觉-语言-动作基础模型,例如通过预训练对齐技术提升跨任务迁移能力。同时,其标准化的LeRobot格式也促进了社区中多数据集联合训练框架的发展,为机器人通用技能库的构建提供了可复现的基线。
数据集最近研究
最新研究方向
在机器人灵巧操作领域,SO101-PlaceSpoon_Ours_20epi数据集聚焦于精细化的餐具放置任务,为模仿学习与行为克隆算法提供了高质量的演示数据。该数据集记录了SO101型机械臂在20个示范回合中执行“放置勺子”动作的完整轨迹,包含关节状态、末端执行器位姿、顶部与腕部视觉输入等多模态信息。近期研究趋势集中利用此类小样本精细操作数据,结合LeRobot框架下的扩散策略或基于Transformer的决策模型,以提升机器人在非结构化环境中的泛化能力。该数据集不仅推动了基于视觉的机器人精细技能迁移研究,还通过标注自然语言指令与子任务目标,为具身智能中语言-动作对齐的前沿探索提供了宝贵资源,对构建可泛化的家庭服务机器人具有重要示范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务