遇见数据集

HyeonseokE/SO101-cap_open_pot_10fps_80epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集由LeRobot创建,是一个用于机器人学任务的数据集,特别针对SO101机器人(follower类型)。数据集包含80个完整的情节(episodes),总计27008帧数据,帧率为10fps。数据以Parquet格式存储,总数据文件大小为100MB,视频文件大小为200MB。数据集特征丰富,包括机器人状态观测(6个关节位置:肩部平移、肩部升降、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置)、动作(相同的6个关节位置)、来自顶部和左腕摄像头的图像观测(分辨率480x640,RGB三通道,H.264编码视频)、末端执行器位置(XYZ坐标和欧拉角)、夹爪二进制状态、技能信息(自然语言描述、验证问题、类型、进度、目标位置)、子任务信息(自然语言描述、对象名称、目标位置)以及时间戳、帧索引、情节索引等元数据。数据集仅包含训练集,覆盖一个任务,适用于机器人控制、模仿学习或强化学习研究。

This dataset was created using LeRobot and is designed for robotics tasks, specifically for the SO101 robot (follower type). It contains 80 total episodes with 27,008 frames at a frame rate of 10 fps. The data is stored in Parquet format, with a total data file size of 100 MB and video file size of 200 MB. The dataset includes rich features such as robot state observations (6 joint positions: shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions), actions (same 6 joint positions), image observations from top and left wrist cameras (resolution 480x640, RGB three-channel, H.264 encoded video), end-effector positions (XYZ coordinates and Euler angles), gripper binary state, skill information (natural language description, verification question, type, progress, goal positions), subtask information (natural language description, object name, target position), and metadata like timestamp, frame index, episode index. The dataset only includes a training split, covers one task, and is suitable for robotics control, imitation learning, or reinforcement learning research.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-cap_open_pot_10fps_80epi 数据集图片
构建方式
在机器人操作研究中,数据集的质量与结构化程度直接影响模仿学习算法的性能表现。SO101-cap_open_pot_10fps_80epi数据集依托LeRobot框架构建,专注于瓶盖开启这一精细操作任务。数据采集过程中,研究者操控SO101型跟随机器人执行80个完整回合(episode)的开盖动作,以每秒10帧的采样率同步录制多模态信息。每一回合的数据被划分为固定大小为1000帧的块(chunk),并以Parquet格式高效存储结构化数值数据,同时将机器人顶置与左腕视角的视觉流以H.264编码的MP4视频形式独立保存。数据集的构建不仅涵盖了机器人六自由度关节状态、末端执行器位姿、夹爪二进制状态等底层观测,还通过自然语言标注了技能类型、子任务目标及验证问题,形成了从感知到语义的完整数据链。
特点
该数据集的核心特色在于其精细的层级化标注体系与多模态融合设计。在数值层面,数据集同步记录了关节位置、末端执行器六维位姿及夹爪开合状态,其中状态与动作空间均包含六个维度的连续控制量,为运动学建模提供了完整输入输出对。视觉层面,顶置与左腕双视角的640×480分辨率彩色视频流,以10fps的稳定帧率捕捉操作过程的全局与局部细节。尤为突出的是,数据集引入了技能(skill)与子任务(subtask)两级语义标注:每个操作片段均关联自然语言描述、进度指示以及目标位置的关节空间与笛卡尔空间双重表示。这种结构化标注使得数据集不仅支持端到端模仿学习,还能够服务于子任务分解、技能泛化评估等高级研究目标,而80个回合、超过27000帧的规模则为模型训练提供了充足的多样性。
使用方法
使用该数据集进行机器人学习研究时,研究者可通过LeRobot框架的标准化接口加载数据。数据集已预设为单一训练集,包含全部80个回合,无需额外划分。推荐的工作流程包括:首先利用Parquet文件中的数值特征(如observation.state与action)训练行为克隆或扩散策略模型,随后结合双视角视频流进行视觉运动策略的联合学习。数据集中丰富的语义标签(如skill.natural_language)使研究者能够基于自然语言指令进行条件策略建模,或借由subtask.target_position字段实现空间引导的动作生成。此外,视频数据与数值序列通过帧索引严格对齐,便于时间序列分析或时序模型训练。研究者可直接调用Hugging Face上的可视化工具预览数据样例,或参照LeRobot的官方教程实现从数据加载到模型评估的完整流水线。
背景与挑战
背景概述
在机器人学习领域,通过模仿学习实现精细操作任务始终是一项核心挑战。SO101-cap_open_pot_10fps_80epi数据集由研究者HyeonseokE等人创建,基于LeRobot框架构建,聚焦于“打开锅盖”这一具有代表性的厨房操作任务。该数据集包含80个演示片段,共计27008帧图像与对应的关节状态、动作指令,以每秒10帧的频率记录,并通过顶部与左腕双视角摄像头捕捉视觉信息。数据集遵循Apache-2.0许可协议,旨在为机器人从人类演示中学习复杂装配与操作技能提供标准化训练素材,推动机器人精细操作能力的泛化与迁移,对于研究实际场景中的柔顺控制与长时序任务执行具有重要参考价值。
当前挑战
该数据集所解决的领域问题核心在于机器人对非结构化环境中物体操作的泛化能力,具体表现为如何从少量演示中学习到可迁移的拧动、提拉等复合动作策略,并适应不同初始状态与物体位姿。在构建过程中,研究者面临的挑战包括:1) 高精度动作捕捉与对齐,需使6自由度机械臂的肩部、肘部、腕部及夹爪姿态与视觉反馈保持同步,避免时序偏移;2) 多模态数据融合,需将640×480分辨率视频流与6维关节位置信号、末端执行器位姿及技能语义标签进行结构化存储,确保数据一致性与可复现性;3) 长时序任务的分割与标注,需精确划分子任务边界并关联自然语言描述,以支持层次化模仿学习方法的训练与评估。
常用场景
经典使用场景
SO101-cap_open_pot_10fps_80epi数据集专为机器人操作技能学习而构建,聚焦于“打开锅盖”这一精细化操作任务。数据集以10帧/秒的频率采集了80个完整演示片段,共包含超过27000帧的机器人状态、关节角度、末端执行器位姿以及多视角视觉图像(顶部和左腕相机)。这些丰富的信息使其成为训练机器人模仿学习模型的理想资源,尤其适用于行为克隆和基于视觉的运动策略学习。研究者可利用该数据集训练机器人从观测状态直接映射到动作指令,实现对开盖这类非刚性物体交互操作的精确复现。
解决学术问题
该数据集有效回应了机器人学中关于精细操作技能迁移和泛化的核心难题。在学术层面,它为解决从人类演示中学习复杂多阶段操作提供了标准化基准,特别针对了开盖这类涉及力控和视觉反馈的任务。通过提供包含语言标签、子任务目标及验证问题在内的结构化标注,数据集支持了对层次化任务分解与执行的研究,推动了从端到端模仿学习到模块化技能组合的学术探索。其意义在于降低了重复采集数据的门槛,促进了可复现的对比实验,加速了操作技能学习理论的验证与迭代。
衍生相关工作
围绕该数据集已衍生出多项具有影响力的研究工作。在模仿学习领域,研究者基于其多视角视觉与状态信息,探索了结合变换器架构的扩散策略,用于生成更平滑且鲁棒的操作轨迹。层次化强化学习受益于数据集中细粒度的子任务标注,发展出将开盖动作分解为抓取、旋转、提升等多个子技能的组合框架。此外,自然语言与操作对齐的研究利用其内置的指令描述,训练了能够理解高层任务意图并映射为具体动作序列的视觉-语言模型,这些工作共同推动了机器人交互智能的前沿进展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务