遇见数据集

HyeonseokE/SO101-cap_close_pot_10fps_20epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是通过LeRobot创建的机器人数据集,专门用于机器人任务。数据集包含20个总集数,7556个总帧数,以及2个总任务数,数据以每秒10帧的速率采集。数据集中包含多种特征,如机器人的观察状态(包括6个关节位置)、动作(6个关节位置)、来自顶部和左腕摄像头的图像(分辨率为480x640,RGB格式)、末端执行器位置和姿态、二进制夹爪状态等。此外,还包括技能相关的自然语言描述、验证问题、类型和进度,以及子任务的自然语言描述、对象名称和目标位置。数据集结构以parquet文件格式存储,并附带视频文件,适用于机器人学习和控制任务的研究。

This dataset was created using LeRobot and is designed for robotics tasks. It includes a total of 20 episodes, 7556 frames, and 2 tasks, collected at a frame rate of 10 fps. The dataset features various attributes such as robot observation states (including 6 joint positions), actions (6 joint positions), images from top and left wrist cameras (with a resolution of 480x640, RGB format), end-effector position and orientation, binary gripper status, and more. Additionally, it includes skill-related natural language descriptions, verification questions, types, and progress, as well as subtask natural language descriptions, object names, and target positions. The dataset is structured in parquet file format and comes with video files, making it suitable for research in robot learning and control tasks.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-cap_close_pot_10fps_20epi 数据集图片
构建方式
该数据集基于LeRobot框架构建,旨在为机器人操作任务提供高质量的行为克隆训练数据。数据采集自SO101型号的跟随机器人(follower),聚焦于“盖紧锅盖”这一精细操作任务。数据集包含20个完整演示片段(episodes),总计7556帧,以每秒10帧(10fps)的采样率录制。所有数据被划分为训练集,无需额外切分。数据以Parquet格式存储,视频流则采用H.264编码的MP4文件,分为顶部摄像头和左手腕摄像头两个视角,分别采集640x480分辨率的RGB图像。每个片段内同时记录了机器人的关节状态、末端执行器位姿、夹爪二进制状态以及自然语言描述的子任务信息,形成了结构化的多模态数据集。
特点
该数据集最显著的特点在于其精细化的层级标注体系。除了基础的状态与动作数据外,每帧还附带了技能(skill)和子任务(subtask)层面的语义标注,包括自然语言指令、验证问题、进度以及目标位姿等元信息。这种结构化设计使得数据不仅可用于端到端的模仿学习,还支持任务分解与分阶段训练。此外,6维关节空间状态与动作的对齐设计,以及6维末端执行器笛卡尔位姿的同步记录,为研究者提供了从关节级到任务级的多样化建模视角。数据量适中(约100MB的Parquet文件与200MB的视频文件),适合快速验证算法。
使用方法
推荐使用LeRobot库加载与处理该数据集。通过`from lerobot import Dataset`接口可直接读取Parquet和视频文件,生成统一的`DataDict`对象供模型训练。数据集已内置默认的训练/测试划分(全部20个片段用于训练),用户无需手动拆分。在行为克隆任务中,可将`observation.state`作为输入,`action`作为预测目标;若需结合视觉信息,可利用`observation.images.top`和`observation.images.left_wrist`作为视觉观察输入。支持通过`skill.natural_language`字段进行条件生成或多任务学习。建议在10fps的固定帧率下处理时间序列数据,注意动作与状态序列的长度对齐。
背景与挑战
背景概述
SO101-cap_close_pot_10fps_20epi数据集由研究者HyeonseokE基于LeRobot框架创建,旨在为机器人操作任务提供精细化的视觉-运动控制训练数据。该数据集聚焦于“盖紧锅盖”这一细粒度操作场景,通过SO101型机械臂的6关节协同运动与顶部、左腕双视角摄像头,采集了20个回合共计7556帧的高频(10fps)动作与状态数据。数据集不仅记录了关节角度、末端执行器位姿等低维控制信号,还引入了自然语言技能描述与子任务分解信息,为理解复杂操作任务中的语义-运动映射提供了结构化标注。作为机器人模仿学习与行为克隆领域的基础资源,该数据集填补了日常厨房操作任务中标准化数据集的空白,推动了从感知到动作的端到端建模研究。
当前挑战
该数据集主要应对两个层面的挑战。在领域问题层面,精细操作任务(如盖锅盖)要求机械臂协调多关节运动以实现精确的力位控制,且操作过程中物体状态变化与视觉反馈的时变耦合显著增加了策略学习的难度,传统基于模型的方法难以捕获此类非刚性接触的动力学特性。在数据集构建层面,高质量数据采集面临硬件标定精度(如摄像头与机器人基座的外参对齐)、动作多样性(20个回合的数据量相对有限)以及任务语义与运动轨迹的标注一致性等难题。此外,技能描述的自然语言文本与底层运动序列之间的语义鸿沟,对多模态联合建模提出了更高的要求,亟需更高效的数据增强与迁移学习方法以拓展数据集的泛化边界。
常用场景
经典使用场景
SO101-cap_close_pot_10fps_20epi数据集专为机器人操作技能学习而设计,聚焦于机械臂执行‘盖锅盖’这一精细操作任务。该数据集以10帧每秒的频率采集了20个演示片段,共计7556帧,包含来自多个视觉传感器(如顶部摄像头和左腕摄像头)的高清图像序列、机器人关节状态、末端执行器位姿以及夹爪二进制状态等多模态信息。其经典使用场景在于为模仿学习算法提供高质量的专家示教数据,尤其适用于基于行为克隆或逆强化学习的机器人技能获取任务。研究者可利用该数据集训练模型,使机器人从观察状态映射到动作空间,从而复现流畅、准确的盖锅盖操作,推动细粒度操作技能的自动化习得。
实际应用
在实际应用中,该数据集可赋能家庭服务机器人完成厨房场景下的自主操作任务,例如机械臂自主合上锅盖以辅助烹饪流程。结合视觉感知与关节控制数据,该资源可用于训练机器人适应不同形状规格锅具的盖合操作,提升其在非结构化环境中的鲁棒性。此外,该机器人与人类技能演示的精确配对数据还可转化为工业装配领域的质检与精密装配环节的参考模板,推动人机协作场景下操作能力的标准化与自动化部署。
衍生相关工作
该数据集的衍生工作广泛涉及基于变换器架构的分层模仿学习方法,研究者利用其多模态特性发展了视觉-语言-动作联合建模的范式。例如,相关工作将自然语言指令嵌入与视觉特征对齐,构建了可解释的技能分解模型,实现了从粗粒度任务描述到细粒度运动轨迹的生成。在LeRobot框架支持下,该数据集还催生了跨具身形态的泛化研究,通过对比分析不同机器人构型下的盖操作数据探索了动作表征的迁移性。这些开拓性工作不仅丰富了机器人学习领域的知识图谱,也为构建通用操作智能体奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务