遇见数据集

HyeonseokE/SO101-cap_close_pot_10fps_80epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集由LeRobot创建,专注于机器人学领域,包含80个episodes,总帧数30173,帧率为10fps,涉及2个任务。数据集结构包括状态观测(如关节位置)、动作、图像观测(顶部和左腕摄像头视角,分辨率为480x640,彩色视频)、末端执行器位置(XYZRPY坐标)、抓取器二进制状态、技能和子任务的自然语言描述、目标位置、时间戳、索引等特征。数据以parquet格式存储,视频以h264编码的mp4格式提供。数据集适用于机器人控制和模仿学习任务。

This dataset was created using LeRobot and belongs to the robotics domain. It contains 80 episodes, with a total of 30,173 frames at 10 fps, and involves 2 tasks. The dataset structure includes features such as state observations (e.g., joint positions), actions, image observations (top and left wrist camera views, with 480x640 resolution, color video), end-effector positions (XYZRPY coordinates), gripper binary state, natural language descriptions for skills and subtasks, target positions, timestamps, indices, and more. Data is stored in parquet format, and videos are provided in h264-encoded mp4 format. The dataset is suitable for robotics control and imitation learning tasks.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-cap_close_pot_10fps_80epi 数据集图片
构建方式
SO101-cap_close_pot_10fps_80epi数据集是依托于LeRobot框架构建的机器人操作数据集,专门用于捕捉SO101型机械臂执行“合盖”任务的演示数据。数据集通过远程遥操作或示教方式采集了80个episode的轨迹,每个episode以10帧每秒的速率记录,总计包含30173帧图像与状态信息。数据存储采用分块Parquet格式(每个块最多1000帧)与H.264编码视频文件,并附有完整的元数据文件,详细描述了机器人关节状态、末端执行器位姿、夹爪二进制状态、技能类型与进度、子任务目标位置等结构化特征。所有数据已按标准划分,训练集包含全部80个episode,便于直接用于模仿学习或强化学习中的策略训练。
特点
该数据集的核心特点在于其全面且层次化的特征设计。除了常规的6维关节位置(肩部旋转、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转、夹爪)和6维末端执行器位姿外,还特别包含了来自顶部与左腕两个视角的640×480分辨率视频流,为视觉-运动策略学习提供了丰富的感知信息。数据集中嵌入了高层次的任务描述(如自然语言指令)、技能验证问题、技能进度标量以及子目标空间位置,支持基于任务分解的多阶段学习范式。此外,数据同时提供了以弧度和URDF标准表示的状态与动作,增强了与不同机器人平台的兼容性。
使用方法
使用该数据集时,用户可通过LeRobot库的API便捷加载。首先利用`lerobot.common.datasets.lerobot_dataset.LeRobotDataset`类指定数据集路径和划分(如`split='train'`),即可按帧或按episode迭代访问观测图像、关节状态、动作序列等张量数据。数据集的视频字段已自动解码为帧数组或提供视频帧索引,便于进行随机或连续采样。用户可结合`chunks_size`参数管理内存加载,并利用`features`元数据中的形状与数据类型信息构建自定义的神经网络输入管道。对于模仿学习研究,推荐将`action`字段作为策略输出目标,而`observation.state`与`observation.images.*`作为输入观测。
背景与挑战
背景概述
在机器人操作领域,如何让机械臂高效且鲁棒地执行精细的物体操控任务一直是核心议题。SO101-cap_close_pot_10fps_80epi数据集由HyeonseokE等人创建,旨在解决“盖锅盖”这一具有代表性的机器人灵巧操作问题。该数据集以10帧/秒的频率采集了80个演示片段,包含了超过3万帧的观测数据,覆盖了关节角度、末端执行器位姿、手爪状态及多视角视觉图像等丰富模态。通过利用LeRobot框架进行标准化处理,该数据集为研究基于模仿学习的机器人技能获取提供了可靠的基础,推动了机器人从简单抓取向复杂装配操作的迁移能力的提升。
当前挑战
该数据集所面临的挑战主要体现在两个层面。在领域问题层面,盖锅盖任务要求机械臂在精确的空间位姿控制与柔顺力调节之间取得平衡,而现有方法在处理此类接触丰富的装配操作时,常因视觉遮挡、模型泛化性不足而难以保证成功率。在数据集构建层面,80个示范片段虽提供了基础样本,但样本数量相对有限,难以覆盖全部可能的初始姿态与干扰情境;同时,多模态数据的同步采集、标注的一致性、以及从人类演示到机器人策略的高效迁移,依然是制约该数据集实用效能的瓶颈。
常用场景
经典使用场景
SO101-cap_close_pot_10fps_80epi数据集专为机器人操作技能学习而构建,聚焦于锅盖闭合这一精细操作任务。该数据集包含80个示范片段,以每秒10帧的高频采样,记录六自由度机械臂从关节位置到末端执行器位姿的全状态信息,并结合顶部与左腕双视角视觉图像,为模仿学习与行为克隆提供了高质量的同步多模态数据流。其最经典的使用场景在于训练基于视觉的机器人策略网络,使机器人能够从示范中泛化出闭合锅盖的完整动作序列,是研究灵巧操作与任务泛化的重要基准。
实际应用
在实际场景中,该数据集可直接赋能家庭服务机器人执行厨房内的锅具管理操作,例如自主闭合压力锅或汤锅的锅盖,从而完成烹饪环节中的关键步骤。结合预先训练的视觉定位与力控策略,机器人能够适应不同尺寸、材质和摆放姿态的锅具,提升操作成功率。此外,该数据集所采集的关节速度与力矩特征还可迁移至工业装配线上,用于指导精密部件的盖合工序,展现出从实验室到现实生活与生产的广泛适用性。
衍生相关工作
基于该数据集,学术界已衍生出若干代表性工作,包括在LeRobot框架下开发的端到端视觉运动策略(如ACT和Diffusion Policy),这些模型利用本数据集的时序状态-动作对进行预训练,显著提升了高精度操作的成功率。同时,该数据集还催生了面向机器人技能的语言条件化策略研究,研究者借助其‘skill.natural_language’与‘subtask.natural_language’标注,设计出可理解自然指令的通用操作模型。此外,在多任务学习与元学习领域,该数据集被用作基准之一,用以评估算法在稀疏示范下对新型操作技能的适应能力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务