遇见数据集

HyeonseokE/SO101-OpenDrawer_Ours_20epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot创建,包含机器人操作任务的数据。具体来说,它基于SO101机器人类型(so101_follower),总共有20个训练集,5694帧数据,帧率为10fps。数据集包含多种特征,如机器人关节状态(6维浮点数组,表示肩部平移、肩部提升、肘部弯曲、手腕弯曲、手腕旋转和夹爪位置)、动作(类似结构)、来自顶部和左腕摄像头的图像观测(480x640分辨率,3通道视频)、末端执行器位置(6维浮点数组,表示XYZ位置和RPY姿态)、夹爪二进制状态、技能自然语言描述、技能验证问题、技能类型、技能进度、技能目标位置(关节和机器人XYZRPY)、子任务自然语言描述、子任务对象名称、子任务目标位置(3维浮点数组),以及时间戳、帧索引、集索引、索引和任务索引。数据集结构以parquet文件格式存储,总数据文件大小为100MB,视频文件大小为200MB。

This dataset was created using LeRobot and contains data for robotic manipulation tasks. Specifically, it is based on the SO101 robot type (so101_follower), with a total of 20 episodes, 5694 frames, and a frame rate of 10fps. The dataset includes various features such as robot joint states (6-dimensional float arrays representing shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions), actions (similar structure), image observations from top and left wrist cameras (480x640 resolution, 3-channel videos), end-effector positions (6-dimensional float arrays for XYZ position and RPY orientation), gripper binary state, skill natural language descriptions, skill verification questions, skill types, skill progress, skill goal positions (joint and robot XYZRPY), subtask natural language descriptions, subtask object names, subtask target positions (3-dimensional float arrays), as well as timestamps, frame indices, episode indices, indices, and task indices. The dataset structure is stored in parquet file format, with a total data file size of 100MB and video file size of 200MB.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-OpenDrawer_Ours_20epi 数据集图片
构建方式
该数据集基于LeRobot框架构建,旨在为机器人操作任务提供高质量的示范数据。数据采集自SO101型机械臂的跟随模式,通过人工操控或预设策略执行“打开抽屉”这一单一任务,共计20个示范片段(episode),总帧数达5694帧。数据以parquet格式存储,并同步录制了顶部与左手腕两个视角的640×480分辨率视频,编码采用H.264格式,帧率为10fps。数据集结构遵循LeRobot的v3.0规范,将训练数据按每1000帧分块,便于高效加载与管理。
特点
该数据集的核心特色在于其多模态、高精度且结构化的数据设计。观测状态包含6维关节位置(如肩部俯仰、腕部旋转等)与6维末端执行器位姿(xyzrpy),联合动作空间同样为6维,实现了状态-动作的完整闭环。尤为突出的是,数据集不仅记录了机器人本体的运动学数据,还整合了自然语言技能描述、验证问题、子任务目标及进度指示等语义层级信息,通过skill与subtask字段将底层控制信号与高层任务意图紧密耦合,为模仿学习与任务分解研究提供了富信息支撑。
使用方法
使用者可通过Hugging Face的LeRobot库直接加载该数据集,调用lerobot.datasets.LeRobotDataset接口即可获取包含状态、动作、图像及语义标签的完整数据流。数据集已预划分为20个训练片段,适合用于端到端策略学习或分层强化学习模型的训练与评估。建议用户在模型训练前,利用数据集中提供的目标位姿(goal_position)与进度指示(progress)字段作为监督信号或奖励函数设计的参考,亦可结合顶部与手腕视角的视频数据开展视觉-运动联合建模。
背景与挑战
背景概述
SO101-OpenDrawer_Ours_20epi数据集由研究人员HyeonseokE等人于近期创建,依托于LeRobot框架,旨在为机器人操作领域提供精细化的模仿学习数据。该数据集聚焦于机器人开抽屉这一基础操作任务,通过SO101_Follower机器人平台采集了20个完整操作片段,共计5694帧高保真数据。其核心研究问题在于如何将人类演示的复杂操作过程转化为机器人可学习的策略,推动机器人从简单重复操作向智能化执行发展。数据集整合了六维关节状态、末端执行器位姿、双目视觉信息(顶部与左腕相机)以及语言指令等多模态特征,为研究多模态融合与技能泛化提供了关键资源,在机器人学习社区中具有重要的基准价值。
当前挑战
该数据集所解决的领域问题主要包括:机器人开抽屉操作中的状态观测与动作生成的精准映射,以及基于有限演示数据学习稳健操作策略的挑战。由于抽屉开启涉及关节角度、抓取姿态与视觉反馈的动态协调,数据集需要捕捉多模态信息的同步性与连续性。构建过程中面临的挑战更为显著:20个演示片段虽能覆盖基本操作模式,但在真实场景中,抽屉阻尼、初始位置变化及机器人本体误差等因素导致数据一致性难以保证;同时,多摄像头视角下图像质量、帧率同步和标定精度直接影响到后续模型训练的可靠性;此外,语言指令与操作序列的语义对齐也为数据标注与结构设计增添了复杂维度。
常用场景
经典使用场景
在机器人操作领域,SO101-OpenDrawer_Ours_20epi数据集为学习精细的抽屉开启动作提供了宝贵资源。该数据集包含20个演示片段,总计5694帧,记录了SO101型机械臂执行单任务——开启抽屉的完整过程。通过高帧率(10 fps)的多视角视觉观测(顶部与左腕相机)及六维关节状态信息,研究者可借此训练模仿学习或强化学习模型,使机器人掌握从感知到动作的端到端映射。该场景聚焦于接触式操作中力控与轨迹规划的结合,是验证算法在结构化家庭环境中泛化能力的经典基准。
衍生相关工作
该数据集衍生出多项代表性工作,包括基于扩散策略的抽屉开启动作生成模型,以及结合大语言模型(LLM)的指令跟随框架。例如,研究者利用其自然语言标注(如“开启抽屉”),训练了多任务分层策略,将高层语言指令分解为子目标序列。另一经典工作是从中提取的领域随机化方法,通过增强视觉特征的多样性提升模型在新外观抽屉上的零样本泛化能力。此外,该数据集的视频模态被用于预训练视觉编码器,为更复杂的料理制作或物品取放任务奠定了接触式操作基础。
数据集最近研究
最新研究方向
在具身智能与机器人操作领域,SO101-OpenDrawer_Ours_20epi数据集聚焦于机械臂开抽屉这一精细操作任务,顺应了近年来模仿学习与行为克隆在机器人技能获取中的前沿浪潮。该数据集记录20个完整操作回合,包含10Hz频率的6维关节状态、视觉图像及自然语言描述,为研究多模态感知与动作映射提供高质资源。随着LeRobot等开源平台的兴起,此类小样本、任务专注的数据集正推动机器人从预设程序向可泛化、可解释的智能行为演进,其精细化的技能标注与目标位置记录,对探索家居场景中的非结构化操作难题具有重要基准意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务