遇见数据集

HyeonseokE/SO101-Openlid_Ours_80epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人控制数据集,使用LeRobot创建,专门针对so101_follower机器人类型。数据集包含80个episodes,总帧数为26880,帧率为10fps。数据以parquet文件格式存储,视频文件以mp4格式存储。数据集特征丰富,包括观察状态(如关节位置:肩部平移、肩部提升、肘部弯曲、腕部弯曲、腕部滚动和夹爪位置)、动作(相同关节位置控制)、图像观察(顶部和左腕摄像头的视频,分辨率为480x640,RGB三通道)、末端执行器位置(XYZ坐标和欧拉角)、夹爪二进制状态、技能信息(自然语言描述、验证问题、类型、进度、目标位置关节和末端执行器坐标)、子任务信息(自然语言描述、对象名称、目标位置)、以及时间戳、帧索引、episode索引等元数据。数据集设计用于机器人学习任务,如模仿学习或强化学习,支持多模态输入(状态和图像)和高级技能表示。

This dataset is a robotics control dataset created using LeRobot, specifically for the so101_follower robot type. It contains 80 episodes with a total of 26,880 frames at a frame rate of 10fps. The data is stored in parquet file format, and video files are stored in mp4 format. The dataset features include observation states (e.g., joint positions: shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions), actions (same joint position controls), image observations (videos from top and left wrist cameras with 480x640 resolution and RGB channels), end-effector positions (XYZ coordinates and Euler angles), gripper binary state, skill information (natural language descriptions, verification questions, types, progress, goal positions in joint and end-effector coordinates), subtask information (natural language descriptions, object names, target positions), and metadata such as timestamps, frame indices, episode indices. The dataset is designed for robotics learning tasks, such as imitation learning or reinforcement learning, supporting multimodal inputs (state and images) and high-level skill representations.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-Openlid_Ours_80epi 数据集图片
构建方式
SO101-Openlid_Ours_80epi数据集基于LeRobot框架构建,旨在服务于机器人操作任务的模仿学习研究。该数据集通过遥操作方式,利用SO101型从动机械臂采集了80个示范轨迹,共计26880帧数据,以10帧/秒的采样频率记录。数据以Parquet格式存储,并辅以H.264编码的视频流,涵盖了顶部与左手腕两个视角的RGB图像,为多模态感知提供了基础。构建过程中,每个轨迹均被划分为训练集,未设置验证或测试划分,确保数据完整性。
特点
数据集的核心特征在于其丰富的语义标注与精细的状态描述。每个样本不仅包含6维关节角度与末端执行器位姿,还融入了自然语言指令、验证问题、技能类型及进度等高层语义信息。此外,子任务级别的语言描述与目标位置进一步细化了操作意图。这些特征使数据集超越了简单的运动记录,能够支持技能分解、任务规划等高级研究。视频与数值数据的同步采集,为构建端到端的视觉运动策略提供了坚实基础。
使用方法
数据集通过HuggingFace的LeRobot工具链实现高效加载与可视化。用户可利用`lerobot`库直接读取Parquet与视频文件,通过`observation.state`和`action`等字段获取机器人状态与动作序列。推荐在训练模仿学习模型时,结合`observation.images.top`与`observation.images.left_wrist`作为视觉输入,以`action`为监督信号。数据集的统一时间戳与帧索引简化了序列对齐过程,而`skills`与`subtasks`等元数据可用于实现条件化策略训练或跨任务迁移学习。
背景与挑战
背景概述
随着机器人学习领域的快速发展,数据驱动的模仿学习因其在复杂操作任务中的潜力而备受关注。SO101-Openlid_Ours_80epi数据集由研究者HyeonseokE等人创建,依托于LeRobot开源平台,旨在推进机器人技能学习的研究。该数据集发布于HuggingFace,围绕SO101型机器人展开,聚焦于单任务的多模态数据采集,涵盖6自由度关节状态、双视角视觉图像、末端执行器位姿及自然语言指令等丰富特征。其核心研究问题在于如何利用人工演示数据高效学习机器人操作技能,尤其是在开盖(open lid)这一精细动作上。通过80个演示片段与26880帧数据,该数据集为评估模仿学习算法提供了标准化基准,对机器人操控领域的可复现研究具有重要推动意义。
当前挑战
该数据集所解决的领域挑战在于机器人精细操作任务的模仿学习,尤其是涉及环境交互的复杂动作,如容错性较差的瓶盖开启任务。此类问题要求模型同时理解视觉反馈与关节动力学,并泛化到未见过场景。在构建过程中,数据采集面临环境一致性与动作轨迹多样性的平衡难题,80个片段虽聚焦单一任务但需覆盖操作变异性。此外,多模态数据的同步标注——如自然语言子任务描述与目标位置的精确对应——以及高分辨率视频(640x480@10fps)的存储与处理,对数据质量和系统开销提出严格挑战。这些难点使得该数据集在促进算法鲁棒性方面具有独特价值。
常用场景
经典使用场景
SO101-Openlid_Ours_80epi数据集面向机器人操作学习领域,聚焦于开盖任务这一精细操控场景。该数据集包含80个示范轨迹,每个轨迹由序列化的机器人关节状态、末端执行器位姿、夹爪状态以及自上而下和左腕视角的视觉观测组成。经典使用场景包括利用行为克隆、逆强化学习或离线强化学习方法,从专家演示中学习开盖操作的闭环策略。研究者可借助数据集中同步记录的视觉与运动信息,训练端到端的控制模型,使其能够复现顺畅的开盖动作,并适应物体位置与姿态的微小变化。数据集提供的高频采样(10帧/秒)与多模态特征,为构建鲁棒的机器人操控策略提供了基础支撑。
解决学术问题
该数据集解决了机器人精细化操作中任务建模与策略泛化的核心学术难题。开盖动作涉及力控与视觉的协同,传统方法难以捕获其非线性动力学特性。通过提供标准化的一对一映射示范,数据集为研究基于视觉的运动规划、接触状态推理以及子任务分解(如抓取、旋转)提供了基准。其结构化的技能标签(skill.natural_language)与子任务描述(subtask.natural_language)使研究者得以探索层次化强化学习框架,将复杂操控拆解为可学习的原始行为。该数据集的发布推动了从单一任务模仿向多技能组合的学术进展,为零样本泛化至新品类的开盖操作提供了可复现的评估平台,深刻影响着灵巧手操控与自主机器人学习领域的研究范式。
衍生相关工作
该数据集衍生了一系列具有影响力的相关研究工作。首先,基于其多模态示范轨迹,研究者提出了联合视觉-运动表征学习方法,将开盖动作映射到隐空间,实现了对相似任务(如旋钮转动、抽屉拉拽)的零样本迁移。其次,数据集中的层次化标签(如skill.type与subtask.object_name)催生了技能分解与组合框架,如利用预训练大语言模型将自然语言指令解析为子任务序列,再依此调用从数据中学得的原始策略。此外,该数据集常被用于验证目标导向的模仿学习算法,例如通过逆最优控制恢复奖励函数,或采用扩散策略生成多样化的示范轨迹。这些衍生工作共同推动了机器人操作学习从单一演示到泛化智能的学术演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务