遇见数据集

HyeonseokE/SO101-Openlid_Ours_40epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集由LeRobot创建,专注于机器人技术领域。它包含一个名为so101_follower的机器人类型的演示数据,总共有40个episodes、13464帧和1个任务。数据以parquet文件格式存储,并附带视频文件。数据集的特征丰富,包括观察状态(如6个关节位置:肩部平移、肩部升降、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置)、动作(相同6个关节位置)、图像观察(顶部和左腕摄像头的视频,分辨率为480x640,帧率为10fps)、末端执行器位置(以xyzrpy表示)、技能信息(如自然语言描述、验证问题、类型、进度和目标位置)、子任务信息(如自然语言描述、对象名称和目标位置),以及时间戳、帧索引、episode索引等元数据。数据集适用于机器人学习任务,如模仿学习或强化学习。

This dataset was created using LeRobot and focuses on robotics. It contains demonstration data for a robot type named so101_follower, with a total of 40 episodes, 13464 frames, and 1 task. The data is stored in parquet format and includes video files. The dataset features a wide range of attributes, including observation states (e.g., 6 joint positions: shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions), actions (same 6 joint positions), image observations (videos from top and left wrist cameras, with a resolution of 480x640 and 10fps), end-effector positions (in xyzrpy format), skill information (such as natural language descriptions, verification questions, types, progress, and goal positions), subtask information (e.g., natural language descriptions, object names, and target positions), and metadata like timestamps, frame indices, and episode indices. It is suitable for robotics learning tasks, such as imitation learning or reinforcement learning.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-Openlid_Ours_40epi 数据集图片
构建方式
该数据集基于LeRobot框架构建,旨在服务于机器人操作任务的模仿学习研究。数据采集过程中,使用so101_follower型机器人执行单一任务,共记录40个操作回合,累计获得13464帧有效数据。每一帧均包含来自机器人多模态传感器的高保真信息,具体涵盖:6维关节状态(shoulder_pan、shoulder_lift、elbow_flex、wrist_flex、wrist_roll及夹爪位置)、6维末端执行器位姿(xyzrpy)、6维动作指令、顶部与左腕两个视角的RGB视频流(分辨率480×640,帧率10 FPS),以及夹爪二进制状态。此外,数据集中还嵌套了任务描述、技能类型、执行进度、子步骤的自然语言描述与目标位置等结构化语义标签。所有数据以Parquet格式存储于按块划分的文件中,视频则采用H.264编码的MP4文件保存,整体文件大小约300 MB,确保了高效存取与训练友好性。
特点
本数据集的核心特点在于其深度耦合了低层运动控制指令与高层语义理解,为机器人模仿学习提供了细粒度且语义丰富的多模态观测空间。数据集不仅记录了传统的位置与动作序列,更创新性地引入了任务层级分解信息:每个回合被划分为技能与子步骤,各自携带自然语言描述(skill.natural_language、subtask.natural_language)、技能验证问题(skill.verification_question)、技能类型(skill.type)及进度状态(skill.progress)等元数据。这种结构化组合使得模型在模仿动作的同时,能够学习到任务拆解、子目标规划及语言指令与运动执行之间的映射关系。视觉模态采用双摄像头设计(顶部全局视角与左腕局部视角),为机器人在不同尺度下的场景感知与细粒度操作提供了充足依据。
使用方法
用户可通过LeRobot库便捷地加载与可视化该数据集。推荐使用Hugging Face Spaces提供的专用可视化界面(点击README中的“Visualize this dataset”按钮),无需本地配置即可浏览各回合的观测与动作序列。在本地开发环境中,开发者可使用lerobot.datasets.LeRobotDataset类直接导入数据,通过指定数据集路径为HyeonseokE/SO101-Openlid_Ours_40epi即可完成实例化。数据集已预先划分为训练集(第0至39个回合),符合标准pytorch数据集接口,可无缝接入常见的模仿学习训练流程。解析后的数据中,observation.state和action字段均为6维浮点向量,对应关节角度;observation.images.*字段为视频帧张量;而skill与subtask相关的自然语言字段则为字符串类型,便于进行条件模仿学习或语言引导的机器人策略训练。
背景与挑战
背景概述
SO101-Openlid_Ours_40epi数据集创建于2024年,由HyeonseokE研究团队基于LeRobot框架构建,专注于机器人操作技能的模仿学习研究。该数据集围绕SO101型机械臂在开盖任务中的精细化操作展开,收录了40个演示片段及逾1.3万帧观测数据,涵盖了多视角视觉输入、关节状态与末端执行器位姿等关键模态。作为机器人学习领域的高质量演示集合,它推动了从人类示教到机器人技能迁移的技术演进,为细粒度操作任务中的策略泛化与鲁棒控制研究提供了标准化基准。
当前挑战
该数据集旨在应对模仿学习中从多模态感知到精细动作映射的核心难题,尤其是在高自由度机械臂执行非结构化操作任务时,如何从有限演示中提取可泛化的技能表征。构建过程中面临的首要挑战是精确同步多视角视频流与高频率关节状态数据,确保时间对齐与语义一致性;其次,开盖任务涉及复杂的接触动力学与力控制,而现有传感器难以直接记录触觉反馈,致使关键交互信息缺失;此外,40个演示的规模远小于大规模机器人数据集,在小样本条件下实现策略对物体位姿变化与几何差异的鲁棒性是显著不足。
常用场景
经典使用场景
SO101-Openlid_Ours_40epi数据集专为机器人模仿学习研究而构建,其经典使用场景在于为SO101型跟随机器人提供高质量的示教数据。数据集包含了40个完整任务情节,每个情节均记录有六维关节状态、末端执行器位姿、夹爪状态以及来自顶部和左腕摄像头的视觉观测。通过将自然语言指令、子任务描述和目标位置等语义信息与时间序列的动作状态对齐,研究者可利用这些数据训练端到端的视觉-运动策略,使机器人能够从人类示教中习得复杂的开盖操作技能。数据集的帧率为10 Hz,总帧数达13464帧,为模型学习细粒度的时序动态特征提供了坚实的数据基础。
解决学术问题
该数据集的核心学术价值在于弥补了机器人技能学习领域中对精细操作任务数据的稀缺。传统数据集多集中于抓取或简单推动,而SO101-Openlid_Ours_40epi聚焦于具有明确阶段性目标的开盖任务,有效解决了模仿学习中语义对齐与动作生成的耦合难题。数据集中包含的子任务自然语言描述和验证问题使得研究者能够探索基于语言条件的策略泛化机制,推动多模态融合与分层强化学习的发展。通过提供标准化的评估基准,该数据集为比较不同模仿学习算法在真实机器人上的表现提供了可复现的实验平台,从而加速了从示教数据到鲁棒策略的转化进程。
衍生相关工作
该数据集衍生的相关工作主要集中在基于LeRobot框架的模仿学习算法改进与多任务扩展。研究者利用其多模态特征开发了视觉-语言-动作联合表示模型,推动端到端策略网络的结构创新。基于该数据集,已有工作探索了动作分块预测与时序注意力机制,有效提升了长时域操作的成功率。此外,数据集中的子任务标注启发了层次化技能分解的研究,通过将复杂任务拆解为可复用的原子技能,促进了元学习与跨任务迁移方法的发展。未来,该数据集有望与仿真环境相结合,形成实物与虚拟数据协同训练的增强学习范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务