遇见数据集

HyeonseokE/SO101-Openlid_Ours_20epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人领域的数据集,使用LeRobot创建,专门针对SO101跟随者机器人。它包含20个完整的情节(episodes),总计6729帧数据,专注于单一任务。数据集以parquet格式存储数据,并配有视频文件(总大小约300MB,其中数据100MB,视频200MB),帧率为10fps。数据集的特征包括:观察状态(6维关节位置)、动作(6维关节控制)、图像观察(顶部和左腕摄像头,分辨率480x640)、末端执行器位置(6维XYZRPY坐标)、抓取器二进制状态、技能信息(自然语言描述、验证问题、类型、进度、关节和末端执行器目标位置)、子任务信息(自然语言描述、对象名称、目标位置)以及时间戳和索引(帧、情节、任务等)。数据用于机器人学习和控制任务,支持训练分割。

This dataset is a robotics dataset created using LeRobot, specifically for the SO101 follower robot. It contains 20 complete episodes, totaling 6729 frames, and focuses on a single task. The data is stored in parquet format and accompanied by video files (total size approximately 300MB, with 100MB for data and 200MB for videos), at a frame rate of 10fps. The dataset features include: observation state (6-dimensional joint positions), action (6-dimensional joint control), image observations (top and left wrist cameras, resolution 480x640), end-effector position (6-dimensional XYZRPY coordinates), gripper binary state, skill information (natural language description, verification question, type, progress, joint and end-effector goal positions), subtask information (natural language description, object name, target position), and timestamps and indices (frame, episode, task, etc.). It is designed for robot learning and control tasks, supporting a training split.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-Openlid_Ours_20epi 数据集图片
构建方式
该数据集基于LeRobot框架构建,专注于SO101机械臂的操作任务。数据采集自20个完整回合(episode),共计6729帧,涵盖了机器人执行单一任务的全过程。每帧数据以Parquet格式存储,包括6维关节状态(如肩部、肘部、腕部等位置信息)、对应的6维动作指令、顶部和左腕两个视角的640×480分辨率视频流,以及末端执行器的位姿和夹爪状态。视频采用H.264编码,帧率为10FPS,保证了时间分辨率的精细度。所有采集的数据按照“data”和“videos”两个目录组织,并以分块形式存放,便于高效读取和管理。
特点
数据集的显著特点在于其多模态与结构化设计。它同时提供了低维状态信息(关节角度、末端位姿、夹爪状态)与高维视觉观测(双视角RGB视频),为模仿学习等算法提供了丰富的感知输入。此外,数据集中包含详尽的语义标签,例如用自然语言描述的技能和子任务类型、验证问题、目标位置坐标以及进度指示器,使得每一条轨迹都具备可解释性,能够支持任务分解和技能泛化等高级研究。数据集规模适中,总大小约300MB,便于快速实验和模型验证。
使用方法
采用方式简便,用户可通过LeRobot库直接加载该数据集。在Python环境中安装LeRobot后,使用`load_dataset`函数并指定数据集路径`HyeonseokE/SO101-Openlid_Ours_20epi`即可获取训练数据。数据集默认划分为训练集,包含全部20个回合。读取后,用户可便捷地访问`observation.state`、`action`、`observation.images`等字段,用于构建行为克隆、扩散策略等模仿学习模型。Hugging Face提供的可视化工具(如Spaces中的演示页面)允许用户在不下载完整数据集的情况下,在线浏览和检验数据质量,降低了使用门槛。
背景与挑战
背景概述
在机器人学习领域,模仿学习作为实现复杂操作任务的关键范式,长期受制于高质量、多模态演示数据的匮乏。SO101-Openlid_Ours_20epi数据集由研究者HyeonseokE等人创建,依托Hugging Face LeRobot开源框架构建,旨在为机械臂精细操作(如开盖任务)提供标准化训练基准。该数据集聚焦于SO101跟随机器人平台,收录了20个完整演示片段,总计6729帧时序数据,以10帧/秒的采样率记录关节角度、末端执行器位姿、视觉图像及语言指令等多模态信息。通过引入自然语言技能描述、验证问答与子任务分解等结构化标注,数据集推动了语言引导的机器人操作研究,并为跨场景泛化能力评估提供了关键资源。其对机器人研究社区的核心贡献在于降低了模仿学习数据采集的门槛,促进了基于视觉-语言-动作联合表征的端到端模型发展。
当前挑战
该数据集所解决的领域核心挑战在于机器人操作中稀疏奖励下的长期依赖与高精度控制,传统强化学习因样本效率低下而难以应对此类密闭容器开启任务。数据集构建过程中面临多重困难:首先,确保演示质量要求操作者一致性动作记录与噪声抑制,而6自由度关节状态与高分辨率视频(640×480像素)的同步采集增加了硬件校准复杂度;其次,20个片段(总时长约11分钟)的小规模特性虽降低采集成本,却对模型过拟合提出了严峻考验,需借助数据增强或预训练策略缓解;此外,自然语言指令与机器人动作的语义对齐、子任务边界界定等标注工作易引入主观偏差,直接影响跨用户迁移的鲁棒性。
常用场景
经典使用场景
在机器人学习领域,SO101-Openlid_Ours_20epi数据集为模仿学习和策略训练提供了基础。该数据集包含20个演示片段,共计6729帧,采集自SO101型机器人执行开盖任务,记录了从关节状态、末端执行器位姿到多视角视觉图像的完整信息。经典使用方式是利用这些示教数据训练行为克隆或隐式策略模型,使机器人能够复现开盖这一精细操作。视觉与状态信息的融合使该数据集特别适合多模态表征学习研究。
解决学术问题
该数据集聚焦于机器人在柔性物体操作中的复现性难题,尤其是开盖这类需协调力位控制的任务。通过提供完整的动作轨迹、状态序列及视觉观测,它解决了从人类演示中学习操作策略的学术挑战,特别是数据稀缺条件下的迁移学习问题。该数据集促使研究者探索如何利用少量示教数据实现鲁棒策略泛化,对理解机器人技能获取中的状态表示学习与行为克隆效率具有重要意义。
衍生相关工作
该数据集衍生了多项机器人学习的前沿工作,包括基于隐式策略的少样本模仿学习框架、多视角视觉状态融合的对比学习方法,以及结合语言指令的任务分解模型。相关工作利用数据集中'自然语言子技能'与'验证问题'字段实现层次化策略学习,推动了从原始传感器数据到语义符号表示的研究进展,形成了面向柔性操作任务的数据驱动方法论体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务