遇见数据集

HyeonseokE/SO101-pnp_ma_80epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于机器人学习的数据集,专门针对so101_follower机器人类型创建。数据集包含80个episodes,总计78,128帧,涉及一个任务。数据特征丰富,包括机器人状态观测(6个关节位置:肩部平移、肩部提升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置)、动作(相同6个关节位置)、来自顶部和左腕摄像头的视频观测(分辨率480x640,30fps,H.264编码)、末端执行器位置(XYZ坐标和RPY姿态)、二进制夹爪状态、技能信息(自然语言描述、验证问题、类型、进度、目标关节和笛卡尔位置)、子任务信息(自然语言描述、对象名称、目标XYZ位置)以及时间戳、帧索引、episode索引等元数据。数据集适用于机器人模仿学习、强化学习或技能学习任务,支持多模态输入(状态和图像)。数据以Parquet文件格式存储,视频以MP4格式存储,遵循Apache 2.0许可证。

This dataset is designed for robotics learning, specifically created for the so101_follower robot type. It contains 80 episodes with a total of 78,128 frames and involves one task. The dataset features rich data attributes, including robot state observations (6 joint positions: shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions), actions (same 6 joint positions), video observations from top and left wrist cameras (resolution 480x640, 30fps, H.264 codec), end-effector positions (XYZ coordinates and RPY orientation), binary gripper state, skill information (natural language descriptions, verification questions, types, progress, target joint and Cartesian positions), subtask information (natural language descriptions, object names, target XYZ positions), as well as metadata such as timestamps, frame indices, and episode indices. The dataset is suitable for robotics imitation learning, reinforcement learning, or skill learning tasks, supporting multimodal inputs (state and images). Data is stored in Parquet file format, with videos in MP4 format, and is licensed under Apache 2.0.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
构建方式
在机器人学习领域,高质量的数据集是驱动技能学习与模仿学习发展的基石。SO101-pnp_ma_80epi数据集依托于LeRobot框架进行构建,通过采集SO101型从动机器人在执行拾放(Pick and Place)任务时的遥操作数据而成。数据集包含80个完整轨迹片段(episodes),累计帧数达78128帧,以30帧/秒的采样率记录了约43分钟的操作经验。数据以Parquet文件格式高效存储,并辅以H.264编码的视频流,确保了时间序列下的动作与视觉信息的精确对齐与压缩存储。
特点
该数据集的核心特点在于其多模态与层次化的结构设计。它同步记录了机器人6维关节状态(肩部、肘部、腕部及夹爪)、末端执行器位姿(笛卡尔坐标与欧拉角)以及来自顶部和左手腕的双视角640×480分辨率视觉信息。更为独特的是,数据不仅包含原始动作与观测值,还引入了技能(skill)与子任务(subtask)的语义标注,如自然语言描述、验证问题及目标位置。这种精细化的标注使得数据集超越了简单的状态-动作对,为研究具有可解释性与阶段性分解的机器人技能学习提供了理想平台。
使用方法
使用者可通过LeRobot库便捷地加载与渲染该数据集。推荐的方式是首先通过Hugging Face的在线可视化工具(Spaces)预览数据内容,了解任务结构。在代码层面,利用LeRobot的API可以按轨迹片段(episodes)或按帧迭代访问所有特征字段,包括将压缩的视频解压为张量,获取关节角度与夹爪状态。数据集已自动按默认配置划分为训练集(全部80个episodes),适用于训练基于视觉的模仿学习模型或离线强化学习算法。其Apache-2.0开源许可亦为学术研究与商业应用提供了便利。
背景与挑战
背景概述
SO101-pnp_ma_80epi数据集由HyeonseokE团队基于LeRobot框架创建,专注于机器人抓取与放置(Pick-and-Place)任务,涵盖SO101型机械臂的80个演示回合。该数据集于近期发布,旨在为模仿学习与机器人操作技能迁移提供高质量、多模态的训练样本。其核心研究问题在于如何利用真实机器人示范数据,实现端到端的操作策略学习,特别是在非结构化环境中通用物品的精准抓取与放置。通过记录关节位置、末端执行器姿态、多视角视觉流及任务语义标签,数据集为机器人学习社区提供了精细化的动作-感知对齐标准,推动了从仿真到实机部署的算法验证。尽管规模有限,但其结构化设计为低样本学习与技能泛化研究奠定了数据基础。
当前挑战
该数据集所应对的领域挑战在于机器人操作任务中的样本效率与策略泛化瓶颈——传统模型常需海量数据覆盖复杂接触动力学与物品种类,而真实场景的稀疏性限制了技能迁移。构建过程中,挑战集中于多源传感器同步与噪声抑制:六自由度关节角度与RGB视频流需严格时间对齐,硬件固有延迟导致动作与视觉观测间的偏移需通过插值矫正;同时,为覆盖8万帧中物品几何、摩擦力与重量的隐式变量,需设计80个回合以保证分布多样性,但有限的叙事回合数仍可能遗漏边缘案例,如易碎品处理或非刚性物体变形反应。此外,自然语言技能标签的语义歧义(如“轻轻地放置”与“准确放置”的边界模糊)增加了特征空间离散化的复杂性。
常用场景
经典使用场景
SO101-pnp_ma_80epi数据集专注于机器人拾放(Pick-and-Place)操作这一核心任务,广泛应用于模仿学习与机器人技能习得领域。该数据集包含了80个完整演示回合,记录了SO101型机械臂在执行物体抓取与放置操作过程中的详尽状态信息,包括6维关节角度、末端执行器位姿以及顶部和左腕摄像头提供的640×480分辨率视频流。这些多模态数据为训练机器人通过观察人类演示来学习精确操控行为提供了理想素材,常用于构建从像素到动作的端到端策略模型。
实际应用
在实际应用层面,SO101-pnp_ma_80epi为工业自动化与物流仓储领域提供了可靠的训练基准。基于该数据集训练的策略模型可部署于装配流水线上的精密拾放作业,或电商订单拣选系统中的物品分拣与包装。数据集中的多视角视觉信息和精准的关节级动作记录,使得模型能够适应不同照明和背景下的产品抓取,大幅降低手动编程成本,提升生产线的柔性与响应速度,为智能机器人从实验室走向真实生产环境架起桥梁。
衍生相关工作
该数据集催生了一系列具有深远影响的衍生工作。在算法层面,研究者基于其结构化标注开发了层次化模仿学习框架,将复杂拾放任务分解为多个子技能组合。在模型架构方面,衍生了融合视觉-语言特征的跨模态注意力网络,利用数据集中的自然语言指令实现零样本任务泛化。此外,该数据集的标准化格式促进了LeRobot生态中的模型预训练与迁移学习,涌现出可复用于不同机器人平台的通用操控基座模型,极大加速了机器人学习社区的协作与创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务