遇见数据集

CoRL2026-CSI/SO101-pnp_ma_30epi

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人学习数据集,使用LeRobot工具创建,专门用于机器人控制任务。数据集包含30个训练集,总帧数为28324,帧率为30fps。数据集中使用SO101跟随者机器人类型,涉及单一任务。数据集结构包括多个特征:观测状态(如关节位置)、动作(关节控制命令)、图像观测(来自顶部和左腕摄像头的视频,分辨率480x640,RGB格式)、末端执行器位置(机器人坐标和旋转)、夹持器状态、技能信息(如自然语言描述、验证问题、类型、进度、目标位置)、子任务信息(如自然语言描述、对象名称、目标位置)、以及时间戳、帧索引、集索引等元数据。数据以parquet文件格式存储,视频文件以mp4格式存储,总数据文件大小为100MB,视频文件大小为200MB。数据集旨在支持机器人模仿学习和技能学习研究。

This dataset is a robotics learning dataset created using the LeRobot tool, specifically designed for robot control tasks. It contains 30 training episodes with a total of 28,324 frames at 30fps. The dataset uses the SO101 follower robot type and involves a single task. The dataset structure includes multiple features: observation states (e.g., joint positions), actions (joint control commands), image observations (videos from top and left wrist cameras, resolution 480x640, RGB format), end-effector positions (robot coordinates and rotation), gripper states, skill information (e.g., natural language descriptions, verification questions, types, progress, goal positions), subtask information (e.g., natural language descriptions, object names, target positions), and metadata such as timestamps, frame indices, and episode indices. Data is stored in parquet file format, with video files in mp4 format; the total data file size is 100MB, and video file size is 200MB. The dataset aims to support research in robot imitation learning and skill learning.

提供机构:
CoRL2026-CSI
搜集汇总
数据集介绍
CoRL2026-CSI/SO101-pnp_ma_30epi 数据集图片
构建方式
该数据集是依托LeRobot框架精心构建而成,旨在为机器人操作学习提供高质量的示范数据。数据集内含30个完整演示回合(episodes),总计28,324帧序列,覆盖单一拾放(Pick-and-Place)任务场景,并统一划分为训练集使用。数据以Parquet格式存储底层结构化特征,而高帧率(30 FPS)的视觉观测信息则采用H.264编码的MP4视频文件记录。相机视角涵盖顶部与左侧手腕双路影像,分辨率为480×640像素,可提供丰富的空间与操作细节。机器人本体状态与动作空间均为6维浮点向量,对应肩部平动、肘部屈伸、腕部俯仰与旋转、夹爪开合等关键关节自由度,确保数据具备精细的运动描述能力。
特点
该数据集的最大特色在于其丰富多层的语义标注体系。除基础的关节状态与末端执行器位姿外,每条数据还附加了自然语言描述、验证问题、技能类型(skill.type)及其完成进度(skill.progress),从而为高层次任务规划与语言引导策略研究奠定基础。技能目标位姿被冗余记录于关节空间、笛卡尔空间及夹爪状态中,有助于多模态对齐与迁移学习。子任务级别的语言标签与目标物体名称、三维空间位置亦被详尽收录,使得从宏观技能到微观动作的阶段化学习成为可能。此外,数据采集频率恒定,时序戳与帧索引信息完整,便于序列建模与因果推断。
使用方法
本数据集高度适配LeRobot生态体系,可经由Hugging Face Spaces提供的可视化交互工具直接预览各演示片段。在模型训练中,推荐使用PyTorch或JAX框架,按序读取Parquet格式的状态与动作数据,并结合H.264视频流为策略网络提供视觉观测输入。数据已预置单任务训练集划分,用户可直接调用LeRobot库中的DataLoader模块实现批量加载与随机混洗。对于面向技能分解与自然语言指令跟随的仿真或实体机器人研究,可利用数据集中精细的skill与subtask层级标注构建条件式决策模型,开展端到端模仿学习或基于语言引导的分层强化学习实验。
背景与挑战
背景概述
随着具身智能与模仿学习的蓬勃发展,机器人从人类演示中直接习得复杂操作技能成为研究热点。SO101-pnp_ma_30epi数据集由CoRL2026-CSI团队基于LeRobot框架创建,聚焦于SO101型六自由度机械臂的拾取与放置(pick-and-place)任务。该数据集包含30个演示片段,共计28324帧,以30帧/秒的频率同步采集了机械臂6个关节角度、末端执行器位姿、夹爪状态及顶部与左腕双视角RGB视频(分辨率480×640),并辅以自然语言描述的子任务标签与目标验证信息。通过提供高保真的多模态观测-动作序列,该数据集旨在标准化机器人精细操作研究的评价基准,推动从仿真到真实世界的策略泛化能力研究。
当前挑战
该数据集面临的核心挑战首先源于精细操作任务本身的复杂性:拾取与放置需要对目标物的精确抓取、稳定转移与准确定位,机械臂在狭窄工作空间中需协调六个自由度以实现无碰撞运动,并对夹爪力与位置进行亚毫米级控制。其次,数据构建过程中存在多重技术难点:通过遥操作或动觉示教采集高质量演示时,操作者的抖动与不一致性会引入噪声;30个轨迹的有限样本难以覆盖多样化的物体形状、材质与起始位置,导致策略面临严重的分布偏移;多视角视频与高维关节状态的同步记录也对硬件时序校准提出了严苛要求。此外,现有模型是否能从这类静态演示中有效解耦技能意图与运动基元,仍是亟待突破的瓶颈。
常用场景
经典使用场景
在机器人学习领域,SO101-pnp_ma_30epi数据集专为机械臂拾取与放置(Pick-and-Place)任务而生。其数据以30帧每秒的高频采样,记录了SO101型从动机械臂在30个示范回合中的完整动作序列,包括肩部、肘部、腕部及夹爪的6维关节状态与对应的6维动作指令。通过多视角视觉信息(顶部与左腕摄像头)、末端执行器位姿及子任务级语义标注,该数据集为模仿学习与行为克隆算法提供了高质量的示范数据,尤其适合训练深度神经网络将视觉观测直接映射为连续动作,是实现机器人精细操作技能迁移的基石。
解决学术问题
该数据集核心解决了机器人操作中从示范到泛化的学术难题。具体而言,它攻克了如何基于有限示范习得可迁移操作策略的挑战——30个回合虽少,但通过结构化元数据(如自然语言技能描述、验证问题、子目标关节位姿)为少样本学习与层级式策略分解提供了理想试验场。研究者可借此探索多模态感知融合(视觉-状态-语言)对抓取与放置成功率的提升机制,并验证跨任务泛化能力,对推动具身智能中“感知-决策-执行”闭环的理论构建具有显著意义。
衍生相关工作
围绕SO101-pnp_ma_30epi数据集,衍生了一系列标志性工作。LeRobot框架将其作为标准基准,催生了基于Transformer的动作分块(Action Chunking)与扩散策略的机器人指令跟随模型。研究者借鉴其分层技能结构,开发出借助大语言模型将自然语言任务分解为操作原语的方法,并验证了视觉运动策略在跨对象泛化中的有效性。此外,数据集中的验证问题标注启发了交互式错误校准机制,推动具身智能体向可自纠、可解释的演进,成为连接仿真示范到实物部署的关键跳板。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务