遇见数据集

CV-Rob/rollout_so101_lego_pick_place_20260526_185349

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是使用LeRobot创建的机器人操作数据集,专注于乐高拾放任务。数据集包含2个总episodes和53242个总帧,帧率为30 fps。特征包括:动作(6个关节位置,如肩部平移、肩部提升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置)、观测状态(与动作相同的6个关节位置)、观测图像(来自顶部摄像头和夹爪摄像头的视频,分辨率480x640,3通道,编码为av1)、干预标志(布尔值)、时间戳、帧索引、episode索引、索引和任务索引。数据集结构为Parquet文件,总数据大小约100 MB,视频文件大小约200 MB,机器人类型为so_follower。适用于机器人学习任务,如模仿学习或强化学习。

This dataset is a robotics manipulation dataset created using LeRobot, focusing on a Lego pick-and-place task. It contains a total of 2 episodes and 53,242 frames with a frame rate of 30 fps. Features include: action (6 joint positions such as shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper position), observation state (same 6 joint positions as action), observation images (videos from a top camera and a gripper camera, resolution 480x640, 3 channels, encoded as av1), intervention flag (boolean), timestamp, frame index, episode index, index, and task index. The dataset is structured in Parquet files, with a total data size of approximately 100 MB and video file size of about 200 MB. The robot type is so_follower. It is suitable for robotics learning tasks such as imitation learning or reinforcement learning.

提供机构:
CV-Rob
搜集汇总
数据集介绍
CV-Rob/rollout_so101_lego_pick_place_20260526_185349 数据集图片
构建方式
在机器人操作数据采集领域,高质量演示数据是策略学习与算法验证的基础。该数据集依托LeRobot框架完成系统性构建,面向SO101机械臂的乐高积木抓取与放置任务,通过遥操作方式驱动so_follower型机械臂执行操作,并同步采集六自由度关节位置、两路视觉图像以及干预标记等多模态信息。全部数据以30帧每秒的频率记录,总计53242帧、2个回合,按Parquet与视频文件分别存储于data与videos目录,遵循统一的分块索引结构,以保证轨迹数据在训练与回放中的一致性。
特点
该数据集的核心特征在于其多模态同步性与任务针对性。观测状态与动作空间均由肩部平移、肩部升降、肘部弯曲、腕部弯曲、腕部旋转及夹爪六个维度构成,配合gripper与top双视角视觉流,能够完整刻画机械臂在抓取与放置过程中的空间位姿与操作意图。数据以LeRobot v3.0规范组织,包含时间戳、帧索引、回合索引与任务索引等元信息,并设有干预标记,便于区分人工干预与自主执行片段,为模仿学习与离线强化学习提供结构清晰、语义明确的训练素材。
使用方法
在具体使用层面,研究者可借助LeRobot生态提供的加载接口直接读取Parquet数据文件与对应视频流,按chunk与file索引还原完整轨迹。数据中action与observation.state字段可用于行为克隆或策略网络的监督训练,observation.images.gripper与observation.images.top则适合作为视觉编码器的输入,用于端到端策略学习。intervention字段支持对干预样本的筛选与分析,timestamp与frame_index可用于时序对齐与帧级采样。通过官方可视化工具,用户还可在线浏览数据集内容,快速核验轨迹质量并开展下游实验。
背景与挑战
背景概述
在机器人学习领域,高质量的真实世界操作数据集是推动模仿学习与策略泛化研究的关键基础设施。本数据集由LeRobot框架构建,聚焦于SO-101机械臂执行乐高积木抓取与放置任务,包含2个演示回合、总计53242帧的同步视觉与状态-动作序列,并以30fps提供双视角RGB视频流。该数据集旨在为精细操作技能的学习与评估提供标准化样本,其结构化特征与开放许可使其能够直接服务于视觉-运动策略训练及跨平台算法基准测试,对推动低成本开源机器人学习生态具有积极意义。
当前挑战
从领域问题来看,精细抓取与放置任务对机器人的末端执行器控制精度、视觉遮挡下的物体位姿估计以及长时程动作序列的稳定性提出了严苛要求,现有策略在狭窄操作空间内的泛化能力仍显不足。就构建过程而言,该数据集仅含两个长时演示回合,样本多样性有限,容易导致模型过拟合于特定初始条件与光照环境;同时,高帧率双视角视频与状态动作数据的同步采集、存储及编解码需保证时序对齐与压缩质量,对数据管线的可靠性构成挑战;此外,单任务设定与真实机器人硬件依赖亦限制了其向多任务、多场景迁移的直接适用性。
常用场景
经典使用场景
在机器人学习领域,尤其是机械臂操作策略的模仿学习与离线强化学习研究中,该数据集呈现了典型的拾放任务场景。其核心用途在于通过SO-101型机械臂从顶部与夹爪双视角同步采集的视觉流,以及六维关节位置与动作序列,构建视觉-运动策略网络。研究者常利用其53242帧、30fps的高频时序数据,训练端到端的抓取与放置技能,并借助干预标志位区分人工引导与自主执行阶段,从而探索示教与自主学习的融合机制。
解决学术问题
该数据集直面机器人模仿学习中的若干核心难题,包括高维视觉输入与低维动作空间的映射学习、长时序任务中的误差累积与状态漂移,以及示教数据与自主探索数据分布不一致导致的策略泛化瓶颈。通过提供细粒度的关节位置、夹爪开合与双视角视频,它为研究离线策略评估、多模态表征学习及干预感知的模仿学习算法提供了可复现的基准,推动了数据驱动机械臂操控从仿真向真实世界迁移的学术进程。
衍生相关工作
以该数据集为基础,学术界与工业界衍生出多类经典工作,包括基于视觉-语言-动作模型的多任务策略迁移、融合干预信号的半自主强化学习框架,以及面向小样本场景的元模仿学习算法。这些工作利用该数据集的时序对齐与干预标注特性,验证了示教数据在策略初始化与在线微调中的关键作用,并进一步推动了LeRobot生态中数据集标准化与跨本体泛化研究的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务