遇见数据集

rollout_pick_n_place_dagger_r8

收藏
Hugging Face2026-06-19 更新2026-06-20 收录
官方服务:

资源简介:

该数据集由LeRobot创建,专注于机器人学任务,特别是拾放(pick and place)操作。数据集包含机器人控制所需的多模态数据:动作指令(action)为6维浮点数组,对应肩部平移、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置;观测状态(observation.state)为6维浮点数组,反映机器人关节位置;观测图像包括前端摄像头图像(observation.images.front)和标注图像(observation.images.annotated),均为480x640分辨率、3通道的RGB视频,帧率30 fps,编码为av1。此外,数据集还包含时间戳、帧索引、回合索引、索引和任务索引等元数据。数据规模为1个回合、1870帧、1个任务,数据文件总大小100 MB,视频文件总大小200 MB。数据以Parquet和MP4格式存储,适用于机器人模仿学习、视觉运动控制等任务,支持训练集划分。机器人类型为so_follower。

This dataset was created by LeRobot, focusing on robotics tasks, particularly pick-and-place operations. It contains multimodal data required for robot control: the action command (action) is a 6-dimensional float array corresponding to shoulder translation, shoulder lift, elbow flexion, wrist flexion, wrist rotation and gripper position; the observation state (observation.state) is a 6-dimensional float array that reflects the robot's joint positions. The observation images include front-facing camera images (observation.images.front) and annotated images (observation.images.annotated), both are 480x640 resolution, 3-channel RGB videos with a frame rate of 30 fps and encoded in AV1. In addition, the dataset also includes metadata such as timestamps, frame indices, episode indices, indices and task indices. The dataset has a scale of 1 episode, 1870 frames and 1 task, with a total size of 100 MB for data files and 200 MB for video files. The data is stored in Parquet and MP4 formats, suitable for tasks such as robot imitation learning and visual motion control, and supports training set splitting. The robot type is so_follower.

创建时间:
2026-06-06
原始信息汇总

数据集概述

  • 数据集名称:rollout_pick_n_place_dagger_r8
  • 任务类别:机器人(robotics)
  • 许可证:Apache-2.0
  • 创建工具:使用 LeRobot 创建

数据集结构

  • 数据格式:parquet 文件,路径为 data/*/*.parquet
  • 帧率:30 FPS
  • 机器人类型:so_follower

特征(Features)

特征名称 数据类型 形状 描述
action float32 [6] 机器人动作:shoulder_pan.pos, shoulder_lift.pos, elbow_flex.pos, wrist_flex.pos, wrist_roll.pos, gripper.pos
observation.state float32 [6] 机器人状态:shoulder_pan.pos, shoulder_lift.pos, elbow_flex.pos, wrist_flex.pos, wrist_roll.pos, gripper.pos
observation.images.front video [480, 640, 3] 前视摄像头视频(AV1编码,30 FPS,640x480,RGB)
observation.images.annotated video [480, 640, 3] 标注版摄像头视频(AV1编码,30 FPS,640x480,RGB)
timestamp float32 [1] 时间戳
frame_index int64 [1] 帧索引
episode_index int64 [1] 回合索引
index int64 [1] 全局索引
task_index int64 [1] 任务索引

数据集统计

  • 总回合数:1
  • 总帧数:1870
  • 总任务数:1
  • 数据分块大小:1000
  • 数据文件大小:约 100 MB
  • 视频文件大小:约 200 MB
  • 数据路径data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频路径videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4
  • 数据划分:训练集(train)包含全部数据(0:1)

可视化

搜集汇总
数据集介绍
rollout_pick_n_place_dagger_r8 数据集图片
构建方式
该数据集采用模仿学习中的DAgger(数据集聚合)算法进行构建,聚焦于机器人拾取与放置(pick and place)操作任务。通过将专家演示与策略执行过程中产生的交互数据逐步聚合,生成更具鲁棒性的示范轨迹。数据集共包含1个任务片段,共计1870帧数据,帧率为30Hz,所有数据存储为高效的Parquet格式,并整合了机器人本体状态与视觉观测信息,确保数据采集具备真实的闭环交互特性。
特点
数据集一个突出之处在于其多模态感知与行为记录的深度融合。它同时记录了6维关节角度控制指令与多角度视觉图像序列,包括正面摄像头和包含标注信息的图像数据,均为640x480分辨率、AV1编码的视频流。所有数据在时间上精确对齐,支持以30帧每秒的动态序列进行时序建模。此外,数据集明确标注了任务标签、片段索引等元信息,并遵循LeRobot统一规范,便于在机器人学习框架中直接调用。
使用方法
数据集可通过LeRobot框架快速加载与可视化,使用Hugging Face提供的专用工具可交互式浏览数据样本。数据被划分为训练集,用户可直接使用Parquet格式的结构化数据与MP4视频文件进行策略训练。动作空间与状态空间维度一致,均为6维连续关节指令,适合训练基于行为克隆(BC)、隐式策略或扩散策略等模仿学习模型。建议配合LeRobot提供的预处理与数据迭代器接口,高效完成模型训练与评估流程。
背景与挑战
背景概述
在机器人操作领域,模仿学习已成为从人类示教中习得复杂技能的关键范式。然而,高质量示范数据的获取往往依赖于昂贵的遥操作设备或人工标注,严重制约了算法的泛化能力与部署效率。为此,Anikitakis 等人于近年创建了 rollpick_n_place_dagger_r8 数据集,旨在推动基于 DAgger(Dataset Aggregation)策略的拾取与放置任务研究。该数据集利用 LeRobot 框架在 SO-Follower 机器人平台上采集,包含 1870 帧高精度运动轨迹及双视角视觉观测(480×640 分辨率),覆盖完整的六自由度关节空间动作(肩关节、肘关节、腕关节及夹爪)与状态信息。作为首个公开的面向机器人“拾取-放置”任务的 DAgger 交互式数据集,其设计思想强调通过在线策略迭代不断扩充示范分布,为后续开发能够从试探中自主校正的行为克隆模型提供了关键基准,对降低机器人技能学习的监督成本具有里程碑意义。
当前挑战
该数据集所聚焦的挑战可归纳为三个层面:一是领域问题的复杂性,拾取与放置任务要求机器人同时处理目标物体的空间定位、几何抓取姿态计算以及运动轨迹碰撞避免,尤其在非结构化环境中,物体形状、纹理与光照变化极易导致策略的脆弱性;二是 DAgger 策略实施中的数据质量难题,由于单次交互中仅含 1 个 episode(1870 帧)的有限示范,算法难以覆盖状态空间的多样性,易陷入专家轨迹分布偏移而引发累积误差;三是构建过程中的工程挑战,包括确保遥操作采集时机器人夹爪力度的精确标定、双路摄像头(front 与 annotated 视图)的时空同步,以及多模态数据(动作、状态、影像、时间戳)在 Parquet 与 MP4 格式下的高效存储与检索,这要求数据管道具备毫秒级的一致性保障。
常用场景
经典使用场景
在机器人学习领域,模仿学习是赋予智能体自主操作能力的关键途径,而高质量示范数据则是其成功的基础。rollout_pick_n_place_dagger_r8数据集专为机器人抓取与放置操作的模仿学习设计,通过DAgger(数据集聚合)范式采集了单条完整轨迹,包含1870帧时间步,覆盖从感知到动作的完整闭环。数据集中,六自由度机械臂的关节位置与夹爪状态作为状态特征,与前向摄像头及带标注信息的视觉观测共同构成多模态输入,驱动策略网络学习精准的拾取与放置行为。该数据集被广泛用于训练基于视觉的模仿学习模型,例如行为克隆或隐式策略网络,验证了受限数据下机器人复杂操作技能的可迁移性。
实际应用
在工业自动化与智能服务机器人的部署过程中,该数据集所代表的模拟环境数据管理方法具有显著实用价值。基于其DAgger范式采集的200MB视频与100MB结构化数据,开发人员可通过LeRobot工具链快速构建虚拟到现实的迁移流水线,例如针对分拣称重、零件装配或桌面清洁等重复性任务,预先在仿真中训练初步策略。数据集中的原始图像与融合标注信息的图像共同支持目标检测与动作规划联合优化,降低了对真实环境下大规模实物采集的依赖,显著缩短了从原型验证到量产应用的时间与成本。
衍生相关工作
该数据集在使用聚合式DAgger框架方面树立了典范,推动了多项关键衍生工作的产生。研究者基于其结构范式,开发了更高效的本质化聚合算法,将多源异构专家策略与自探索数据进行自适应融合;另一批工作则聚焦于其视频-结构化数据双通道特点,提出分层注意力机制以解耦时空依赖,并衍生出跨具身平台的零样本泛化框架。此外,针对其有限轨迹规模,涌现出多频段数据扩增与分布式并行采集策略,在保持数据一致性的前提下提升了策略的样本效率与复杂性上限,形成了持续迭代的数据-模型协同演进体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务