遇见数据集

put_banana_apple_in_pink_blue_plates

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

该数据集是使用LeRobot框架创建的机器人操作数据集。数据集包含一个遥操作任务:将香蕉和苹果放入粉色和蓝色盘子中(put banana and apple in pink and blue plates)。机器人类型为mantis_follower(基于UR5)。数据集包含50个episodes,共计15621帧,帧率为15fps。每个样本包含7维关节动作(6个自由度加夹爪)和对应的7维关节状态观测,以及来自四个摄像头的图像:左RGB、右RGB、左深度、右深度。深度图像为无损HEVC编码,单位为毫米,深度范围0.01-10米。RGB图像使用AV1编码。所有图像分辨率为720x1280。数据集还包含时间戳、帧索引、episode索引和任务索引。数据以parquet文件和MP4视频文件形式存储,总数据量约100MB(parquet)+200MB(视频)。许可证为Apache-2.0。该数据集适用于机器人操作策略学习、模仿学习、视觉运动控制等任务。

This dataset is a robot manipulation dataset created using the LeRobot framework. It contains a teleoperation task: put banana and apple in pink and blue plates. The robot type is mantis_follower (based on UR5). The dataset includes 50 episodes with a total of 15621 frames at 15fps. Each sample consists of 7-dimensional joint actions (6 degrees of freedom plus gripper) and corresponding 7-dimensional joint state observations, along with images from four cameras: left RGB, right RGB, left depth, and right depth. Depth images are lossless HEVC encoded in millimeters, with a depth range of 0.01-10 meters. RGB images use AV1 encoding. All images have a resolution of 720x1280. The dataset also includes timestamps, frame indices, episode indices, and task indices. Data is stored as parquet files and MP4 video files, with a total size of approximately 100MB (parquet) + 200MB (video). License: Apache-2.0. The dataset is suitable for robot manipulation policy learning, imitation learning, visual motor control, etc.

创建时间:
2026-08-26
原始信息汇总

数据集概述

  • 数据集名称: put_banana_apple_in_pink_blue_plates
  • 许可证: Apache-2.0
  • 任务类别: 机器人学 (robotics)
  • 标签: LeRobot, 机器人学, ur5, 操作 (manipulation), 遥操作 (teleoperation)
  • 创建工具: LeRobot (https://github.com/huggingface/lerobot)

数据集结构

  • 总片段数 (episodes): 50
  • 总帧数 (frames): 15,621
  • 总任务数 (tasks): 1
  • 帧率 (fps): 15
  • 机器人类型: mantis_follower
  • 数据划分: 训练集 (train) 0:50

数据特征 (Features)

  • action: 7维浮点数组, 包含6个关节位置和1个夹爪位置
  • observation.state: 7维浮点数组, 与action结构相同
  • observation.images.left: 视频数据, 分辨率720x1280, 3通道, 编码AV1, 帧率15fps
  • observation.images.right: 视频数据, 分辨率720x1280, 3通道, 编码AV1, 帧率15fps
  • observation.images.left_depth: 深度视频数据, 分辨率720x1280, 1通道, 编码HEVC, 深度单位mm
  • observation.images.right_depth: 深度视频数据, 分辨率720x1280, 1通道, 编码HEVC, 深度单位mm
  • timestamp: 时间戳, 1维浮点数组
  • frame_index: 帧索引, 1维整数数组
  • episode_index: 片段索引, 1维整数数组
  • index: 索引, 1维整数数组
  • task_index: 任务索引, 1维整数数组

数据文件

  • 数据文件格式: Parquet
  • 视频文件格式: MP4
  • 数据文件大小: 约100 MB
  • 视频文件大小: 约200 MB
搜集汇总
数据集介绍
put_banana_apple_in_pink_blue_plates 数据集图片
构建方式
该数据集名为put_banana_apple_in_pink_blue_plates,是基于LeRobot框架通过遥操作方式采集的机器人操作数据集。数据采集使用了UR5机械臂,执行将香蕉和苹果分别放入粉色和蓝色盘子的任务。数据包含50个演示回合,共15621帧,记录了7维关节动作(包括6个关节位置和夹爪位置)以及左右两个视角的RGB图像和深度图像,图像分辨率为720x1280,帧率15fps。数据以Parquet和MP4格式存储,分为训练集和验证集,训练集包含全部50个回合。
特点
数据集具有多维感知与动作对齐的特性,同时包含RGB图像、深度图像和关节角度信息,为视觉-运动控制模型提供了丰富的输入模态。深度图像以无损HEVC编码保存,确保了深度数据的精度。数据以15fps采样,覆盖了完整的任务执行过程,动作与观测同步记录。此外,数据集包含时间戳、帧索引和回合索引等元数据,便于时序建模和数据划分。该数据集专门用于机器人模仿学习任务,场景设计具有明确的目标导向,适合研究多物体分类放置的操纵问题。
使用方法
使用LeRobot库加载该数据集,可通过HuggingFace datasets库读取Parquet文件,配合视频文件获取图像序列。用户可参考LeRobot的教程,将数据转换为训练所需的格式,用于训练视觉运动策略,如扩散策略或行为克隆。数据集提供了统一的接口,支持动作和观测的同步提取,便于进行端到端的模仿学习评估。具体使用时,需安装LeRobot并按照其数据加载示例进行操作,并可通过可视化工具进行数据预览。
背景与挑战
背景概述
在机器人操作领域,模仿学习已成为实现复杂技能的重要手段,而高质量的数据集则是训练稳健策略的基石。该数据集由Hugging Face团队与外部研究者合作创建,基于LeRobot框架,利用UR5机械臂进行远程操作,旨在研究将香蕉和苹果分别放入粉色和蓝色盘子的精细操作任务。数据集包含50个示范轨迹,共计15,621帧,记录了高分辨率RGB图像、深度图像以及7维关节角度和夹爪状态,为多模态感知与动作预测提供了丰富信息。其核心研究问题聚焦于从真实世界示范中学习可泛化的操作策略,并探索多视角视觉与深度信息的融合对任务性能的影响。该数据集以其标准化的格式、开源的许可和对LeRobot生态的集成,为机器人学习社区提供了可复现的基准,推动了基于视觉的抓取与放置任务的研究进展。
当前挑战
该数据集所解决的领域问题在于复杂物体的精准识别与位置估计,以及多步骤操作任务的序列学习,其挑战包括:物体(香蕉和苹果)在形状、颜色和纹理上的差异要求模型具备细粒度视觉感知能力;粉色和蓝色盘子的目标位置变化则对空间泛化提出要求。构建过程中,远程操作需要确保动作的平滑性和一致性,以减少噪声对策略学习的干扰;多传感器数据的同步采集(如RGB、深度、关节角度)带来校准和时间对齐的难题;此外,数据规模相对有限(50个episodes),如何通过数据增强或迁移学习弥补数据不足,也是训练鲁棒模型的关键挑战。这些挑战考验着从数据采集到算法设计的各个环节,驱动着机器人操作数据领域的持续创新。
常用场景
经典使用场景
该数据集基于UR5机械臂与LeRobot遥操作框架构建,聚焦于将香蕉和苹果分别放入粉色与蓝色盘子的精细操作任务。它提供了50个完整回合、总计15621帧的多模态数据,包括高分辨率RGB图像、深度图以及7维关节角度与夹爪动作序列。此类数据集是模仿学习与行为克隆研究的经典基准,常用于训练视觉-运动策略,使机械臂能够从视觉输入直接映射到低层控制指令,从而验证算法在真实物理环境下的泛化能力与鲁棒性。
衍生相关工作
此数据集催生了以LeRobot框架为核心的一系列策略学习工作,例如基于Transformer的动作分块(Action Chunking with Transformers, ACT)和扩散策略(Diffusion Policy)在此类数据上的微调与评测。研究者亦已构建多任务扩展版本,结合其他操作基准进行联合训练,以提升跨任务迁移能力。其公开的视频与状态数据促进了机器人学习社区对遥操作数据质量、相机配置及策略鲁棒性的深入研究,并衍生出用于数据增强与仿真到现实迁移的多样化基准。
数据集最近研究
最新研究方向
在具身智能与机器人操作领域,基于遥操作演示的数据驱动学习正成为推动泛化操作能力跃升的关键范式。该数据集聚焦于UR5机械臂在双色托盘间进行香蕉与苹果的精细分拣任务,通过同步采集高分辨率RGB图像、深度图及关节角度状态,为模仿学习与强化学习算法提供了多模态、时序对齐的训练语料。其前沿研究指向利用视觉-语言-动作模型实现跨物体类别的语义理解与操作策略迁移,同时结合深度信息增强对透明或遮挡物体的鲁棒感知。该数据集的发布不仅助力于机器人从单一任务执行向灵活任务组合的演进,也为评估算法在动态环境中的适应性与安全性提供了标准化基准,对未来家庭服务机器人在非结构化场景中的实际部署具有重要推动意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务