遇见数据集

lettuce-to-plate

收藏
Hugging Face2026-06-08 更新2026-06-09 收录
官方服务:

资源简介:

该数据集是一个机器人操作数据集,专为机器人模仿学习、策略学习及相关研究设计。数据集使用LeRobot框架创建,采集自名为blueberry_ros的双臂机器人平台,记录了机器人执行特定操作任务时的多模态信息。数据规模包括55个完整操作序列(episodes),总计41,186个时间步(frames),数据文件总大小约100 MB,关联视频文件总大小约200 MB。数据以15 FPS的帧率采集,并以分块(chunk)形式存储在Parquet文件中,目前仅提供训练集(train split)。数据内容涵盖丰富的机器人状态与动作信息:动作(action)为26维浮点向量,包括机器人左臂和右臂的末端执行器线速度与角速度、左右手各手指关节角度以及机器人基座平移控制量;状态观测(observation.state)为55维浮点向量,包括左右臂各关节位置与力矩、左右手各手指关节位置与力矩以及凝视向量;视觉观测(observation.images)提供四个视角的同步RGB视频流(左眼、右眼、用户视角、用户凝视视角),分辨率640x480,3通道,以AV1编码存储;索引信息包括时间戳、帧索引、序列索引等,便于数据对齐。该数据集适用于需要结合高层指令、低层关节控制与多视角视觉感知的机器人学习任务,如行为克隆、视觉运动策略学习和多模态表征学习。

This dataset is a robot manipulation dataset designed for robot imitation learning, policy learning, and related research. It is created using the LeRobot framework and collected from the blueberry_ros dual-arm robot platform, recording multimodal information during the robots execution of specific manipulation tasks. The dataset scale includes 55 complete operation episodes, totaling 41,186 frames, with a total data file size of approximately 100 MB and associated video files of about 200 MB. Data is collected at a frame rate of 15 FPS and stored in Parquet files in chunks, currently only providing a training split. The data content encompasses rich robot state and action information: action is a 26-dimensional floating-point vector, including linear and angular velocities of the left and right arm end-effectors, joint angles of left and right hand fingers, and base translation controls; observation.state is a 55-dimensional floating-point vector, including position and torque of left and right arm joints, position and torque of left and right hand finger joints, and a gaze vector; observation.images provides synchronized RGB video streams from four perspectives (left eye, right eye, user view, user gaze view), with a resolution of 640x480, 3 channels, stored in AV1 encoding; indexing information includes timestamps, frame indices, episode indices, etc., for easy data alignment and retrieval. This dataset is suitable for robot learning tasks that require integration of high-level instructions, low-level joint control, and multi-view visual perception, such as behavior cloning, visual-motor policy learning, and multimodal representation learning.

创建时间:
2026-06-06
原始信息汇总

数据集概述:lettuce-to-plate

  • 来源: 该数据集使用 LeRobot 创建。
  • 许可协议: Apache-2.0
  • 任务类型: 机器人学 (robotics)

数据集规模

指标 数值
总 Episode 数 55
总帧数 41,186
总任务数 1
FPS 15
数据文件大小 100 MB
视频文件大小 200 MB
  • 训练/测试分割: 全部 55 个 Episode 用于训练。
  • 机器人类型: blueberry_ros

数据集特征

数据集包含动作、状态观测和多个摄像头视角的图像。

  • 动作 (action): 一个包含 26 个浮点数的向量,包括:

    • 左右手臂的线性和角速度 (x, y, z)
    • 左右手的五指位置 (pinky, ring, middle, index, thumb1, thumb2)
    • 底盘控制 (base_joy.x, base_joy.y)
  • 状态观测 (observation.state): 一个包含 55 个浮点数的向量,包括:

    • 左右手臂 7 个关节的位置 (pos) 和扭矩 (effort)
    • 左右手 6 个手指关节的位置 (pos) 和扭矩 (effort)
    • 视线追踪数据 (gaze.x, gaze.y, gaze.valid)
  • 图像观测 (observation.images): 四路分辨率为 480x640 的彩色视频流 (AV1 编码, 15 FPS):

    • left: 左侧摄像头
    • right: 右侧摄像头
    • user: 用户视角摄像头
    • user_gaze: 用户注视点摄像头
  • 其他特征: 时间戳 (timestamp)、帧索引 (frame_index)、episode 索引 (episode_index)、数据索引 (index)、任务索引 (task_index)。

数据集结构

  • 数据路径: data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频路径: videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4
  • 配置: default,数据文件为 data/*/*.parquet
  • 引用: 暂无提供 BibTeX 引用。
搜集汇总
数据集介绍
lettuce-to-plate 数据集图片
构建方式
在机器人学习领域,面向复杂操作任务的高质量数据集是推动技术发展的关键基石。本数据集基于LeRobot框架构建,聚焦于“生菜盛盘”这一精细操作场景,通过远程操控蓝莓机器人平台采集了55个完整演示片段,共计41186帧数据。每个片段以15帧/秒的速率记录,涵盖了双臂协同的26维动作指令(包括双臂线性与角速度、各手指关节位置及底盘控制)以及55维机器人状态信息(涵盖关节位置、力矩与操作者视线坐标),并同步保存了来自左、右、用户视角及视线追踪共四路480×640像素的AV1编码视频流,数据总量约300MB。
特点
本数据集具有鲜明的多模态与高维度特点。动作空间包含双臂各7自由度、双手各5自由度及2维底盘控制,共26维连续指令,贴合真实双臂机器人的操作复杂性。观测状态则融合了关节位置与力矩,以及操作者注视点信息,共计55维,为模仿学习提供了丰富的机器人本体与外感知线索。四路同步视频不仅从双机械臂侧方记录操作细节,还创新性地引入了操作者第一人称视角与视线追踪画面,使得人类操作意图与注视焦点可被显式编码,有利于训练具备注意力机制的操作模型。
使用方法
该数据集设计为可直接被LeRobot框架调用,无需额外预处理。用户可通过LeRobot的数据集可视化工具预览各片段内容。数据以Parquet格式存储非图像信息,视频按秒级分块压缩为MP4文件,便于流式加载。训练时,可将单片段内连续帧的观测图像与状态序列作为输入,以对应的26维动作向量作为监督信号,构建基于行为克隆或隐式策略的模仿学习模型。需注意所有数据均未划分验证集,建议用户自行利用交叉验证或留出部分片段进行模型评估。
背景与挑战
背景概述
该数据集由研究团队基于LeRobot框架构建,于近期发布,旨在推动机器人操控领域的发展,特别是针对精细操作任务的研究。数据集聚焦于“生菜装盘”这一具体场景,通过55个示范片段、总计41186帧的高频数据(15FPS),记录了双臂机器人(Blueberry ROS平台)从抓取到放置的完整操作流程。核心研究问题在于如何利用多模态观测(包括左右相机、用户视角及眼动追踪视频)与高维动作空间(26维动作指令),实现从人类演示到机器人的技能迁移。该数据集为模仿学习、行为克隆等算法提供了标准化基准,对提升机器人在非结构化环境中的操作鲁棒性具有重要影响力。
当前挑战
数据集的核心挑战在于解决机器人精细操作中的领域问题:生菜作为易变形物体,其形态多变且缺乏刚性约束,要求机器人具备对柔顺物体的精准抓取与力控能力,而传统刚性操作策略难以直接适用。构建过程中,数据采集面临高精度传感与同步的难题,需协调26维动作指令(涵盖双臂关节、手指开合及基座移动)与多路视频流(左右相机、用户视角及眼动追踪)的时序对齐。此外,仅有55个示范片段的数据规模限制了模型泛化性,如何从有限演示中提取通用操作模式并应对未见过的生菜形态,是当前亟需突破的瓶颈。
常用场景
经典使用场景
在机器人学习领域,灵巧操作任务一直是研究的前沿与难点。lettuce-to-plate数据集聚焦于将生菜从初始位置放置到餐盘这一精细操作场景,为机器人学习提供了标准化的模仿学习与强化学习基准。该数据集包含55个完整演示片段,总计超过4万帧的高频状态-动作序列,每个片段详细记录了双臂26维动作指令和55维观测状态,包括关节位置、力矩以及多视角视觉输入。研究者可基于此训练机器人从视觉观察中学习复杂的双手协调和力控策略,尤其适用于基于行为的克隆学习、隐式策略优化等主流算法。
解决学术问题
该数据集系统性地解决了机器人操作领域中数据稀缺与任务多样性的平衡难题。传统的厨房操作研究多集中于刚性物体的抓取与放置,但对生菜此类柔性、可形变物体的精细化操作缺乏标准化数据支持。lettuce-to-plate为此类研究提供了高保真度的示范数据,使学术界能够深入探索柔性物体操作中的力位混合控制策略、多模态感知融合机制以及任务中的视觉-运动耦合关系。其公开的框架和标准化格式促进了不同算法间的公平比较,推动了机器人操作领域从简单抓取向复杂服务应用的范式演进。
衍生相关工作
该数据集的发布催生了一系列前沿科研工作。基于其提供的细粒度动作与状态记录,研究人员开发了用于双臂机器人协同操控的对称性自注意力网络,有效提升了生菜摆放的稳定性。结合眼动追踪数据,衍生出基于注意力机制的视觉模仿学习框架,使得机器人能够聚焦关键操作区域从而减少不必要的计算开销。在模型层面,该数据集被用于验证多任务分层强化学习算法,其中高层规划器负责任务分解,底层控制器执行精细动作,显著提高了操作成功率。这些工作进一步丰富了机器人操作领域的数据驱动方法论。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务