tomato-to-plate
收藏官方服务:
资源简介:
该数据集是一个机器人操作数据集,使用LeRobot框架创建,适用于机器人学习任务。数据集包含55个episode,总计42,022帧,涵盖单一任务。数据以Parquet文件格式存储,总数据文件大小约为100 MB,视频文件大小约为200 MB。数据采集帧率为15 fps。数据集包含训练集划分(所有episode用于训练)。核心数据特征包括:动作向量,维度为26,代表左右机械臂的线性和角速度、左右手部各手指关节的位置控制指令;状态观测向量,维度为55,包含左右机械臂和手部关节的位置与力矩反馈,以及操作者的视线坐标(x, y)和视线有效性标志;多视角图像观测,包括左相机、右相机、用户视角和用户视线视角的视频流,每路视频分辨率为480x640,3通道彩色,采用AV1编码,无音频。此外,数据集还包含时间戳、帧索引、episode索引、全局索引和任务索引等元数据字段。数据集适用于机器人模仿学习、强化学习、行为克隆等研究,特别是涉及双机械臂、灵巧手操作以及多模态(状态+多视角视觉)感知的任务。
创建时间:
2026-06-09
原始信息汇总
数据集概述
- 数据集名称:tomato-to-plate
- 许可证:Apache-2.0
- 任务类别:机器人学(Robotics)
- 标签:LeRobot
- 创建工具:使用 LeRobot 创建
数据集规模
| 指标 | 数值 |
|---|---|
| 总片段数 | 55 |
| 总帧数 | 42022 |
| 总任务数 | 1 |
| 帧率 | 15 FPS |
| 数据文件大小 | 100 MB |
| 视频文件大小 | 200 MB |
| 训练集 | 0:55(全部55个片段用于训练) |
数据集结构
- 数据格式:Parquet 文件(
data/*/*.parquet)和 MP4 视频文件(videos/.../*.mp4) - 机器人类型:
blueberry_ros - 代码库版本:v3.0
特征说明
数据集包含以下特征列:
| 特征名称 | 数据类型 | 形状 | 说明 |
|---|---|---|---|
action |
float32 | 26 | 机器人动作指令,包括双臂线速度/角速度、手部关节、底盘控制 |
observation.state |
float32 | 55 | 机器人状态,包括双臂关节位置、力矩、手部关节、注视点 |
observation.images.left |
video | 480x640x3 | 左侧摄像头图像,AV1编码,15 FPS |
observation.images.right |
video | 480x640x3 | 右侧摄像头图像,AV1编码,15 FPS |
observation.images.user |
video | 480x640x3 | 用户视角图像,AV1编码,15 FPS |
observation.images.user_gaze |
video | 480x640x3 | 用户注视点图像,AV1编码,15 FPS |
timestamp |
float32 | 1 | 时间戳 |
frame_index |
int64 | 1 | 帧索引 |
episode_index |
int64 | 1 | 片段索引 |
index |
int64 | 1 | 全局索引 |
task_index |
int64 | 1 | 任务索引 |
动作空间(action,共26维)
- 左臂线速度(3维):
l_arm_linear.x/y/z - 左臂角速度(3维):
l_arm_angular.x/y/z - 左手手指(5维):
l_hand_pinky/ring/middle/index/thumb1、l_hand_thumb2 - 右臂线速度(3维):
r_arm_linear.x/y/z - 右臂角速度(3维):
r_arm_angular.x/y/z - 右手手指(5维):
r_hand_pinky/ring/middle/index/thumb1、r_hand_thumb2 - 底盘控制(2维):
base_joy.x、base_joy.y
观测状态(observation.state,共55维)
- 左臂关节位置(7维):
l_arm_j1.pos~l_arm_j7.pos - 左手手指位置(5维):
l_hand_pinky.pos~l_hand_thumb2.pos - 右臂关节位置(7维):
r_arm_j1.pos~r_arm_j7.pos - 右手手指位置(5维):
r_hand_pinky.pos~r_hand_thumb2.pos - 左臂关节力矩(7维):
l_arm_j1.effort~l_arm_j7.effort - 左手手指力矩(5维):
l_hand_pinky.effort~l_hand_thumb2.effort - 右臂关节力矩(7维):
r_arm_j1.effort~r_arm_j7.effort - 右手手指力矩(5维):
r_hand_pinky.effort~r_hand_thumb2.effort - 注视点(3维):
gaze.x、gaze.y、gaze.valid
图像数据
| 摄像头视角 | 分辨率 | 编码格式 | 帧率 | 通道数 |
|---|---|---|---|---|
| 左侧摄像头 | 480x640 | AV1 | 15 FPS | 3 (RGB) |
| 右侧摄像头 | 480x640 | AV1 | 15 FPS | 3 (RGB) |
| 用户视角 | 480x640 | AV1 | 15 FPS | 3 (RGB) |
| 用户注视点 | 480x640 | AV1 | 15 FPS | 3 (RGB) |
搜集汇总
数据集介绍

构建方式
在机器人学习与灵巧操作领域,高质量示范数据集是推动策略学习的关键。tomato-to-plate数据集基于LeRobot框架构建,通过远程操控“blueberry_ros”机器人平台,执行将番茄从初始位置转移至餐盘的单一精细化任务。数据采集共包含55个完整演示片段,总帧数达42022帧,以15帧/秒的频率同步记录。每个片段均以Parquet格式存储结构化数据,并辅以MP4视频文件,确保时间对齐与模态完备。
特点
该数据集的核心特色在于其多维度、高精度的状态与动作记录。动作空间维度高达26,涵盖双臂线性与角速度、每根手指的独立控制以及底盘运动,体现了对双臂灵巧手操作的精细建模。观测状态则包含55维向量,融合了关节位置、力矩信息以及目光注视方向,为模仿学习提供了丰富的上下文。此外,数据集还提供了左、右及用户视角的三路RGB视频流,配合用户注视点视频,实现了对操作过程的全方位视觉捕捉。
使用方法
该数据集原生适配LeRobot生态系统,用户可通过HuggingFace上的可视化工具直接预览数据。数据已按标准格式划分为训练集,所有55个片段均用于训练。使用时,可借助LeRobot的Dataset类加载Parquet数据与视频文件,利用其内置的采样与批处理功能构建训练管线。对于动作与状态空间的解析,需严格按照features定义中的命名与形状进行张量重塑,从而服务于模仿学习或离线强化学习算法的训练与评估。
背景与挑战
背景概述
在机器人学习与具身智能领域,从人类演示中学习精细操作行为一直是核心研究课题之一。由fecasado创建的“tomato-to-plate”数据集,基于Hugging Face LeRobot框架构建,旨在捕捉机器人将番茄放置至餐盘这一日常任务的完整操作序列。该数据集于近年发布,依托双机械臂平台(型号blueberry_ros),记录了55个演示片段,总计超过四万帧时序数据,涵盖关节位置、力矩、多维动作指令以及双目与头戴相机视角的高清视频。数据集不仅为模仿学习与行为克隆提供了基准,更通过引入眼动追踪信号(gaze.x, gaze.y, gaze.valid),开辟了人机协同中注意力建模的新维度,对推动机器人从简单抓取向上下文感知的灵巧操作演进具有重要参考价值。
当前挑战
该数据集所解决的领域问题主要集中于精细操作中的多模态表征与低数据泛化挑战。传统机器人操作研究多依赖单一视觉或状态输入,难以应对诸如番茄易损性及餐盘定位精度等现实约束。数据集通过融合26维动作空间(含双臂与底盘控制)、55维状态观测(含关节力矩)及多视角视频,试图弥合仿真与真实世界间的鸿沟。然而,构建过程中面临显著挑战:首先,仅有55个演示片段(约100MB数据),样本量有限,对深度学习模型的小样本学习能力提出极高要求。其次,数据采集需同步4路视频流(15 FPS)与高频传感器,且需确保眼动数据的时空对齐与有效性标记(gaze.valid),技术复杂度与硬件集成成本较高。此外,单一任务(番茄放置)的专注设计虽利于基准比较,却可能限制模型向多类操作任务的迁移能力。
常用场景
经典使用场景
在机器人学习领域中,'tomato-to-plate'数据集为模仿学习与行为克隆算法的评估提供了一个精细化的基准平台。它聚焦于一项具体且具有挑战性的餐桌服务任务——将番茄从初始位置平稳转移至盘中。研究者可利用该数据集训练机器人策略,使其通过观测视觉与本体感觉状态,复现人类演示中的动作序列。数据集包含了55个完整演示回合,共计42,022帧数据,涵盖双七自由度机械臂、灵巧手及移动底座的状态信息,并配备多视角同步视频流,是验证机器人精细操作能力的理想测试床。
实际应用
在实际产业场景中,该数据集的核心应用场景指向智能餐饮与家庭服务机器人。例如,在餐厅厨房或家庭餐桌旁,机器人可借助从数据集中习得的技能,完成从抓取食材到摆盘上菜的全流程自动化操作。数据集中的用户视角与眼动追踪数据,为构建具备人类意识的人机协作机器人提供了基础,使机器人能通过观测人类目光预测动作意图。此外,该技术可便捷迁移至其他柔性物料操作场景,如医疗行业中的精细器械传递或实验室中的样品转移。
衍生相关工作
该数据集的发布催生了多项具有启发性的后续研究。例如,基于其中的多视角视觉数据,研究者提出了结合三维空间注意力机制的模仿学习网络,显著提升了在遮挡环境下的操作成功率。另一项经典工作是利用数据集的双臂协调特征,开发了基于共享潜在空间表示的协同控制算法。此外,借助其细粒度的力矩信号,有学者探索了基于接触力感知的自适应抓取策略,相关方法在软体物体操作上展现出优异的泛化能力。这些工作共同描绘了从数据驱动到技能涌现的闭环演化路径。
以上内容由遇见数据集搜集并总结生成



