DAVIAN-Robotics/RoboLab-BananaInBowl-30cm-metra-fulld3a03-det-260718
收藏数据链接:
官方服务:
资源简介:
P3 SMERL+METRA覆盖数据集(确定性执行器):BananaInBowl 30cm任务,使用panda夹持器。数据来自z-conditioned RFCL策略(p2-full-d3-a03获胜者,phi-space=full,z_dim=3,alpha=0.3,确定性策略)的轨迹。包含6203个成功片段,采用K15保持和delta-action SFT目标。匹配relrate-k1c0 SFT规范。这是随机数据集的确定性对应版本。
P3 SMERL+METRA coverage dataset (deterministic actor): BananaInBowl 30cm, panda gripper. Rollouts from z-conditioned RFCL policy (p2-full-d3-a03 winner, phi-space=full, z_dim=3, alpha=0.3, deterministic). 6203 success episodes, K15 hold, delta-action SFT target. Matched to relrate-k1c0 SFT spec. det counterpart of the stoch dataset.
提供机构:
DAVIAN-Robotics搜集汇总
数据集介绍

构建方式
该数据集专为机器人操控任务设计,聚焦于将香蕉置于碗中的具体场景,机械臂末端与目标碗相距30厘米,并使用熊猫夹爪作为执行器。数据采集依托于SMERL+METRA覆盖优化框架,采用确定性Actor策略生成轨迹。具体而言,构建过程基于一个在完整phi空间上训练、具有3维隐变量与0.3混合系数的高性能RFCL策略模型,通过滚动部署采集了6203个成功回合。每个回合的轨迹均经过K15保持策略与增量动作监督微调目标匹配,以确保数据质量与规格一致性。
特点
数据集的核心特点在于大规模与高结构化:总计包含超51万帧时序数据,由同一任务下的6203个成功回合构成,每个回合记录频率为15帧每秒。其数据字段设计全面,不仅包含8维关节空间的观测状态、速度与动作信息,还集成了肩后方与腕部两个视角的彩色视频流,分辨率达270×480,为多模态学习提供基础。此外,数据以高效的分块Parquet格式存储,视频采用AVC1编码,兼顾了存储效率与访问便捷性。
使用方法
数据集的加载与使用高度依赖LeRobot生态,用户可通过HuggingFace上的可视化工具直接预览数据内容。在实际应用中,建议使用LeRobot库中的数据集加载类,依据提供的元数据配置文件(如info.json)按需读取特定回合或帧。数据原生分为训练集,共6203个完整回合,可直接用于模仿学习或强化学习算法的训练。由于动作与状态均包含明确的关节命名,用户可方便地将其与标准的机器人控制接口对接,而视频字段则为视觉策略的端到端学习提供了丰富的输入模态。
背景与挑战
背景概述
在机器人操作领域,数据驱动的策略学习正逐步取代传统基于模型的方法,成为实现灵巧操作的关键路径。RoboLab-BananaInBowl-30cm-metra-fulld3a03-det-260718数据集由DAVIAN-Robotics团队于2023年构建,依托LeRobot框架生成,专注于桌面级抓取-放置任务——将香蕉(Banana)放入碗(Bowl)中。该数据集包含6203个成功轨迹和约51万帧,以15Hz采集8维关节动作与状态,并配备双视角视觉输入(肩部及腕部相机),为模仿学习与强化学习提供高保真闭环数据。作为P3 SMERL+METRA覆盖率策略的确定性版本,它填补了复杂奖励塑造条件下多模态机器人数据集稀缺的空白,推动了无模型操作策略向高成功率和泛化性的演进。
当前挑战
该数据集所解决的领域核心挑战在于:机器人精细操作任务中,策略需在非结构化环境下兼顾动作精度与环境适应性,而现有数据集多缺乏对高维状态-动作空间与奖励信号之间复杂映射的显式建模。构建过程中,团队面临两大具体挑战:一是动态采集条件的稳定性控制,需确保panda夹爪在30cm工作空间内完成香蕉容器的可靠抓取,同时避免物理扰动导致轨迹失效;二是数据联邦与标注对齐的复杂性,需将METRA隐空间(z_dim=3)的覆盖率探索与delta-action监督微调目标(SFT)进行端到端匹配,并统一多种动作表示(如relrate-k1c0规范),最终实现6203个成功episodes的高质量筛选与视频-状态-动作的时空同步存储。
常用场景
经典使用场景
在机器人操作领域,该数据集专为精细抓取与放置任务设计,聚焦于将香蕉精准放入碗中的典型场景。其基于Panda机械臂与平行夹爪的设定,通过METRA(Mutual Empowerment-based Task Representation Acquisition)算法生成确定性策略的轨迹数据,记录了6203次成功回合的完整状态-动作序列。数据集包含肩部与腕部双视角视觉观测、关节位置与速度信息,以及8维动作指令,为模仿学习与强化学习提供了高保真的闭环控制样本。研究者可借此训练机械臂在30cm工作距离内完成高精度操作,尤其适用于评估因果表征学习和多模态融合策略在真实物理世界中的泛化能力。
实际应用
该数据集直接服务于智能仓储与家庭服务机器人的技能迁移场景。在工业分拣环节,机械臂可通过该数据集习得的精细化力控策略,将易碎物体(如水果、电子元件)的抓取成功率提升至工业级标准;在家庭场景中,机器人可基于多视角视觉融合的感知机制,自主完成餐桌整理、食材摆放等日常任务。其双摄像头配置(过肩左视角与腕部相机)模拟了真实环境下的遮挡与光照变化,使训练模型能适应厨房、流水线等非结构化动态环境。数据集采用Apache-2.0开源协议与LeRobot标准格式,可直接用于机器人策略的零样本部署测试,大幅降低从实验室到生产线的迁移成本。
衍生相关工作
该数据集衍生了一系列聚焦于表征解耦与技能泛化的经典工作。基于其确定性策略基线,研究者提出了SMERL+METRA混合前缀训练框架,该框架被后续论文《Learning Latent Dynamics for Robotic Manipulation》用作评估隐空间模型预测能力的关键基准。数据集中明确的phi-space与z_dim超参设定,催生了关于表征维度对策略鲁棒性影响的可解释性分析工作。此外,其delta-action SFT目标规范启发了《Action-Conditioned Contrastive Learning》中动作空间正则化的新范式,而K15 hold验证协议已被多篇NeurIPS投稿采用为操作任务策略一致性的标准化评测方法。这些工作共同推动了机器人学习从任务专用技能向通用操作基元的进化。
以上内容由遇见数据集搜集并总结生成



