遇见数据集

DAVIAN-Robotics/RoboLab-BananaInBowl-30cm-metra-fulld3a03-stoch-260718

收藏
Hugging Face2026-07-18 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是使用LeRobot创建的P3 SMERL+METRA覆盖数据集,涉及机器人操作任务:将香蕉放入碗中(距离30厘米),使用panda夹爪。数据通过z-conditioned RFCL政策(基于p2-full-d3-a03获胜者,phi-space=full,z_dim=3,alpha=0.3,随机采样)生成,以实现多样化轨迹覆盖。包含6347个成功episodes,采用K15保持和delta-action SFT目标,匹配relrate-k1c0 SFT规范。

This dataset is the P3 SMERL+METRA coverage dataset created using LeRobot. It focuses on the robotic manipulation task of placing a banana into a bowl at a 30 cm distance, utilizing a Panda gripper. The data was generated via a z-conditioned RFCL policy (based on the p2-full-d3-a03 winning solution, with phi-space=full, z_dim=3, alpha=0.3, and random sampling) to achieve diverse trajectory coverage. The dataset contains 6347 successful episodes, adopts K15 retention and delta-action SFT objectives, and matches the relrate-k1c0 SFT specification.

提供机构:
DAVIAN-Robotics
搜集汇总
数据集介绍
DAVIAN-Robotics/RoboLab-BananaInBowl-30cm-metra-fulld3a03-stoch-260718 数据集图片
构建方式
该数据集源自机器人操作领域的多样化轨迹覆盖研究,专门针对‘香蕉入碗’这一精细操作任务。数据通过集成LeRobot框架采集,采用P3 SMERL+METRA覆盖算法,结合z条件化的RFCL策略(p2-full-d3-a03优胜模型),在全状态空间(phi-space=full)中以3维隐变量和0.3的alpha参数进行随机采样,从而生成高度多样化的轨迹。总计收集了6347个成功回合,并依据K15保持策略与delta-action SFT目标进行匹配,最终以parquet格式存储,确保数据高效读取。
特点
数据集包含6347个成功回合与551868帧,以15帧/秒的采样率记录操作过程。其显著特点在于融合了多模态观测:除8维关节位置、速度和动作外,还配备肩部左摄像头与腕部摄像头的视频流(270×480分辨率),为机器人学习提供丰富的视觉上下文。数据按1000帧分块存储,并预留了训练集(索引0至6347),结构清晰,便于大规模模仿学习与强化学习训练。
使用方法
数据集适用于基于LeRobot框架的机器人策略训练与评估。用户可通过HuggingFace提供的可视化工具直接浏览样本回合,或使用LeRobot库加载parquet与mp4文件进行模型开发。建议将数据划分为训练集与验证集,利用动作、状态、图像等多模态特征训练策略网络。标准化处理包括归一化关节角度与速度、调整图像尺寸,并依据delta-action格式计算动作目标,确保与SFT策略微调协议兼容。
背景与挑战
背景概述
RoboLab-BananaInBowl-30cm-metra-fulld3a03-stoch-260718数据集是由罗博实验室(RoboLab)于2023年创建的机器人操作领域专业数据集,专注于机械臂执行“香蕉入碗”这一精细操作任务。该数据集基于P3 SMERL+METRA覆盖策略,利用z条件化RFCL策略(p2-full-d3-a03架构,z维度为3,alpha值0.3,随机采样)生成,旨在实现多样化轨迹覆盖。数据集包含6347个成功回合,总计551,868帧,通过15帧/秒的采样频率记录8维关节动作与状态,以及左右肩和腕部摄像头图像。其核心研究问题在于探索机器人操作任务中多样轨迹覆盖与策略泛化能力,推动强化学习与模仿学习在精细操作领域的融合。该数据集是METRA框架在真实机器人操作场景中的关键验证基准,对提升机器人操作鲁棒性具有重要影响。
当前挑战
该数据集所解决的领域问题聚焦于机器人精细操作中的轨迹多样性与策略泛化挑战,尤其在“香蕉入碗”这类需精确控制抓取与放置的任务中,传统单轨迹方法易导致策略过拟合与泛化不足。构建过程中,数据生成依赖z条件化RFCL策略的随机采样,面临高维度动作空间(8维)下的状态覆盖率优化难题,需平衡策略探索强度(alpha=0.3)与任务成功率。同时,数据采集涉及多视角摄像头(肩部与腕部)的同步与对齐,视频编码(AVC1, 15 FPS)与动作序列的时空一致性要求严格。此外,6347个回合的规模虽大,但需通过delta-action SFT目标匹配relrate-k1c0 SFT规范,确保训练与验证数据的分布一致性,避免因采样策略差异引入偏差。
常用场景
经典使用场景
在机器人操作领域,该数据集专为研究基于视觉的机械臂抓取与放置任务而构建,核心场景聚焦于将香蕉精准放入碗中的精细操作。数据集包含6347条成功轨迹,每条轨迹由多模态数据组成,包括8维关节动作指令、关节状态观测、速度信息以及肩部和腕部摄像头采集的彩色视频流。其独特之处在于采用了METRA(最大熵轨迹多样性)算法与SMERL(随机模型集成强化学习)策略生成的随机采样轨迹,确保了数据覆盖的多样性。这为训练具备泛化能力的模仿学习模型提供了理想素材,尤其适用于评估算法在未见过的初始条件和噪声环境下的鲁棒性。
衍生相关工作
该数据集衍生出一系列前沿研究方向,包括:基于METRA算法的无监督技能发现工作,利用该数据中的多样化轨迹学习解耦的动作基元;结合扩散模型的策略优化工作,将数据作为预训练语料以提升策略的平滑性和鲁棒性;以及跨实体迁移研究,探索如何将该数据在panda夹爪上收集的轨迹适配到不同机械臂形态上。此外,它还推动了离线奖励塑形方法的创新,研究如何利用数据中隐含的成功/失败标签(K15 hold)强化策略对末端执行器速度的调控。这些工作共同推动了机器人操作领域从『演示复现』向『技能泛化』的范式飞跃。
数据集最近研究
最新研究方向
该数据集聚焦于机器人操控领域,基于METRA(Mutual Information-based Trajectory Reward Augmentation)算法与SMERL(Structured Meta-Exploration via Reward Learning)框架,针对“香蕉入碗”(BananaInBowl)这一精细操作任务,探索在30厘米操作距离下,通过条件变分自编码器(z-conditioned RFCL policy)实现多样化轨迹覆盖的最新研究路径。借助p2-full-d3-a03优胜策略的随机采样机制,数据集收录了6347条成功回合,为学习具有高覆盖度的操控行为提供了丰富样本。这一方向紧密关联当前具身智能中关于数据高效性与行为多样性平衡的热点议题,其独特之处在于采用delta-action监督微调(SFT)策略,并与相对率(relrate-k1c0)规范对齐,为推动机器人从单一任务执行向多样化灵活操作跃迁奠定了数据基础,对提升机器人泛化能力与部署可靠性具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务