遇见数据集

DAVIAN-Robotics/RoboLab-BananaInBowl-30cm-pi05rollout-det-260716

收藏
Hugging Face2026-07-16 更新2026-07-22 收录
官方服务:

资源简介:

该数据集使用LeRobot创建,包含来自预训练pi0.5策略本身(DAVIAN-Robotics/pi05_droid_jointpos)的rollouts,已转换为LeRobot v3.0格式用于pi0.5 SFT。其存在目的是作为消融实验的数据源基线:一个由速率受限RL策略(relrate k1-c0)构建的数据集移除了pi0.5的SFT崩溃问题。该数据集用于隔离增益是来自RL策略的动作平滑性还是仅来自拥有大量成功演示——收集器、环境和约定相同,仅执行策略不同。数据细节包括:策略为确定性预训练模型,动作块大小15;动作空间记录为绝对关节目标(droid帧,j7偏移-pi/4);夹爪为二进制{0,1}(1表示关闭);成功标准为K-hold settle(success_hold_steps=15),以成功作为截断条件;初始化随机化30cm;成功率约0.325;摄像头包括over_shoulder_left_camera(外部)和wrist_cam;统计信息包含q01/q99分位数;视频经过CFR归一化。比较集为RoboLab-BananaInBowl-30cm-relrate-k1c0-{det,stoch}-gripbin-260716。

This dataset was created using LeRobot. It contains rollouts from the pretrained pi0.5 policy itself (DAVIAN-Robotics/pi05_droid_jointpos), converted to LeRobot v3.0 for pi0.5 SFT. The purpose of this set is to serve as the data-source baseline for an ablation: a dataset built from a rate-limited RL policy (relrate k1-c0) removed pi0.5s SFT collapse. This set isolates whether that gain came from the RL policys action smoothness or simply from having many successful demonstrations — the collector, environment and conventions are identical; only the acting policy differs. Details include: policy is deterministic pretrained model with chunk_size=15; action space recorded as absolute joint targets (droid frame, j7 offset -pi/4); gripper is binary {0,1} (1 = close); success defined by K-hold settle with success_hold_steps=15, success-as-truncation; init randomization at 30cm; yield ~0.325 success per rollout; cameras include over_shoulder_left_camera (exterior) and wrist_cam; stats include q01/q99 quantiles; videos are CFR-normalized. Comparison sets: RoboLab-BananaInBowl-30cm-relrate-k1c0-{det,stoch}-gripbin-260716.

提供机构:
DAVIAN-Robotics
搜集汇总
数据集介绍
DAVIAN-Robotics/RoboLab-BananaInBowl-30cm-pi05rollout-det-260716 数据集图片
构建方式
该数据集基于LeRobot框架构建,源自RoboLab(Isaac Lab)仿真环境中的“BananaInBowl”操作任务,机械臂与碗的初始距离设定为30厘米。数据由预训练的pi05策略(DAVIAN-Robotics/pi05_droid_jointpos)在确定性模式下生成,共包含6070个成功轨迹片段,总计1375891帧画面。每次 rollout 的成功率约为0.325,采用15步的K-hold稳定判定机制作为截断成功条件。动作空间记录为绝对关节目标值,夹爪为二进制信号,相机视角包括肩部左上方相机和腕部相机,图像经过CFR归一化处理,并提供了q01/q99统计量以适配pi05的分位数归一化需求。
使用方法
该数据集可直接通过LeRobot库加载使用,适用于pi05策略的监督微调(SFT)训练。用户可通过指定数据集标识符`DAVIAN-Robotics/RoboLab-BananaInBowl-30cm-pi05rollout-det-260716`调用,数据以Parquet格式存储于`data/`目录下,视频文件则位于`videos/`目录。与对比数据集`RoboLab-BananaInBowl-30cm-relrate-k1c0-{det,stoch}-gripbin-260716`配合使用时,可系统分析不同策略对模型性能的影响。建议在训练时将右腕相机通道补零并利用LeRobot的掩码机制处理,以确保输入维度一致性。
背景与挑战
背景概述
该数据集由DAVIAN-Robotics团队于2026年7月创建,旨在探究机器人操作任务中强化学习策略与数据驱动微调之间的相互作用。核心研究问题围绕pi0.5预训练策略在香蕉入碗任务中的性能评估,特别是通过对比速率受限的强化学习策略(relrate k1-c0)来分离成功演示数量与动作平滑度对模型微调效果的影响。作为消融研究的基线数据集,它在30厘米初始随机化条件下,利用pi0.5预训练策略的确定性滚转生成,包含6070个成功片段和超过137万帧数据,为机器人操作领域中的模仿学习、策略优化以及数据增强提供了关键基准。
当前挑战
该数据集面临的挑战首先源自机器人操作领域的固有问题:高维连续动作空间与稀疏奖励信号使得策略学习困难,尤其是pi0.5策略在部署时需应对环境随机性和任务成功率的波动(约32.5%的滚转成功率)。其次,构建过程中需解决数据一致性问题,包括确保动作空间采用绝对关节目标表示、夹爪二进制化以避免标注伪影、以及通过左肩和腕部摄像头映射到pi0.5所需的标准化观测空间。此外,成功判定标准需与对比数据集严格对齐,保持相同的保持步数和截断条件,这要求精心设计环境初始化和终止逻辑以避免引入采样偏差。
常用场景
经典使用场景
在机器人操作领域,RoboLab-BananaInBowl-30cm-pi05rollout-det-260716数据集作为一项核心基准资源,广泛用于模仿学习和离线强化学习的策略微调。该数据集记录了在30厘米初始随机距离下,基于预训练pi0.5策略(DAVIAN-Robotics/pi05_droid_jointpos)确定性执行将香蕉放入碗中的任务轨迹,共计6070个成功片段,包含137万余帧。其经典用法在于为pi0.5模型的监督微调(SFT)提供数据源,通过对比分析与同环境但基于速率限制策略(relrate k1-c0)生成的对比集,研究者能够精准隔离策略平滑性与示范多样性对模型收敛行为的影响,从而深入探索SFT坍塌现象的缓解机制。
解决学术问题
该数据集旨在回应机器人学习中的一个关键学术难题:预训练视觉运动策略在监督微调阶段为何容易陷入性能坍塌?通过构建仅执行策略不同、其余条件完全一致的双数据集对照实验,研究者得以系统评估动作平滑性与成功示范数量两个潜在因素的作用。该数据集揭示了纯由pi0.5自身滚动的轨迹数据无法避免的SFT退化问题,进而推动了基于速率限制策略的改进方案研究。其意义在于为离线策略蒸馏中的数据构成原理提供了定量证据,帮助学术界理解模仿学习数据质量与策略泛化能力之间的深层耦合关系,推动了更稳健的机器人微调方法发展。
实际应用
在实际机器人部署场景中,该数据集通过提供结构化的多模态观测与动作记录,直接服务于桌面级精细操作任务的策略训练。例如,在工业机械臂的香蕉摆放质检、家庭服务机器人物品归位等应用中,研究人员可利用此数据集预训练或微调视觉运动策略,实现从仿真到实物的零样本或小样本迁移。数据集包含的肩部上方视角与腕部摄像头双流视觉信息,以及绝对关节位置指令和二进制夹爪控制信号,为研发环境感知与灵巧抓取算法提供了标准化测试床,加速了机器人从感知到执行的闭环系统开发。
数据集最近研究
最新研究方向
在机器人操作领域,基于预训练视觉-语言-动作模型(如pi0.5)的自监督微调(SFT)中,数据来源策略对策略收敛质量的影响日益成为研究焦点。该数据集通过采集预训练pi0.5策略自身在固定环境中确定性 rollout 的轨迹,专门构建了与速率受限强化学习(RL)策略数据集进行消融对比的基准,旨在解剖SFT崩溃缓解现象的根本成因——究竟是源于RL策略的动作平滑性,还是单纯归因于成功示范数量的积累。这一精心设计的对照实验,为理解模仿学习中的数据分布与策略泛化能力之间的深层关联提供了关键实证,凸显了数据收集策略本身作为独立变量在机器人技能习得中的不可忽视地位。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务