遇见数据集

RoboLab-BananaInBowl-hard-base-det-260802

收藏
Hugging Face2026-08-09 更新2026-08-02 收录
官方服务:

资源简介:

该数据集包含来自RoboLab(Isaac Lab)的BananaInBowl策略在“hard”初始姿态分布下的强化学习rollout数据,专为pi0.5的delta-action监督微调(SFT)导出。收集策略为ipl-bana-hard-s0,是一种RFCL代理,在逆向→前向过渡阈值为solved_frac_threshold=0.9时训练(当前向课程中45/50个演示被解决时开始前向阶段)。其最终评估成功率为0.98,平均成功回合长度为47.7步。初始姿态分布采用预生成且经物理验证的布局数据集,hard表示位置覆盖任务可测范围的100%,偏航角在±180°内均匀分布。记录规范包括:手臂动作为DROID框架中的绝对关节目标,夹爪动作为二进制{0,1},状态为完整关节向量,成功由K-hold稳定判定,相机包括左肩上方相机和腕部相机,帧率为15 fps。仅包含成功回合,失败回合在收集时丢弃。数据集包含5950个回合,共423318帧。

The dataset contains reinforcement learning rollout data from the BananaInBowl policy of RoboLab (Isaac Lab) under the hard initial pose distribution, exported for delta-action supervised fine-tuning (SFT) of pi0.5. The collection policy is ipl-bana-hard-s0, an RFCL agent trained with a reverse→forward transition threshold of solved_frac_threshold=0.9 (forward phase starts when 45/50 demos are solved in forward curriculum). Its final evaluation success rate is 0.98, average success episode length is 47.7 steps. The initial pose distribution uses a pre-generated and physically validated layout dataset, hard means position covers 100% of the task measurable range, yaw uniformly distributed in ±180°. Recording specifications include: arm actions as absolute joint targets in DROID framework, gripper action as binary {0,1}, state as full joint vector, success determined by K-hold stability, cameras include left shoulder camera and wrist camera, frame rate 15 fps. Only successful episodes are included, failed episodes are discarded during collection. The dataset contains 5950 episodes, 423318 frames.

提供机构:
DAVIAN-Robotics
创建时间:
2026-08-02
原始信息汇总

RoboLab-BananaInBowl-hard-base-det-260802 数据集详情

数据集概述

该数据集由 LeRobot 创建,来源于 RoboLab(Isaac Lab)环境中 BananaInBowl(香蕉入碗) 任务在 hard 初始位姿分布下的强化学习(RL)策略 rollout 数据,专为 pi0.5 增量动作监督微调(delta-action SFT)导出。

数据来源与策略信息

  • 采集策略ipl-bana-hard-s0,一种 RFCL(反向课程强化学习)智能体,使用反向→正向转换阈值 solved_frac_threshold = 0.9
  • 最终评估性能success_end 为 0.98,平均成功回合步数为 47.7 步。
  • 重要提示:存在另一个独立训练车道(banana-hard-sf50),其阈值设为 0.5,两者策略不同,数据集不可互换,在进行受控对比实验时请勿混合使用。

初始位姿分布(hard 模式)

  • 位置:覆盖任务测量可行范围的 100%
  • 偏航角:在 ±180°(整圆)内均匀分布
  • 物体放置:来自预生成且经物理验证的布局数据集(DAVIAN-Robotics/robolab-init-positions),无初始穿模情况;名字含 bin 的容器固定,其他资产(包括碗)与目标物一起随机化;存储的偏航角为绝对角度,已包含场景默认朝向。

记录约定

项目 说明
机械臂动作 绝对关节目标(DROID 坐标系,j7 偏移 −π/4)
夹爪动作 二进制 {0, 1}(原始值 >0 表示闭合)
状态 完整关节向量
成功判定 K-hold 稳定判据,success_hold_steps = 15,成功即截断回合
相机 over_shoulder_left_camera(左肩上方相机)、wrist_cam(腕部相机)
帧率 15 fps

注意:夹爪为二进制记录。早期连续夹爪记录会高估下游策略质量,请勿从二进制通道反向推导连续值。q01/q99 分位数统计位于 meta/stats.json(pi0.5 分位数归一化所需),在聚合后计算。所有视频均为恒定帧率(CFR),已进行归一化处理。

数据内容

  • 由确定性(argmax)策略采集;随机采样版本单独发布
  • 仅包含成功回合,失败数据在采集时已丢弃
  • 完全合成数据,在模拟中生成,不含第三方录音

数据集规模

  • 回合数:5950
  • 总帧数:423318
  • 任务数:1
  • 数据文件大小:约 100 MB
  • 视频文件大小:约 200 MB
  • 划分:train(0:5950)

数据特征结构

  • action:float32,形状 [8](7 个关节 + 夹爪),15 fps
  • observation.state:float32,形状 [8](关节 j0-j7),15 fps
  • observation.velocity:float32,形状 [8]
  • observation.images.over_shoulder_left_camera:视频,270×480×3,AVC1 编码,15 fps
  • observation.images.wrist_cam:视频,270×480×3,AVC1 编码,15 fps
  • 其他字段:episode_indexframe_indexindextask_indextimestampnext.done

许可协议

  • 许可证:Apache-2.0

可视化

可通过 LeRobot 数据集可视化器在线查看:Open in the LeRobot dataset visualizer

引用信息

BibTeX 引用信息当前不可用([More Information Needed])。

二维码
社区交流群
二维码
科研交流群
商业服务