遇见数据集

RoboLab-BananaInBowl-hard-base-det-260802

收藏
Hugging Face2026-08-09 更新2026-08-10 收录
官方服务:

资源简介:

该数据集是在RoboLab(Isaac Lab)模拟环境中,使用一个针对BananaInBowl任务训练的RL策略(基于反向-正向课程学习,阈值solved_frac_threshold=0.9)在hard初始姿态分布下进行确定性采样(argmax策略)生成的rollout数据。数据仅包含成功episode(失败episode在收集时被丢弃)。记录约定:臂动作为DROID坐标系下的绝对关节目标(j7偏移-π/4),夹爪动作为二值{0,1},状态为完整关节向量,成功判定采用K-hold稳定检查(success_hold_steps=15),episode在成功后截断。相机视角包括over_shoulder_left_camera和wrist_cam,帧率15fps。数据规模:5950个episodes,总计423318帧。所有视频已进行恒定帧率归一化处理,并包含所需的q01/q99分位数统计(用于pi0.5分位数归一化)。数据集采用Apache-2.0许可证发布,完全由模拟生成,无第三方录制内容。

This dataset consists of rollout data generated by deterministic sampling (argmax policy) of an RL policy trained for the BananaInBowl task (using reverse-forward curriculum learning with solved_frac_threshold=0.9) in the RoboLab (Isaac Lab) simulation environment under hard initial pose distribution. Only successful episodes are included (failed episodes are discarded during collection). Recording conventions: arm actions are absolute joint targets in the DROID coordinate frame (j7 offset -π/4), gripper actions are binary {0,1}, states are full joint vectors, success is determined by K-hold stability check (success_hold_steps=15), and episodes are truncated upon success. Camera views include over_shoulder_left_camera and wrist_cam at 15fps. Data size: 5950 episodes, 423318 frames total. All videos have been constant-frame-rate normalized and include required q01/q99 quantile statistics (for pi0.5 quantile normalization). The dataset is released under the Apache-2.0 license, entirely simulated, with no third-party recordings.

创建时间:
2026-08-02
原始信息汇总

RoboLab-BananaInBowl-hard-base-det-260802 数据集概述

数据集基本信息

  • 数据集名称: RoboLab-BananaInBowl-hard-base-det-260802
  • 许可证: Apache-2.0
  • 任务类别: 机器人技术 (robotics)
  • 标签: LeRobot, robotics, isaac-lab, manipulation, rl-rollout, pi0.5
  • 创建工具: LeRobot (https://github.com/huggingface/lerobot)
  • 数据格式: Parquet 文件(路径为 data/*/*.parquet

数据集描述

本数据集来源于 RoboLab(Isaac Lab)中 BananaInBowl 任务在 hard 初始位姿分布 下的强化学习(RL)策略回放数据,专门为 pi0.5 增量动作监督微调(SFT)导出。数据由确定性(argmax)策略收集,仅包含成功回合,失败回合在收集时已丢弃。

数据来源与可追溯性

  • 收集策略检查点路径: /home/nas_main/minhopark/repos/dg-rl/libs/FlashSAC/models/init-pose-ladder/ipl-bana-hard-s0/BananaInBowl/seed0-0731-195129/step6104
  • 策略类型: ipl-bana-hard-s0,RFCL 智能体,采用反向→正向转移阈值 solved_frac_threshold = 0.9(正向阶段在反向课程中 45/50 个演示解决后开始)
  • 最终评估: success_end 为 0.98,平均成功回合长度为 47.7 步
  • 重要提示: 一个单独通道(banana-hard-sf50)使用 solved_frac_threshold = 0.5 从头重训此任务,其数据集与本数据集不可互换。若需进行受控对比,请勿混合使用。该阈值仅影响策略训练方式,不改变记录轨迹本身。

初始位姿分布(hard)

  • 位置: 覆盖任务可测可行范围的 100%
  • 偏航角: 在 ±180° 内均匀分布(全圆周)
  • 随机化规则: 名称含 bin 的容器固定不动;其他所有资产(包括 bowl)与目标物一同随机化
  • 存储偏航角: 绝对值,已包含各资产的场景默认方向
  • 布局来源: 来自预生成的物理验证布局数据集 DAVIAN-Robotics/robolab-init-positions,避免回合开始时物体相互穿透

记录约定

字段 约定
机械臂动作 DROID 坐标系中的绝对关节目标(j7 偏移 −π/4)
夹爪动作 二值 {0, 1}(原始值 > 0 表示闭合)
状态 完整关节向量(teleport-native)
成功判定 K-hold 稳定判定,success_hold_steps = 15,成功时回合截断
摄像头 over_shoulder_left_camera, wrist_cam
帧率 15 fps

注意:二值夹爪至关重要——早期一轮记录连续夹爪导致下游策略质量高估,请勿从中重新推导连续通道。

数据处理细节

  • meta/stats.json 中包含 q01/q99 分位数统计(pi0.5 分位数归一化所需),且是在聚合之后计算,而非按分片计算
  • 所有视频为恒定帧率(CFR),已应用 CFR 归一化处理并验证(每个视频单一 PTS 增量),避免 torchcodec 后端误读帧

数据集规模

  • 回合数: 5,950
  • 帧数: 423,318
  • 任务数: 1
  • 块大小: 1000
  • 数据文件大小: 100 MB
  • 视频文件大小: 200 MB
  • 数据划分: 仅有 train 划分(0:5950)

数据特征

  • action: float32, 形状 [8](j0-j6 及 gripper),15 fps
  • observation.state: float32, 形状 [8](joint_0 至 joint_7),15 fps
  • observation.velocity: float32, 形状 [8]
  • observation.images.over_shoulder_left_camera: 视频,270×480×3,codec avc1,15 fps
  • observation.images.wrist_cam: 视频,270×480×3,codec avc1,15 fps
  • 其他字段: episode_index, frame_index, index, task_index, timestamp, next.done

许可与归属

数据完全由本项目在模拟环境中合成生成,不包含任何第三方录制内容,基于 Apache-2.0 许可证发布。

可视化

可通过 LeRobot 数据集可视化器 进行浏览。

搜集汇总
数据集介绍
RoboLab-BananaInBowl-hard-base-det-260802 数据集图片
构建方式
本数据集源自RoboLab(Isaac Lab)仿真环境中的BananaInBowl操作任务,由采用逆向课程学习的RFCL代理在'hard'初始位姿分布下进行确定性(argmax)策略的强化学习回滚生成,旨在为pi0.5模型提供增量动作监督微调数据。数据采集全程依托LeRobot框架,记录动作、状态、速度及双视角视频(肩部左相机与腕部相机),并以15帧/秒的恒定帧率存储。初始物体位姿并非随机采样,而是选自经过物理验证的预生成布局数据集(DAVIAN-Robotics/robolab-init-positions),确保无物体穿插现象。所有轨迹均为成功回合,失败样本在采集时即被剔除,最终整合为5,950个回合、共计423,318帧的规模,并附带元数据文件(provenance.json与stats.json)以记录训练配置和分位数统计信息。
使用方法
使用本数据集时,可通过LeRobot框架加载,采用绝对动作和二元夹爪指令,并配合成功保持(K-hold settle)判断机制。由于统计量已提供,可直接用于需要分位数归一化的模型,如pi0.5。训练时可利用LeRobot数据可视化工具查看回放,并应严格遵循记录的相机视角与帧率设置。需注意,本数据集与另一基于不同阈值(0.5)训练的'banana-hard-sf50'线路数据不可混用,尤其在进行受控对比实验时,应避免跨数据集的混合训练,以确保策略评估的公平性与准确性。
背景与挑战
背景概述
该数据集由RoboLab项目团队于2023年创建,旨在推动机器人操作领域的模仿学习研究。其核心研究问题在于如何通过强化学习(RL)从高质量演示中高效学习复杂操作技能,特别是针对精细的物体放置任务。数据集由HuggingFace与Isaac Lab合作生成,采用了先进的RFCL(Reverse-Forward Curriculum Learning)算法,并通过精心设计的逆向课程策略提升策略的泛化能力。该数据集为机器人学习社区提供了标准化、可复现的训练基准,对评估不同学习算法在复杂操作任务中的表现具有重要价值,尤其是在pi0.5等小样本学习场景中,其设计方法和训练策略为后续研究提供了参考。
当前挑战
该数据集所解决的领域问题在于,机器人操作任务常面临初始状态分布复杂、物体位姿多变等挑战,导致策略泛化能力不足。为此,数据集采用预先生成的物理验证布局,覆盖100%可行范围及全视角旋转,确保无物体穿透。构建过程中面临的挑战包括:确保硬件控制指令的兼容性,如机械臂动作采用绝对关节目标,并特别强调二值夹爪控制以避免连续值带来的策略质量高估;此外,数据聚合后视频帧率不稳定,需进行恒定帧率校准以确保数据质量。这些解决方案为同类数据集的构建提供了重要经验。
常用场景
经典使用场景
RoboLab-BananaInBowl-hard-base-det-260802数据集专为机器人操作领域的强化学习与模仿学习研究设计。其核心应用场景聚焦于‘香蕉入碗’这一精细操作任务,在‘hard’初始位姿分布下(即目标位置覆盖全可行域、偏航角完全随机),利用LeRobot框架采集了5950条成功轨迹,共包含423,318帧同步图像与动作数据。该数据集特别适用于训练和评估视触觉驱动的策略模型,如pi0.5多模态模型,进行增量动作微调(delta-action SFT),并支持离线强化学习(如RLPD)以及行为克隆等经典范式。
解决学术问题
该数据集解决了机器人学习中高难度任务泛化性不足与数据采集一致性差的双重难题。它采用物理验证的初始位姿布局,消除了物体穿插伪影,并通过K-hold成功判据(15步稳定接触)确保轨迹质量;明确记录绝对关节目标、二进制夹爪动作及量化归一化统计量,避免了连续夹爪信号对策略质量的夸大效应。由此推进了领域随机化、课程学习(如逆向前向阈值调整)以及跨策略可对比性研究,为验证操作策略在复杂初始条件下的鲁棒性提供了标准化的基准,促进了从仿真到现实迁移的可重复性研究。
实际应用
在实际应用中,该数据集可直接服务于工业分拣、家庭服务机器人等场景的‘拿取-放置’技能习得。其高质量轨迹(确定性策略采集)为快速原型验证提供可靠素材,使开发者能够高效训练视觉运动策略,用于机械臂在干扰环境下的精准操作。数据集的二值夹爪控制约定简化了执行层部署,而15fps、双视角(肩部与腕部相机)的视频流则兼容主流端到端模型输入格式。此外,Apach-2.0许可与完整元数据(provenance.json、stats.json)降低了企业集成与二次开发的门槛,可被直接嵌入机器人技能库,支撑‘从感知到动作’的闭环控制系统开发。
数据集最近研究
最新研究方向
本数据集聚焦于机器人操作领域中的逆强化学习与课程学习交叉前沿,特别是基于反向课程学习(RFCL)训练的智能体在硬初始位姿分布下的策略迁移能力。数据集采集自Isaac Lab模拟环境中的BananaInBowl任务,采用确定性策略进行滚动,仅保留成功轨迹,为pi0.5模型提供delta-action监督微调数据。研究热点在于通过控制训练过程中的`solved_frac_threshold`参数(如0.9 vs 0.5),探索不同逆转阈值对策略最终性能的影响,从而优化从逆课程到正课程的学习效率。该数据集严格区分不同训练阈值的采集车道,强调数据不可混用,对于构建严格对照实验、避免隐性偏差具有重要意义。此外,数据集的初始位姿分布采用物理验证的布局数据,确保无穿透,且包含绝对偏航角,为后续研究提供了高保真的训练样本。其发布推动了具身智能领域中数据透明度与可复现性标准的提升,有望成为操作策略泛化研究的基准资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务