遇见数据集

RoboLab-BananaInBowl-hard-base-stoch-260802

收藏
Hugging Face2026-08-09 更新2026-08-10 收录
官方服务:

资源简介:

该数据集使用LeRobot工具从RoboLab (Isaac Lab)模拟环境中收集,基于一个在BananaInBowl任务上训练的策略,在hard初始位姿分布下进行强化学习rollout。数据集导出用于pi0.5 delta-action有监督微调。数据仅包含成功episodes,通过随机采样(温度1.0)获取。共有5941个episodes,总计433699帧,帧率15fps。每个样本包含:8维动作向量(绝对关节目标,其中第7个维度为二值夹爪指令,0或1表示打开/关闭)、8维观测状态(关节位置)、8维速度、两个相机视角的图像(over_shoulder_left_camera和wrist_cam,分辨率270x480,RGB视频),以及episode索引、帧索引、时间戳、任务索引、完成标志等字段。记录约定:动作采用绝对关节目标(DROID坐标系,j7偏移-π/4),夹爪为二值控制,状态为teleport原生关节向量,成功判定基于K-hold settle(success_hold_steps=15),episode达到成功即截断。所有视频为恒定帧率,经过归一化处理。数据集完全由模拟生成,无第三方数据,采用Apache-2.0许可证。

This dataset was collected using the LeRobot tool from the RoboLab (Isaac Lab) simulation environment, based on a policy trained on the BananaInBowl task with a hard initial pose distribution during reinforcement learning rollouts. The dataset is exported for supervised fine-tuning of the pi0.5 delta-action model. It contains only successful episodes obtained via random sampling (temperature 1.0). There are a total of 5941 episodes, 433699 frames, at 15fps. Each sample includes: an 8-dimensional action vector (absolute joint targets, with the 7th dimension being a binary gripper command, 0 or 1 for open/close), an 8-dimensional observation state (joint positions), 8-dimensional velocities, images from two camera views (over_shoulder_left_camera and wrist_cam, resolution 270x480, RGB video), as well as episode index, frame index, timestamp, task index, and completion flag. Recording conventions: actions use absolute joint targets (DROID coordinate system, j7 offset -π/4), gripper is binary control, states are teleport native joint vectors, success is determined by K-hold settle (success_hold_steps=15), and episodes are truncated upon success. All videos are constant frame rate and normalized. The dataset is entirely simulated, contains no third-party data, and is licensed under Apache-2.0.

创建时间:
2026-08-02
原始信息汇总

数据集概述:RoboLab-BananaInBowl-hard-base-stoch-260802

基本信息

  • 数据集名称: RoboLab-BananaInBowl-hard-base-stoch-260802
  • 创建工具: LeRobot (https://github.com/huggingface/lerobot)
  • 许可证: Apache-2.0
  • 任务类别: 机器人学 (robotics)
  • 标签: LeRobot, robotics, lerobot, isaac-lab, manipulation, rl-rollout, pi0.5

数据集内容

  • 总集数 (episodes): 5941
  • 总帧数 (frames): 433699
  • 任务数: 1
  • 分割: train (0:5941)
  • 帧率 (fps): 15

数据来源与采集方式

  • 数据来源于RoboLab(Isaac Lab)环境中BananaInBowl任务的强化学习策略回放(RL rollouts)。
  • 采集策略使用hard初始姿态分布,基于checkpoint /home/nas_main/minhopark/repos/dg-rl/libs/FlashSAC/models/init-pose-ladder/ipl-bana-hard-s0/BananaInBowl/seed0-0731-195129/step6104(该checkpoint为RFCL代理,采用reverse→forward转换阈值solved_frac_threshold = 0.9,最终评估成功率为0.98,平均成功片段长度为47.7步)。
  • 数据通过采样方式从策略分布(temperature 1.0)收集,仅包含成功片段,失败片段在采集时被丢弃。
  • 一个确定性(argmax)版本的数据集将单独发布。注意:另有一个分支(banana-hard-sf50,阈值0.5)重新训练的任务,其数据不可与本数据集互换,在进行对比实验时请勿混用。

初始姿态分布(hard)

  • 位置: 任务可测量可行范围的100%
  • 偏航角 (yaw): 均匀分布于±180°(全圆)
  • 固定物体: 名称含bin的容器保持固定;其他资产(包括bowl)与目标一起随机化。
  • 存储的偏航角为绝对角度,已包含各资产的场景默认方向。
  • 所有初始布局来自预生成的物理验证布局数据集(DAVIAN-Robotics/robolab-init-positions),不存在物体互相穿透的初始状态。

记录规范

字段 规范
臂部动作 绝对关节目标(DROID帧,j7偏移−π/4)
夹爪动作 二值 {0, 1}(raw > 0 → close)
状态 完整关节向量(teleport-native)
成功标准 K-hold settle,success_hold_steps = 15,达到成功即截断片段
相机 over_shoulder_left_camera, wrist_cam
帧率 15

重要说明:夹爪动作为二值形式。早期版本中连续夹爪信号会高估下游策略质量,请勿从二值信号重新推导连续通道。

数据特征

  • 动作 (action): float32,形状[8],包含电动机:j0, j1, j2, j3, j4, j5, j6, gripper,帧率15
  • 状态 (observation.state): float32,形状[8],包含关节:joint_0至joint_7,帧率15
  • 速度 (observation.velocity): float32,形状[8],帧率15
  • 图像 (observation.images): 两个相机视图(over_shoulder_left_camera 和 wrist_cam),均为270×480×3像素,AVC1编码,yuv420p像素格式,帧率15
  • 其他字段: episode_index, frame_index, index, task_index, timestamp, next.done

元数据

  • meta/provenance.json:记录了采样模式、初始姿态等级、动作/夹爪约定、保持长度等溯源信息。
  • meta/stats.json:包含q01/q99分位数统计(用于pi0.5分位数归一化),在聚合后计算。
  • 所有视频已应用恒定帧率(CFR)规范化处理(解决PTS抖动问题)。

文件结构与大小

  • 数据文件: parquet格式,路径 data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet,大小约100 MB
  • 视频文件: mp4格式,路径 videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4,大小约200 MB
  • 分块大小: 1000

可视化

可通过LeRobot数据集可视化工具查看:Open in the LeRobot dataset visualizer

其他信息

  • 数据集完全合成,由本项目在仿真环境中生成,无第三方录制内容。
  • 主页、论文和引用信息均为"More Information Needed"。
搜集汇总
数据集介绍
RoboLab-BananaInBowl-hard-base-stoch-260802 数据集图片
构建方式
该数据集源自RoboLab(Isaac Lab)仿真环境下的BananaInBowl任务,由强化学习策略在难度分级为“hard”的初始位姿分布下进行随机采样(温度1.0)生成,仅收集成功回合,剔除失败样本。策略采用RFCL算法,经逆向课程训练,其前向阶段在45/50个演示达成率阈值0.9时启动,最终评估成功率达0.98。数据记录遵循严格约定:机械臂动作为DROID坐标系下的绝对关节目标,夹爪动作为二值信号,状态向量为完整关节值,并采用K-hold稳定判定成功(保持15步)。物体初始位姿来自预生成的物理验证布局数据集,避免穿插,其中容器固定,其余物体(含碗)随机化。所有视频经恒定帧率归一化处理,确保PTS一致性,并附有聚合后的分位数统计文件及来源元数据。
特点
数据集规模宏大,包含5941个成功回合、433699帧,覆盖完整的物理可行位姿范围及±180°全周偏航角,极具多样性。其独特之处在于严格区分不同的策略来源:收集策略的阈值设置(0.9与0.5)导致数据集不可互换,为对照实验提供清晰边界。数据以Parquet格式存储,特征含8维动作、状态、速度及两路相机(肩部左相机、腕部相机)视频,帧率15fps,分辨率270×480。夹爪动作采用二值编码,避免连续值高估问题。标准化统计量(q01/q99)在聚合后计算,满足pi0.5量化归一化需求。全合成数据,Apache-2.0许可,无第三方内容。
使用方法
该数据集专为pi0.5模型的delta-action监督微调(SFT)设计,可直接用于机器人操作策略的模仿学习。使用时需依据meta/info.json和provenance.json解析数据特征与采集配置,并应用元数据中的分位数统计进行状态和动作的归一化。训练时,应遵循LeRobot框架标准流程,将动作作为目标值,观测图像和状态作为输入。注意区分不同阈值策略生成的数据,避免混合以保证对照公平。仅包含成功轨迹,适用于学习正向示范。所有视频为恒定帧率,可直接使用torchcodec后端解码。用户可通过LeRobot可视化器预览数据,或直接加载Parquet文件进行自定义训练管线。
背景与挑战
背景概述
该数据集由DAVIAN-Robotics团队于2026年8月2日创建,旨在为机器人操作领域的强化学习(RL)策略提供高质量的轨迹数据。它基于Isaac Lab仿真环境,聚焦于“BananaInBowl”任务,即控制机械臂将香蕉放入碗中。数据集的构建源于对复杂初始姿态下策略泛化能力的探究,特别是针对逆课程学习(RFCL)中反向到正向迁移阈值的敏感性。该数据集通过LeRobot框架导出,采用pi0.5增量动作监督微调(SFT)格式,为后续策略对比研究提供了基准。其发布对机器人学习社区具有重要影响,为研究初始姿态分布、策略阈值选择及数据记录约定对下游任务性能的影响提供了标准化的数据资源。
当前挑战
该领域的核心挑战在于实现机械臂在高度复杂初始条件下的精准操作,其困难源自物体摆放的广泛可行范围与全角度偏航的随机性,这要求策略具备强大的泛化能力。数据集构建过程中面临多重困难:物理上需保证初始布局无穿透,通过预生成验证布局实现;动作表示上,二进制夹爪与绝对关节目标的约定需精确统一,以免误导下游策略;视频流需处理恒定帧率与PTS抖动问题,确保数据一致性;量化统计需在聚合后计算,避免分片偏差。此外,不同训练阈值(0.9与0.5)产生的策略在数据上不可互换,数据集的采集需严格追踪来源,防止对比实验的混淆。
常用场景
经典使用场景
RoboLab-BananaInBowl-hard-base-stoch-260802数据集作为一项精心构建的机器人操控模拟数据集,其核心应用场景集中在强化学习与模仿学习的策略训练与评估之中。数据集囊括了5941个成功轨迹和逾43万帧的高频观测数据,涵盖了肩部与腕部双视角视觉信息,以及完整的关节状态与动作指令,为研究者提供了端到端训练视觉运动策略(如pi0.5模型)的理想数据基础。特别地,该数据集采用随机采样的策略分布,并严谨记录了动作与夹爪的二进制控制约定,确保了数据的高置信度,从而有效支持在复杂初始位姿分布下对操控策略泛化能力的深度探索。
衍生相关工作
依托于此数据集,研究者可衍生出多项前沿工作。一方面,它推动了对RL课程学习策略与阈值调节机制的探索,鼓励构建基于逆向课程(reverse→forward transition)的自动化任务分解方法。另一方面,该数据集的发布也将催化基于此数据结构的新型动作归一化与量化技术的涌现,如对delta-action空间的分析。此外,配合其展示的CFR视频处理技巧,为后续处理非恒定帧率视频数据提供了参考基线,进而支持多视角表征学习、位姿估计以及鲁棒操控等方向的学术创新。
数据集最近研究
最新研究方向
该数据集聚焦于机器人操作领域的前沿研究方向,特别是通过强化学习(RL)和逆课程学习(Reverse Curriculum Learning, RFCL)训练策略在复杂初始位姿分布下的泛化能力。其‘hard’初始位姿设置覆盖了任务的全部可行范围与全周角偏航,挑战了策略在极端变动环境下的鲁棒性。数据源自模拟环境(Isaac Lab)中的策略回滚(rollout),采用绝对关节目标与二进制抓取动作的规范化记录,专为π0.5模型的增量动作监督微调(SFT)设计。这种涵盖全范围初始位姿、高度标准化的高质量合成数据,为多模态机器人策略的跨分布泛化研究提供了基准,尤其有助于推动精细操作任务在非结构化场景中的实际应用,也对如何在可控条件下比较不同训练策略(如阈值变化)的影响具有方法论上的重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务