遇见数据集

DAVIAN-Robotics/RoboLab-BananaInBowl-30cm-relrate-k1c0-stoch-260711

收藏
Hugging Face2026-07-16 更新2026-07-22 收录
官方服务:

资源简介:

该数据集名为RoboLab (Isaac Lab) BananaInBowl @30cm,包含从RFCL x RoboLab RL策略收集的rollout数据,已转换为LeRobot v3.0格式,适用于pi0.5(pi05)监督微调(SFT)。数据集记录了机器人操作任务,具体为将香蕉放入碗中的场景,初始随机化距离为30厘米。策略使用relrate k1-c0(速率限制的相对关节动作),采样为随机(stoch)方式。动作空间记录为绝对关节目标(在droid框架中,第7关节偏移为-pi/4),夹爪状态为连续值[0,1](但已被标注为有误,因为实际环境中的夹爪项是二进制的)。成功条件基于K-hold settle,设置success_hold_steps=15,并以成功作为终止条件。数据集包含两个相机视角:over_shoulder_left_camera(外部)和wrist_cam(腕部)。数据集总计5916个episodes,387310帧,帧率为15fps,特征包括动作、观察状态、速度、图像等。注意:该数据集已被取代,建议使用替代数据集RoboLab-BananaInBowl-30cm-relrate-k1c0-stoch-gripbin-260716。

The dataset is named RoboLab (Isaac Lab) BananaInBowl @30cm. It contains rollout data collected from the RFCL x RoboLab RL policy, converted to the LeRobot v3.0 format, and is designed for supervised fine-tuning (SFT) of pi0.5 (pi05). The dataset documents a robotic manipulation task: placing a banana into a bowl, with an initial randomized distance of 30 centimeters. The policy uses relrate k1-c0 (rate-limited relative joint actions), with sampling performed in a stochastic (stoch) manner. The action space is recorded as absolute joint targets (in the DROID framework, the 7th joint has an offset of -pi/4), and the gripper state is a continuous value [0, 1], which has been noted as incorrect since the actual gripper term in the environment is binary. The success condition is based on K-hold settle, with success_hold_steps set to 15, and success is used as the termination condition. The dataset includes two camera perspectives: over_shoulder_left_camera (external) and wrist_cam (wrist-mounted). In total, the dataset contains 5916 episodes and 387310 frames, with a frame rate of 15 fps, and includes features such as actions, observation states, velocities, images, and more. Note: This dataset has been superseded, and the recommended alternative dataset is RoboLab-BananaInBowl-30cm-relrate-k1c0-stoch-gripbin-260716.

提供机构:
DAVIAN-Robotics
搜集汇总
数据集介绍
DAVIAN-Robotics/RoboLab-BananaInBowl-30cm-relrate-k1c0-stoch-260711 数据集图片
构建方式
该数据集源自RoboLab(Isaac Lab)仿真平台,旨在收集机器人将香蕉放入碗中的操作轨迹。数据集基于一个速率受限的相对关节动作强化学习策略(relrate k1-c0)进行随机采样(stoch)生成,策略检查点源自FlashSAC算法在特定种子下的训练结果。虽然策略输出为相对动作,但数据记录器捕获的是最终应用于机器人的绝对关节目标值,即关节位置经限幅后的结果,以符合标准绝对目标约定。每个episode的结束由成功条件触发(K-hold settle,成功保持15步),并在初始化时加入30cm范围的随机化。数据采用LeRobot v3.0格式存储,包含约5916个episode、387310帧,以15帧/秒的频率采集,并配有肩部和腕部两个视角的视频。
特点
该数据集的核心特点在于其动作空间的特殊性和标注的潜在问题。动作向量包含8维,前7维对应机器人的绝对关节位置目标,第8维为夹爪的连续开合值(范围0至1)。然而,该夹爪标注被明确指出为标注伪影:仿真环境中夹爪实际为二值控制,因此记录下的连续中间值从未被物理执行,约96%的夹爪标签落在中间范围,导致其分布与后续模型的动作先验存在显著不匹配。数据集统计信息中包含了q01和q99分位数,视频文件采用CFR归一化处理。数据集的肩部相机为外部视角,腕部相机提供末端执行器近景,共同为模仿学习提供丰富的视觉信息。
使用方法
用户可通过LeRobot框架的视觉化工具直接预览数据集的episode内容。数据以parquet文件存储动作、状态、速度等数值信息,视频以MP4格式独立存储。若需加载数据集进行训练,推荐使用LeRobot库的API,该API能够自动处理数据集索引、chunk读取和视频解码。需特别注意,由于本数据集的夹爪标签存在前述偏差,若计划将数据用于pi0.5等模型的监督微调,应优先使用作者提供的替代版本(RoboLab-BananaInBowl-30cm-relrate-k1c0-stoch-gripbin-260716),该版本已修正夹爪标注问题,并确保动作分布与实际执行一致。数据集仅包含训练划分(0至5916),不支持交叉验证的默认分割。
背景与挑战
背景概述
该数据集由DAVIAN-Robotics团队于2025年7月前后创建,依托RoboLab(Isaac Lab)仿真平台与RFCL实验室的强化学习策略,旨在为机器人操作任务提供高质量的演示数据。核心研究问题聚焦于通过相对关节动作策略(relrate k1-c0)生成香蕉入碗(BananaInBowl)操作轨迹,为pi0.5(pi05)模型的有监督微调(SFT)提供基准数据。数据集包含5916个回合、近38.7万帧,涵盖过肩左摄像头与腕部摄像头的双目视觉观测,并采用LeRobot v3.0格式标准化存储。作为RoboLab系列数据的早期版本,其对机器人策略学习与仿真到现实迁移的研究具有重要参考价值,提供了一个规模化、结构化的操作技能学习资源。
当前挑战
该数据集面临的核心挑战首先在于领域问题层面:机器人操作任务中精细抓取与放置的连续控制难以通过简单的二值化夹爪信号完成,而数据集早期版本错误地将连续夹爪值作为标签,导致约96%的夹爪数据集中在中间范围,这与实际物理执行中的二值化阈值行为严重不符,形成了分布外(OOD)问题,误导了策略学习。其次,构建过程中遇到的技术挑战包括:相对动作策略在记录时被转换为绝对关节目标,增加了动作空间表述的复杂性;数据采集涉及随机初始化与成功率判定(K-hold settle机制),需平衡探索效率与数据质量;此外,视频数据需进行CFR归一化处理,以保证视觉特征的一致性。这些挑战促使了修正版数据集(gripbin后缀)的发布。
常用场景
经典使用场景
在机器人操作领域,该数据集专为精细抓取与放置任务而设计,其经典使用场景聚焦于从仿真环境到真实世界的策略迁移学习。数据集中包含近6000条由强化学习策略生成的示范轨迹,记录了机械臂将香蕉精准放入碗中的完整操作过程,结合肩部与腕部双视角视觉信息,为模仿学习提供了丰富的多模态训练样本。研究者可利用该数据集训练基于视觉的动作预测模型,探索如何将仿真中习得的操作技能高效迁移至物理机器人平台。
实际应用
在工业自动化与家庭服务机器人领域,该数据集直接服务于自主抓取与放置系统的开发。基于该数据训练的模型可部署于协作机械臂,完成餐盘整理、物料搬运等重复性操作任务。其双摄像头配置模拟了真实场景中的观测条件,使算法能够适应环境光变化和视角差异,为生产线的柔性自动化升级提供了可行的技术方案。数据集的Apache-2.0许可也降低了商业应用的门槛。
衍生相关工作
该数据集衍生出的代表性工作包括基于扩散策略的精细操作模型、相对动作空间的正则化学习方法,以及视觉-运动联合表征预训练技术。研究者已利用其修正版本验证了夹爪二值化标签对策略稳定性的提升效果,并推动了pi0.5基础模型在机器人SFT微调场景中的应用。此外,数据集的标准化格式(LeRobot v3.0)还促进了跨数据集泛化研究,催生了融合多源示范的通用操作策略架构。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务