遇见数据集

B1k_rollout

收藏
Hugging Face2026-07-16 更新2026-07-17 收录
官方服务:

资源简介:

BEHAVIOR-1K pi0.5 Rollouts 数据集是一个用于机器人研究的多样化演示数据集,基于BEHAVIOR-1K挑战任务,由Pi0.5(pi_behavior_b1k_fast)任务条件策略生成。该数据集包含在新生成的任务实例(ID为500系列)上收集的机器人操作轨迹,数据来源于特定模型检查点。数据集提供丰富的多模态信息:每个轨迹包括状态(256维)和动作(23维)序列的.hdf5文件;来自多个视角(头部、左手腕、右手腕)的RGB和深度视频.mp4文件;以及记录场景、步数和成功状态的元数据.json文件。此外,数据集还包含每个轨迹的量化评估指标q_score.final,表示任务目标条件的完成比例(1.0为完全成功)。当前版本涵盖12个不同的日常家居操作任务(例如打开收音机、将鞋子放上架子、捡起垃圾、整理卧室等),总计447条轨迹,整体平均q分数约为0.485,涵盖了成功、部分完成和失败的案例。该数据集旨在支持机器人模仿学习、策略评估以及失败恢复训练等研究,并会随着新轨迹的完成而持续更新。

The BEHAVIOR-1K pi0.5 Rollouts dataset contains a series of robot operation trajectories generated by the Pi0.5 (pi_behavior_b1k_fast) task-conditioned policy on BEHAVIOR-1K challenge tasks. These trajectories are collected based on a set of newly generated task instances (ID 500 series) and sourced from specific model checkpoints. The dataset provides rich multimodal information: each trajectory includes .hdf5 files for state (256-dimensional) and action (23-dimensional) sequences; RGB and depth video .mp4 files from multiple perspectives (head, left wrist, right wrist); and metadata .json files recording scene, step count, and success status. The dataset also includes a quantitative evaluation metric q_score.final for each trajectory, representing the completion ratio of task objectives (1.0 for full success). The current snapshot covers 12 different daily household operation tasks (e.g., turning on a radio, placing shoes on a shelf, picking up trash, tidying a bedroom, etc.), totaling 447 trajectories, with an overall average q-score of approximately 0.485, encompassing successful, partially completed, and failed cases. This dataset aims to provide diverse demonstration data for research in robot imitation learning, policy evaluation, and failure recovery training, and will be continuously updated as new trajectories are completed.

创建时间:
2026-07-14
原始信息汇总

数据集概述:BEHAVIOR-1K pi0.5 Rollouts (B1k_rollout)

  • 名称:BEHAVIOR-1K pi0.5 Rollouts (B1k_rollout)
  • 许可证:MIT
  • 任务类别:机器人学
  • 标签:机器人学,BEHAVIOR-1K,操作,模仿学习,pi0

数据集描述

该数据集包含来自 OpenPI / Pi0.5 策略(pi_behavior_b1k_fast)在 BEHAVIOR-1K 挑战任务上生成的 rollout 数据。这些 rollout 是在新生成的任务实例(500 系列实例 ID)上收集的,数据来自检查点 checkpoint_1/2/3 的策略 IliaLarchenko/behavior_submission,并基于每个观测进行任务条件化。

数据结构

<task_name>/by_instance/idxNNN/{success|failure}/2025-challenge-demos/ ├── trajectories/.hdf5 # 状态 (256维) + 动作 (23维) 轨迹,每个episode一个文件 ├── videos/.mp4 # RGB + 深度,头/左腕/右腕视角 (LeRobot 视频支持) └── meta/episode_.json # 场景、步数、成功标志 <task_name>/by_instance/idxNNN/logs/ # 每个episode的指标:metrics/.json -> q_score.final <task_name>/by_instance/idxNNN/offline_eval/ # VLM失败判定输出(子集)

  • q_score.final:任务 BDDL 目标条件满足的比例(1.0 = 完全成功)。
  • idxNNN:任务在 test_instances.csv 中的密集索引;这些 rollout 覆盖了新添加的实例。

数据内容(快照)

任务 任务ID Rollout数量 平均q值
turning_on_radio 0 101 0.400
putting_shoes_on_rack 22 95 0.624
picking_up_trash 1 92 0.563
tidying_bedroom 18 78 0.373
setting_mousetraps 5 40 0.504
clean_boxing_gloves 31 10 0.550
wash_a_baseball_cap 32 10 0.550
setting_the_fire 30 10 0.188
clean_up_your_desk 29 7 0.130
cleaning_up_plates_and_food 3 3 0.429
collecting_childrens_toys 21 1 1.000
set_up_a_coffee_station_in_your_kitchen 10 0

总计:447 个 rollout,整体平均 q ≈ 0.485(涵盖 12 个任务)。数据包含成功、部分完成和失败的混合案例,适用于成功与失败恢复训练。

补充说明

该快照会随着更多 rollout 完成而增量更新,每个任务的 rollout 数量会随时间增长。

搜集汇总
数据集介绍
B1k_rollout 数据集图片
构建方式
该数据集源自对基于BEHAVIOR-1K挑战任务的Pi0.5条件策略(pi_behavior_b1k_fast)的rollout收集。策略检查点取自IliaLarchenko/behavior_submission的checkpoint_1/2/3,并在新生成的500系列任务实例上执行,每个观测均结合任务条件进行推理。数据集以任务名称为顶层目录,按实例索引(idxNNN)组织,每个实例下区分成功与失败两类rollout,分别存储轨迹(HDF5格式:256维状态与23维动作)、多视角视频(RGB+深度,头、左腕、右腕)以及元数据JSON文件。
使用方法
用户可通过任务名称与实例索引定位特定rollout,加载HDF5轨迹文件进行状态-动作序列的模仿学习或行为克隆训练。视频文件采用LeRobot视频回放格式,便于可视化校验。元数据JSON中的场景信息、步数与成功标志可直接用于训练数据筛选。q_score.final可作为加权采样或课程学习的依据,而失败rollout与VLM评判结果相结合,可用于构建鲁棒性训练或失败恢复策略的强化学习环境。
背景与挑战
背景概述
B1k_rollout数据集诞生于具身智能与机器人操作领域的前沿探索,由IliaLarchenko等研究人员基于BEHAVIOR-1K挑战任务构建,于2025年发布。该数据集旨在为模仿学习策略Pi0.5(`pi_behavior_b1k_fast`)提供大规模、多样化的任务条件化执行轨迹,核心研究问题聚焦于如何通过任务条件化策略在复杂真实场景中实现长序列操作行为。数据集涵盖了从开关收音机到整理床铺等12项日常操作任务,共计447条轨迹,平均任务完成度达0.485,为机器人操作策略的鲁棒性评估与失败恢复训练提供了标准化的基准资源,在具身智能社区中具有重要影响。
当前挑战
B1k_rollout数据集所解决的领域核心挑战是机器人操作策略在开放世界环境中的泛化与鲁棒性问题:传统方法在单一任务场景下表现良好,但难以应对BEHAVIOR-1K中多样化的任务实例与动态环境变化,尤其是在任务条件化下的动作空间高维度(23维)与状态空间复杂性(256维)带来的策略优化困难。构建过程中,数据集面临的主要挑战包括:跨异构任务实例的轨迹一致性保持、失败案例的充分收集以支撑恢复学习,以及多传感器模态(RGB、深度、手臂视点)的同步与标准化存储,同时还需应对在线评估中VLM(视觉语言模型)对失败判定的可靠性问题,这些挑战共同构成了高质量操作轨迹数据构建的技术瓶颈。
常用场景
经典使用场景
在具身智能与机器人操作研究领域,B1k_rollout数据集为模仿学习与行为克隆范式提供了高质量的轨迹训练资源。该数据集源自最新的Pi0.5视觉-语言-动作基础模型在BEHAVIOR-1K挑战任务上的策略展开,涵盖12项复杂日常操作任务,如开关收音机、整理卧室、设置捕鼠器等。其典型用法是作为离线强化学习的专家示范库,研究人员可提取每一条轨迹中的高维状态向量与动作序列,用于训练机器人策略网络。尤为珍贵的是,该数据集忠实记录了任务成功、部分完成与失败三种结果,为基于逆强化学习的奖励函数学习以及从失败中恢复的鲁棒策略训练创造了独特条件。
解决学术问题
该数据集系统地回应了具身智能领域长期存在的两大核心挑战:任务条件化场景下的泛化能力评估与细粒度操作失败分析。长期以来,机器人学习数据要么局限于单一成功示范,要么因噪声过大而难以解析动作语义。B1k_rollout创新性地通过BDDL目标条件满足比例(q_score)量化每个任务实例的完成度,首次为学界提供了可精确度量的部分成功轨迹。这使得研究者能够从机理上探究策略在复杂长时域任务中的中间状态退火现象,揭示Pi0.5架构在不同任务难度下的性能边界。此外,数据集中新实例索引与旧实例的分离设计,为评估策略对新场景分布的鲁棒性提供了标准化基准。
实际应用
在机器人产业化落地进程中,B1k_rollout数据集直接服务于家庭服务机器人、仓储物流机器人及辅助生活设备的智能操作升级。例如,turning_on_radio与setting_the_fire等任务数据可训练机器人在杂乱环境中精准识别并操作家电与特定工具;putting_shoes_on_rack与tidying_bedroom数据则对应家庭整理与物品摆放的实际需求。更为关键的是,该数据集包含的447条展开轨迹中混合的失败案例,使开发者能够构建闭环纠错机制——机器人在模拟环境中通过离线数据学习检测操作失效前的动作前兆,从而在实际运行时提前触发重规划。这种基于失败数据的应用思路,显著降低了机器人从模拟环境迁移至真实场景时的部署风险。
数据集最近研究
最新研究方向
该数据集聚焦于具身智能领域中的模仿学习与任务条件化策略研究,基于BEHAVIOR-1K挑战任务,通过Pi0.5多模态策略模型收集447条轨迹数据,涵盖开关收音机、整理卧室等12类日常操作任务。研究前沿在于探索部分成功与失败轨迹对策略鲁棒性的提升作用,尤其是在任务实例多样性与条件化泛化能力评估中,数据集提供的平均质量分数(q均值0.485)凸显了复杂场景下策略的不完全性,为后续解决失败恢复训练与增量式行为学习提供了关键基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务