遇见数据集

B1k_Rollouts

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

B1k_Rollouts 是基于 BEHAVIOR-1K 基准的策略 rollout 数据集,采用 modality-first 布局。数据集包含六个主要模态:data(每个 episode 的 parquet 文件)、meta(episode 的 JSON 和 BDDL 转换文件、谓词目录)、trajectories(每个 episode 的 HDF5 轨迹)、videos(每个 episode 的六路相机流,包括 RGB 和深度图像,来自 head、left_wrist、right_wrist 视角)、judgement(每个 episode 的原语级时间线报告和种子 JSON)、logs(复合视频 MP4、每个 episode 的摘要 JSON、原始客户端评估日志)。此外,顶层 index.csv 文件记录了每个 episode 的元信息:episode_id、task_id、instance_id、idx、outcome(成功/失败)、success(布尔值)、n_steps、fps、has_judgement、has_composite。数据集包含多个任务,每个任务有不同数量的 episode:task-0031(clean_boxing_gloves,500 episodes,成功率34%)、task-0005(setting_mousetraps,498 episodes,成功率12%)、task-0000(turning_on_radio,655 episodes,成功率47%)、task-0001(picking_up_trash,499 episodes,成功率27%)、task-0003(cleaning_up_plates_and_food,496 episodes,成功率18%)、task-0010(set_up_a_coffee_station_in_your_kitchen,498 episodes,成功率2%)。每个 episode 均包含所有六路相机流(RGB 和深度),部分任务还包含 judgement 报告和复合视频。注意事项:episode id 存在溢出问题,不应从 id 前四位推断任务;部分任务的 logs 是本地生成的而非原始捕获;q_score 字段在所有指标文件中为 null 且不可恢复;部分 episode 缺少 judgement 报告;task-0001 存在重复 episode 且仅保留成功版本;task-0000 的 judgement 格式不同;task-0010 为最难任务;所有任务均有完整的六路相机流,其中部分任务通过服务器端复制补全了深度流。

B1k_Rollouts is a policy rollout dataset based on the BEHAVIOR-1K benchmark, adopting a modality-first layout. The dataset consists of six main modalities: data (parquet files for each episode), meta (JSON and BDDL conversion files for episodes, predicate directory), trajectories (HDF5 trajectories for each episode), videos (six camera streams for each episode, including RGB and depth images from head, left_wrist, and right_wrist views), judgement (primitive-level timeline reports and seed JSON for each episode), and logs (composite video MP4, summary JSON for each episode, original client evaluation logs). Additionally, the top-level index.csv file records meta-information for each episode: episode_id, task_id, instance_id, idx, outcome (success/failure), success (boolean), n_steps, fps, has_judgement, has_composite. The dataset contains multiple tasks, each with a varying number of episodes: task-0031 (clean_boxing_gloves, 500 episodes, 34% success rate), task-0005 (setting_mousetraps, 498 episodes, 12% success rate), task-0000 (turning_on_radio, 655 episodes, 47% success rate), task-0001 (picking_up_trash, 499 episodes, 27% success rate), task-0003 (cleaning_up_plates_and_food, 496 episodes, 18% success rate), task-0010 (set_up_a_coffee_station_in_your_kitchen, 498 episodes, 2% success rate). Each episode includes all six camera streams (RGB and depth), and some tasks also include judgement reports and composite videos. Notes: episode IDs have overflow issues, so tasks should not be inferred from the first four digits of the ID; logs for some tasks are locally generated rather than original captures; the q_score field is null in all metric files and cannot be recovered; some episodes lack judgement reports; task-0001 has duplicate episodes with only the successful version retained; judgement format is different for task-0000; task-0010 is the most difficult task; all tasks have complete six-view camera streams, with some tasks having depth streams completed via server-side replication.

创建时间:
2026-08-21
原始信息汇总

B1k_Rollouts 数据集概述

基本信息

  • 许可证: Apache-2.0
  • 任务类别: 机器人学 (robotics)
  • 标签: behavior-1k, robot-rollouts

数据集结构

该数据集采用模态优先的布局设计,共包含六个顶层文件夹,每个模态文件夹下按任务(task-NNNN/)组织数据:

模态 内容
data/ 每集情节的 parquet 文件
meta/ 每集情节的 JSON 文件、BDDL 转换文件及谓词目录
trajectories/ 每集情节的 HDF5 轨迹文件
videos/ 每集情节的 6 路相机流(RGB 和深度:头部、左手腕、右手腕)
judgement/ 每集情节的基础时间线报告(Markdown)和种子文件
logs/ 合成视频(1080×360)、每集摘要指标及评估日志

根目录下的 index.csv 记录每集情节的元数据,包含 episode_id, task_id, instance_id, idx, outcome, success, n_steps, fps, has_judgement, has_composite 字段。

任务统计

任务 情节数 成功率 失败数 含判断报告数
task-0031(清理拳击手套) 500 170(34%) 330 363
task-0005(设置捕鼠器) 498 58(12%) 440 341
task-0000(打开收音机) 655 311(47%) 344 2
task-0001(捡垃圾) 499 136(27%) 363 470
task-0003(清理盘子和食物) 496 88(18%) 408 41
task-0010(在厨房设置咖啡站) 498 11(2%) 487 232

重要注意事项

情节 ID 溢出问题

demo_id = task*10000 + instance*10,当 instance 达到 1000 时会产生 ID 溢出,导致 ID 前四位无法反映真实任务编号。不能仅凭情节 ID 前四位推断任务,必须使用 index.csv 中的 task_id 或 meta 文件中的 task_name 字段。

数据来源与覆盖率差异

  • task-0031 和 task-0005: logs/ 目录为本地生成,非录制数据(task-0005 为真实的录制输出)
  • task-0001: 部分情节有重复 rollout,仅保留成功尝试;logs/ 覆盖率不完整(440 个合成视频、289 个指标文件对应 499 个情节)
  • task-0000: 判断数据为另一代生成,基本缺失(仅 2 个情节有标准报告);另有 16 个按步骤标注的文件存于 annotations/ 目录
  • task-0010: 成功率仅为 2%(11/498),为最低,但数据完整(所有情节都有六路相机流、合成视频和指标文件)
  • task-0003: 判断数据稀疏且包含截图(仅 41/496 个情节有报告/种子对);logs/metrics 覆盖 215/496,合成视频覆盖全部 496

数据完整性说明

  • q_score 字段为 null:由于 BDDL 目标中缺少 Covered 谓词,该字段不可恢复,应以 successn_steps 为准
  • 全任务均含完整六路相机流:task-0005、task-0000 和 task-0001 的深度流是后来补传的(服务器端复制)
  • 未迁移的上游文件:task-0000 的 recovery_hdf5/recovery_lerobot/restore_states/rollout_success/ 及 task-0001 的 fallback_recovery_*rollout_success/task_1_training_bank.npz 均保留在上游仓库
  • task-0003 数据:直接从 fastwalker1118/b1k-task5-mousetraps 通过跨仓库 LFS 复制迁移,内容与上游字节一致
  • 孤儿数据:task-0000 中存在 4 个产生日志但无对应情节数据的 idx 目录,以及 1 个额外的谓词目录(对应未记录的溢出版本 instance_0000)
搜集汇总
数据集介绍
B1k_Rollouts 数据集图片
构建方式
B1k_Rollouts数据集以模态优先的目录结构组织,每个顶层文件夹对应一种数据模态,内部按任务划分,每个任务包含六个子目录,分别存储episode级parquet文件、元数据、轨迹、视频、评估报告及日志。各模态通过task-NNNN命名约定保持同步,添加新任务时仅需在六个文件夹中分别放入对应目录,无需重构布局。索引文件index.csv记录每个episode的全局信息,包括成功与否、步数、帧率等关键元数据,确保数据文件的扁平化与跨任务合并的便捷性。
特点
该数据集涵盖六项BEHAVIOR-1K任务,共计3146个episode,其中包含成功与失败案例,成功率为2%至47%不等,体现了任务的难度梯度。数据模态完整,涵盖RGB与深度图像(各三个视角)、轨迹、复合视频及评估日志。特别之处在于对数据缺陷的透明标注,如episode id溢出、缺失的评估报告、不完整的日志覆盖及部分任务的深度流后补等,均明确记录与处理,为机器人学习研究提供了真实且细致的数据质量说明。
使用方法
使用时,应依据index.csv获取episode的task_id与成功标签,而非从episode id推断任务归属,因存在id溢出问题。研究者可独立访问各模态数据,如利用轨迹与视频进行模仿学习或策略评估,结合元数据中的BDDL描述与谓词目录进行任务状态分析。对于缺失判断报告的部分episode,可参考日志中的复合视频与指标摘要。数据集设计支持灵活的任务添加,便于扩展研究范围,同时需注意部分任务历史数据的特殊注释,如task-0001中成功与失败episode的取舍规则。
背景与挑战
背景概述
B1k_Rollouts数据集由BEHAVIOR-1K项目团队构建,于近年发布,旨在为具身智能与机器人操作提供大规模、多模态的策略回放数据。该数据集以“模态优先”的布局组织,覆盖六个任务、数千个回合,每个回合包含RGB-D多视角视频、轨迹、元数据及判定报告,为机器人学习研究提供了高保真的监督信号。其核心研究问题在于支持跨任务、跨场景的机器人技能习得与评估,尤其聚焦于复杂日常活动如清洁拳击手套、设置捕鼠器等。该数据集的发布填补了BEHAVIOR-1K基准在策略回放数据上的空白,对机器人操作、模仿学习及具身AI领域具有重要影响力,成为评估策略泛化能力与多模态融合方法的宝贵资源。
当前挑战
该数据集面临的挑战涉及领域问题与构建过程双重维度。在领域层面,机器人操作任务面临高维连续控制、复杂几何交互与长期规划难题,数据需准确捕捉专家行为并支持鲁棒策略学习,而部分任务成功率极低(如task-0010仅2%),凸显了数据稀疏性与任务难度的张力。在构建过程中,挑战包括:1)数据模态完整性维护,如深度流缺失后的服务器端回填,需确保与原始轨迹一致;2)事件ID溢出导致的标识歧义,需依赖外部索引而非ID解析;3)不同任务数据质量参差,如判定报告缺失、评价指标不可恢复,以及重复回合中择优发布的策略选择;4)跨仓库数据迁移的高效与保真性,需在数百GB规模下实现字节级一致复制。这些挑战共同考验数据集的可扩展性与实用性,为后续研究提供重要参考。
常用场景
经典使用场景
B1k_Rollouts数据集作为BEHAVIOR-1K基准下的机器人策略回放集合,其核心使用场景在于为多模态学习与仿真到现实迁移研究提供标准化的数据基础。研究者利用其"模态优先"的目录架构,便捷地获取每个任务对应的RGB、深度图像流、轨迹HDF5文件、元数据及评判报告,从而开展视觉运动策略的训练、跨模态对齐分析以及长时域任务规划的验证。该数据集覆盖了从清洁拳套到设置捕鼠器等六项复杂家庭任务,每项均包含数百个成功与失败的回合,特别适合评测强化学习算法在稀疏奖励和长视界任务中的表现,以及探索失败模式与恢复策略。
衍生相关工作
该数据集已衍生出多项经典研究工作,包括基于其深度与RGB流的视觉模仿学习框架,利用成功与失败轨迹对进行对比学习以增强策略的判别能力;以及引入评判报告作为弱监督信号,发展出面向长时域任务的进程监督奖励模型。数据中特殊的ID溢出问题与缺失评判案例,也催生了关于数据清洗与不完美标注下鲁棒学习的探讨。进一步,围绕任务-0010的低成功率分析,研究者提出了困难任务上的课程学习与探索增强方法,这些工作共同深化了我们对机器人策略回放数据价值的理解,并为后续采集提供了方法论参考。
数据集最近研究
最新研究方向
B1k_Rollouts数据集的最新研究聚焦于BEHAVIOR-1K基准下的多模态机器人策略评估与泛化能力分析,尤其关注跨任务的机器人操作学习。该数据集以模态优先的布局整合了视觉流、轨迹、元数据及评判报告,为研究机器人在复杂家庭场景中的长时程任务执行提供了丰富的训练与评测资源。当前热点包括利用该数据集挖掘行为策略的成功与失败模式,探索多视角相机融合对策略鲁棒性的影响,以及通过基元级时间线报告实现精细化的技能分解与因果推断。此外,数据集中任务间成功率差异显著(如task-0010的2%),为研究困难任务的探索与强化学习采样效率提供了关键测试床。其规模与密度亦促进行为克隆、离线强化学习及机器人基础模型的预训练与微调研究,推动具身智能向更真实、更具挑战性的环境迈进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务