遇见数据集

B1k_Recovery

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

B1k_Recovery是一个用于机器人失败恢复和演示学习的数据集,基于BEHAVIOR-1K模拟环境,采用LeRobot v3.0格式组织。当前版本包含task5(设置捕鼠器),由官方人类演示和自动生成的导航、放置/恢复、成功示范片段混合而成。数据集总计5,795个episode,3,537,240帧,时长约32.752小时(30帧/秒)。其中约58%的帧来自官方人类演示,其余42%为生成数据。每个episode包含61维的观测状态(包括基座、双臂、末端执行器、夹爪和躯干的位姿与速度)和23维的R1Pro VLA动作指令。观测数据来自三个RGB摄像头(头部、左/右RealSense),分辨率224×224,H.264编码。数据集适用于训练机器人操作策略,特别是需要失败恢复能力的任务。使用时需注意:本地task_index(0)需映射到BEHAVIOR-1K全局任务索引5;基座线速度是基座坐标系下的,不应再旋转;推荐使用校正后的归一化统计量;基座通道存在强烈的静止先验偏差。

B1k_Recovery is a dataset for robot failure recovery and demonstration learning, based on the BEHAVIOR-1K simulation environment, organized in LeRobot v3.0 format. The current version includes task5 (setting a mousetrap), composed of official human demonstrations and automatically generated navigation, placement/recovery, and successful demonstration fragments. The dataset totals 5,795 episodes, 3,537,240 frames, with a duration of approximately 32.752 hours (30 fps). About 58% of the frames are from official human demonstrations, and the remaining 42% are generated data. Each episode contains 61-dimensional observation states (including base, dual arms, end-effectors, grippers, and torso poses and velocities) and 23-dimensional R1Pro VLA action commands. Observations come from three RGB cameras (head, left/right RealSense) with a resolution of 224×224, H.264 encoded. The dataset is suitable for training robot manipulation policies, especially for tasks requiring failure recovery capabilities.

创建时间:
2026-08-20
原始信息汇总

B1k_Recovery 数据集详情

数据集概述

B1k_Recovery 是一个面向 BEHAVIOR-1K 机器人任务失败恢复与演示的数据集,采用 LeRobot v3.0 格式,按任务组织为独立子文件夹。当前包含 task5setting_mousetraps),后续将添加更多任务作为同级文件夹。

数据构成与规模

来源类型 片段数 帧数 时长(小时,@30fps)
官方人类演示 200 2,039,222 18.882
生成导航数据 1,170 562,590 5.209
生成成功演示 37 327,684 3.034
生成放置/恢复数据 4,388 607,744 5.627
总计 5,795 3,537,240 32.752
  • 约 58% 的帧来自官方人类演示,42% 为生成数据
  • 片段长度呈强双峰分布:5,102 个片段低于 500 帧(短恢复片段,约 25% 帧),237 个片段超过 3,000 帧(长演示,约 67% 帧)
  • 采样按帧进行,均匀洗牌批次反映帧分布而非片段分布

技术规格

属性
格式 LeRobot v3.0
机器人 R1Pro
任务 setting_mousetraps,本地 task_index=0
观测状态 float32[61]
动作 float32[23]
频率 30 Hz
RGB 相机 3 路 224×224 H.264(yuv420p)流
磁盘大小 7.3 GB,共 23,192 个文件
截断后帧采样数(H=30) 3,363,390

观测状态(61维,BEHAVIOR 2026布局)

切片 含义
0:3 base-frame 观测的 base_qvel = [vx, vy, wz]
3:10, 10:17 左臂 qpos, qvel
17:20, 20:24 左端执行器位置, 四元数
24:26, 26:28 左夹爪 qpos, qvel
28:35, 35:42 右臂 qpos, qvel
42:45, 45:49 右端执行器位置, 四元数
49:51, 51:53 右夹爪 qpos, qvel
53:57, 57:61 躯干 qpos, qvel

动作(23维 R1Pro VLA 动作)

text base[0:3], trunk[3:7], left_arm[7:14], left_gripper[14], right_arm[15:22], right_gripper[22]

相机

  • observation.rgb.zed_link_camera_0(头部)
  • observation.rgb.left_realsense_link_camera_0
  • observation.rgb.right_realsense_link_camera_0

训练注意事项

1. 任务索引重映射

meta/tasks.parquetsetting_mousetraps 映射为本地索引 0,但 BEHAVIOR-1K 全局索引为 5。若直接使用存储的 task_index,会导致阶段数为 5 而非正确的 12。应通过活动名称进行重映射。

2. base_qvel 为 base-frame 坐标系

经验验证:std = (0.0694, 0.0292, 0.0762)std_x/std_y = 2.37,77.7% 帧中 |vx| > |vy|。world-frame 数据应接近 1.0 且无前进偏差。评估器如有帧切换选项(如 B1K_BASE_QVEL_FRAME),应保持未设置/base,强制 world 会向 base-frame 策略输入旋转信号。

3. 使用 qvel 校正的归一化统计

若归一化统计中 state[0:3] 的 std 比自身 action[0:3] std 小约 10 倍,说明基于损坏的 qvel 通道计算。正确的缩放尺度为 std ≈ (0.109, 0.061, 0.133)

4. 已知偏差:base 通道存在强烈静止先验

  • 81.6% 帧 |state_vx| < 0.005,其中仅约 2.0% 命令 |action_vx| > 0.05
  • corr(state[0:3], action[0:3]) = 0.88 / 0.79 / 0.68
  • 策略可能通过回声当前速度而非学习启动时机来获得低 base 速度损失,评估时表现为机器人原地转动但不前进
  • 生成的恢复片段可减少此泄漏;人类专属子集更严重(corr ≈ 0.997,静止帧仅 0.05% 命令运动)

验证状态

发布前已全面验证:

  • 全部 5,795 个 Parquet 文件和 3,537,240 行状态/动作数据已扫描
  • 所有状态 61 维、动作 23 维、数值有限
  • 片段/帧/全局索引、时间戳、任务映射及元数据总数一致
  • 全部 17,385 个视频已解码并与片段帧数核对
  • 各来源族精确通过源到输出检查
  • 所有来源族样本均通过 LeRobot 0.5.2 加载,包含全部三个 RGB 张量

关联模型

基于 BEHAVIOR-1K checkpoint_1 在 task5 上微调的检查点发布在 fastwalker1118/b1kcheckpointstask5ckptmerged1500039999)。30,000 步、batch 128 约等于 1.14 个 epoch。

兼容性警告

本数据集为 2026 格式。若使用传统 2025 流水线训练,需显式格式适配器,否则无法处理 256 维状态、world/canonical-frame base qvel 或 observation.images.rgb.* 相机键。

搜集汇总
数据集介绍
B1k_Recovery 数据集图片
构建方式
B1k_Recovery数据集针对BEHAVIOR-1K基准中的失败恢复任务而构建,采用LeRobot v3.0格式,按任务分目录组织。以task5的setting_mousetraps任务为例,其构建融合了官方人工演示与生成式数据,其中人工演示占帧数的58%,生成的导航、放置/恢复及成功轨迹占42%。生成数据源若保留遗留的256维本体感觉,构建器会提取特定块并将其全向虚拟关节速度旋转至机器人基座坐标系,确保速度信号的一致性。所有数据通过标准流程验证,包括状态/动作维度、视频帧数及元数据一致性检查,确保数据集质量。
特点
该数据集具备鲜明的多模态与多源特性,包含5,795个片段,总计3,537,240帧,时长约32.75小时,配备三个RGB视频流。其特点是帧数分布的强烈双峰性,短片段(<500帧)占多数,而长演示(>3000帧)贡献大部分帧,使得按帧采样能反映帧分布而非片段分布。此外,数据集详细记录了61维观测状态与23维R1Pro VLA动作,并特别标注基座速度采用基座坐标系,且具有明显的静止先验偏差,防止策略陷入“原地转向”的虚假优化。
使用方法
使用时需注意关键步骤:首先,必须通过任务名称而非存储的整数索引映射task_index,因为本地索引与BEHAVIOR-1K全局索引不一致。其次,基座速度信号已基于基座坐标系,不得再次旋转。训练时建议采用qvel修正的归一化统计量,以避免速度通道尺度失衡。评估时应关闭基座速度的坐标系切换选项,并注意数据集的静止先验可能导致策略学习到“回声”行为,需通过开放循环测试验证策略质量。最终,可直接使用LeRobot加载器指向最内层数据集文件夹,并适配2026格式要求。
背景与挑战
背景概述
随着具身智能与机器人学习领域的迅猛发展,大规模行为数据集成为训练通用操作策略的关键基石。BEHAVIOR-1K作为涵盖千种日常活动的基准,为机器人长程任务提供了丰富的仿真环境,但其数据多源于专家演示,对错误恢复与状态干扰的覆盖不足,制约了策略在真实世界中的鲁棒性。为此,研究者于2026年构建了B1k_Recovery数据集,专为BEHAVIOR-1K中的任务(如布置捕鼠夹)注入了故障恢复与演示数据,由相关研究团队在LeRobot v3.0格式下精心整合。该数据集融合了官方人类演示与生成的导航、放置/恢复及成功轨迹,共计包含5795个片段、超过353万帧,时长约32.75小时,旨在弥合策略在失败后自适应调整能力的缺口。其发布不仅丰富了BEHAVIOR-1K生态,更为机器人失败恢复研究提供了标准化训练资源,有望推动具身智能体在复杂动态环境中的部署。
当前挑战
B1k_Recovery所面临的挑战多维且深刻。在领域问题层面,它瞄准了机器人长程操作中的核心难题——失败恢复,即策略需从错误状态中自主纠偏,而传统数据集往往忽略此类稀疏事件,导致模型泛化能力不足。构建过程中,团队遭遇了一系列技术壁垒:首先,异构数据源(官方演示与生成数据)在状态表征上存在维度冲突,需通过坐标变换统一至61维观测空间,并需精确保留基座速度的基座坐标系,避免旋转误差。其次,动作与状态统计量的偏差可能误导归一化,如速度基座通道存在强静态先验,需通过qvel校正统计并使用任务特定索引(如task_index映射)来保证训练与评估的一致性。此外,数据规模巨大,需确保5700余个Parquet文件及1.7万个视频的完整性,并验证帧级索引与元数据的严格对齐,这对管道鲁棒性提出了严苛要求。
常用场景
经典使用场景
B1k_Recovery数据集聚焦于BEHAVIOR-1K基准中的失败恢复与示范学习场景,其核心使用范式在于为具身智能体提供混合了人类示范与自动生成导航、放置/恢复及成功执行片段的训练语料。研究者通常借助LeRobot v3.0格式的标准化接口加载该数据集,以30Hz频率、三视角RGB流及61维观测状态与23维动作空间为输入,训练视觉-语言-动作(VLA)策略,旨在提升机器人在复杂长时程任务(如设置捕鼠器)中的鲁棒操作能力,尤其强调从失败状态中自主恢复并达成任务目标的决策机制。
衍生相关工作
该数据集催生了系列后续研究,包括基于BEHAVIOR-1K预训练检查点的迁移学习工作(如fastwalker1118/b1kcheckpoints),以及针对失败恢复的元学习、逆强化学习与离线强化学习算法。研究者亦以其为基准,探索了数据混合比例对策略性能的影响,并开发了任务索引重映射与坐标框架校正等标准化工具链,相关成果推动了LeRobot v3.0格式的社区普及。此外,该数据集与OmniGibson仿真平台深度耦合,衍生出关于仿真-现实差距分析、自动生成示范质量评估以及多任务联合训练的研究,为具身智能领域的可扩展学习范式和评估体系提供了重要参照。
数据集最近研究
最新研究方向
面向具身智能体的失败恢复学习正成为机器人学习领域的核心前沿方向,B1k_Recovery数据集在此背景下应运而生。该数据集基于BEHAVIOR-1K仿真环境,创新性地融合了人类演示与自动生成的导航、放置/恢复及成功轨迹数据,构建了首个覆盖失败-恢复全流程的大规模视觉-语言-动作训练资源。其双峰分布的长短片段设计,精准模拟了真实操作中频繁的短暂纠错与长程任务执行并存的场景,为研究策略在扰动下的鲁棒性提供了关键基准。数据集的发布顺应了从单一成功演示学习向容错、可恢复策略学习的范式转变,对推动机器人从实验室走向复杂真实世界应用具有重要里程碑意义,也为后续探索多任务通用恢复策略奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务