遇见数据集

bridge_orig

收藏
Hugging Face2026-07-03 更新2026-07-04 收录
官方服务:

资源简介:

该数据集是一个大规模机器人示教数据集,使用LeRobot框架创建,专门针对机器人学习任务。数据采集自WidowX机器人,遵循RLDS(机器人学习数据集标准)格式。数据集核心内容为机器人执行任务的交互记录,包含丰富的多模态信息。数据规模庞大,总计包含53,191条轨迹(episodes),约199.9万帧数据,覆盖19,973个独立任务。数据以分块Parquet文件形式组织,并附带对应的视频文件。主要特征包括:1) 观测部分:提供四个同步的RGB摄像头图像观测(image_0, image_1, image_2, image_3),每帧图像分辨率为256x256,编码格式为AV1,帧率为5fps。2) 状态部分:记录机器人末端执行器的三维位置(eef_xyz)、欧拉角姿态(eef_rpy)、6D旋转表示(eef_rot6d)以及夹爪开合状态(gripper_state)。同时提供了一个整合的状态向量(observation.state)。3) 动作部分:提供了多种表示形式的动作指令,包括末端执行器位置的差分指令(diff_eef_xyz)、姿态差分指令(diff_eef_rpy)、在世界坐标系下的目标位置(world_eef_xyz)和6D旋转(world_eef_rot6d)、在夹爪坐标系下的目标位置(gripper_eef_xyz)和6D旋转(gripper_eef_rot6d)、夹爪目标状态(gripper_state),以及一个整合的动作向量(action)。4) 索引信息:包含时间戳(timestamp)、帧索引(frame_index)、轨迹索引(episode_index)、数据索引(index)和任务索引(task_index)。该数据集适用于机器人模仿学习、离线强化学习、视觉运动策略学习、多视角视觉表示学习等研究任务。数据集采用Apache-2.0许可证。

This is a large-scale robot demonstration dataset created using the LeRobot framework, specifically designed for robot learning tasks. The data is collected from the WidowX robot and adheres to the RLDS (Robot Learning Dataset Standard) format. The core content of the dataset consists of interaction records of robots performing tasks, containing rich multimodal information. The dataset has a massive scale, with a total of 53,191 episodes, approximately 1.999 million frames of data, covering 19,973 independent tasks. The data is organized into chunked Parquet files, with corresponding video files provided alongside. The main features are as follows: 1) Observation section: Four synchronized RGB camera image observations (image_0, image_1, image_2, image_3) are provided. Each frame has a resolution of 256×256, encoded in AV1 format, with a frame rate of 5 fps. 2) State section: Records the 3D position (eef_xyz), Euler angle pose (eef_rpy), 6D rotation representation (eef_rot6d) of the robot's end-effector, as well as the gripper state (gripper_state). An integrated state vector (observation.state) is also provided. 3) Action section: Provides action instructions in multiple representation forms, including differential end-effector position commands (diff_eef_xyz), differential pose commands (diff_eef_rpy), target position in the world coordinate system (world_eef_xyz) and 6D rotation (world_eef_rot6d), target position in the gripper coordinate system (gripper_eef_xyz) and 6D rotation (gripper_eef_rot6d), gripper state (gripper_state), as well as an integrated action vector (action). 4) Index information: Includes timestamp, frame_index, episode_index, data index (index), and task_index. This dataset is applicable to research tasks such as robot imitation learning, offline reinforcement learning, visuomotor policy learning, and multi-view visual representation learning. The dataset is licensed under the Apache-2.0 license.

创建时间:
2026-06-25
原始信息汇总

数据集概述

  • 数据集名称: bridge_orig
  • 许可证: Apache-2.0
  • 任务类别: 机器人学 (Robotics)
  • 标签: LeRobot, bridge_orig, rlds, openx, widowx

数据集规模

  • 总片段数: 53,191
  • 总帧数: 1,999,362
  • 总任务数: 19,973
  • 数据文件大小: 100 MB
  • 视频文件大小: 200 MB
  • 帧率: 5 FPS

数据集划分

  • 训练集: 片段 0 至 53,190(全部数据)

机器人类型

  • 机器人类型: WidowX

数据特征

该数据集包含以下特征:

  • 观测图像:

    • observation.images.image_0: 视频,尺寸 256x256x3,RGB,编码 AV1,帧率 5 FPS
    • observation.images.image_1: 视频,尺寸 256x256x3,RGB,编码 AV1,帧率 5 FPS
    • observation.images.image_2: 视频,尺寸 256x256x3,RGB,编码 AV1,帧率 5 FPS
    • observation.images.image_3: 视频,尺寸 256x256x3,RGB,编码 AV1,帧率 5 FPS
  • 机器人状态:

    • state.eef_xyz: 末端执行器位置 (x, y, z),float32
    • state.eef_rpy: 末端执行器姿态 (roll, pitch, yaw),float32
    • state.eef_rot6d: 末端执行器旋转 6D 表示,float32
    • state.gripper_state: 夹爪状态,float32
    • observation.state: 完整状态 (x, y, z, rot1-6, gripper),float32
  • 动作空间 (均为 float32):

    • action.diff_eef_xyz: 末端执行器位置差 (x, y, z)
    • action.diff_eef_rpy: 末端执行器姿态差 (roll, pitch, yaw)
    • action.world_eef_xyz: 世界坐标系下的末端执行器位置
    • action.world_eef_rot6d: 世界坐标系下的末端执行器旋转 6D 表示
    • action.gripper_eef_xyz: 夹爪坐标系下的末端执行器位置
    • action.gripper_eef_rot6d: 夹爪坐标系下的末端执行器旋转 6D 表示
    • action.gripper_state: 夹爪动作
    • action: 完整动作向量 (x, y, z, rot1-6, gripper)
  • 其他特征:

    • timestamp: 时间戳,float32
    • frame_index: 帧索引,int64
    • episode_index: 片段索引,int64
    • index: 索引,int64
    • task_index: 任务索引,int64

数据格式

  • 数据文件路径: data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频文件路径: videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

创建信息

  • 该数据集使用 LeRobot 创建。
搜集汇总
数据集介绍
bridge_orig 数据集图片
构建方式
在机器人学习领域,大规模真实世界操作数据的匮乏长期制约着基于模仿学习的策略泛化能力。bridge_orig数据集应运而生,其构建依托于LeRobot框架,采用WidowX机械臂平台进行远程操作数据采集。数据收集过程涵盖多样化的桌面任务场景,操作员通过遥操作方式控制机械臂完成抓取、放置、推拉等动作,同步记录高精度状态信息与视觉观测数据。所有原始数据均经过系统化处理后,按固定帧率(5 FPS)切片为独立的episode,并将时间序列信息与动作指令对齐编码。数据存储采用高效Parquet格式与AV1压缩视频编码,在保持信息完整性的同时优化存储效率。
特点
该数据集在规模与维度上展现出显著优势,总计包含53,191个操作片段、近200万帧图像及19,973种任务类别,为多任务模仿学习提供了充足训练样本。其视觉感知模块尤为丰富,集成四路不同视角的256×256 RGB摄像头,全方位捕捉操作环境的动态变化。状态空间涵盖末端执行器三维位置、姿态的六维旋转表示及夹爪状态等10维连续量,动作空间则同时提供差分与世界坐标系下的运动指令,支持多种运动规划算法。独特的rot6d旋转表示设计避免了欧拉角奇异点问题,提升了学习过程的数值稳定性。
使用方法
借助LeRobot生态系统的标准化接口,研究者可通过几行Python代码直接加载数据集并获取格式统一的观测-动作对。数据按episode_index与frame_index构建时序关联,支持逐帧或整段采样的灵活访问模式。对于策略训练,推荐采用差分动作(diff_eef_xyz与diff_eef_rpy)作为预测目标,配合末端执行器状态特征进行端到端学习。可视化分析工具内置专属Web界面,便于快速浏览指定episode的完整影像序列与状态轨迹。数据集默认按0:53191的切片比例划为单一训练集,适配各类离线模仿学习与行为克隆算法的评估范式。
背景与挑战
背景概述
bridge_orig数据集是由LeRobot社区在Apache-2.0许可下发布的大规模机器人操控数据集,核心研究问题在于通过多样化的示范数据推动机器人学习中的模仿学习与行为克隆技术发展。该数据集基于WidowX机械臂平台收集,涵盖51,191个独立片段、近200万帧图像以及超过19,973种任务变体,为多任务策略泛化提供了丰富的多视角视觉输入(256×256分辨率)与高自由度运动状态记录。其影响力体现在:作为桥接仿真与真实世界的开源基准,它填补了非结构化家庭环境中机器人数据稀缺的空白,促进了具身智能领域从单一任务向泛化操作的范式转变。
当前挑战
该数据集面临的领域挑战包括:多源异构任务间的策略迁移困难,以及小样本条件下操作技能的鲁棒性不足——现有模型难以在未训练的新物体或动态场景中保持性能。构建过程中的核心挑战涉及:大规模遥操作数据的标注成本与动作质量一致性矛盾,机械臂关节漂移导致的时序误差累积,以及不同光照与纹理背景对视觉特征提取的干扰。此外,高低频混合动作(如抓取与旋转)的同步编码问题,使得运动轨迹的平滑化与异常值过滤成为数据预处理的关键瓶颈。
常用场景
经典使用场景
在机器人学习与模仿学习领域,bridge_orig数据集堪称基石之作。该数据集基于WidowX机械臂平台,采集了超过5万条操作轨迹与200万帧高分辨率视觉观察数据,涵盖近2万种多样化任务。其经典使用场景聚焦于视觉-运动策略的端到端训练,研究者利用多视角RGB图像(image_0至image_3)与末端执行器状态信息,构建从感知到动作的映射模型。数据集提供的精细化动作表示(如末端位移、旋转6D表示及夹爪状态)使得策略学习能够捕捉复杂的灵巧操作模式,成为跨具身智能体泛化研究的重要基准。
解决学术问题
该数据集直击机器人学习领域长期面临的“少样本泛化”与“开集任务适应”两大核心瓶颈。通过提供海量、异构、带有精细标注的演示数据,bridge_orig有效支撑了行为克隆与逆强化学习方法在真实物理世界中的训练与评估。其丰富的数据规模与任务多样性,使得研究者得以系统性探讨视觉表征的鲁棒性、动作空间结构对策略性能的影响,以及如何从离线数据中提取可迁移的操作先验知识。该数据集的出现,显著推动了通用操作技能从实验室特定场景向开放环境迁移的学术进程。
衍生相关工作
基于bridge_orig数据集,学界衍生出多项里程碑式工作。其中最具代表性的是RT-1系列模型,其多任务架构通过融合语言指令与视觉条件,实现了对数据集内千余种任务的统一建模;扩散策略(Diffusion Policy)则利用该数据集的轨迹稠密采样特性,在动作序列生成中引入去噪扩散过程,显著提升了操作连贯性。此外,3D视觉-语言导航模型也在该数据集的视觉特征上进行预训练,证明了跨模态表征的泛化潜力。这些衍生工作共同塑造了当前视觉-运动策略发展的主流范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务