遇见数据集

libero_extrinsics

收藏
Hugging Face2026-07-31 更新2026-08-01 收录
官方服务:

资源简介:

LIBERO 每帧相机外参与夹爪事件时间数据集是基于 HuggingFaceVLA/libero 数据集的增强版本。该数据集在原始 LIBERO 机器人操作数据的基础上,为每一帧额外添加了相机外参和夹爪事件时间信息。相机外参包括 agentview 相机和 wrist 相机在世界坐标系中的位置(3维)和单位四元数(4维),采用 OpenCV 惯用坐标系,并匹配数据集中存储的 180° 翻转图像方向。夹爪事件时间包括从当前帧到演示中下一次夹爪命令翻转(关闭或打开)的倒计时时间(秒),其中夹爪关闭命令对应 action[6] 二进制值 +1,打开对应 -1,合并了短于 3 步(0.3 秒)的遥操作抖动。若当帧之后无对应翻转,则时间设为 sentinel 值 10000。该数据集适用于机器人模仿学习、策略评估等任务,可与 LeRobot 的 LiberoEnv 在评估时实时暴露相同键值。

The LIBERO per-frame camera extrinsic and gripper event timing dataset is an enhanced version based on the HuggingFaceVLA/libero dataset. This dataset adds camera extrinsic parameters and gripper event timing information for each frame on top of the original LIBERO robot manipulation data. Camera extrinsic parameters include the position (3D) and unit quaternion (4D) of the agentview camera and wrist camera in the world coordinate system, using the OpenCV convention and matching the 180° flipped image orientation stored in the dataset. Gripper event timing includes the countdown time (in seconds) from the current frame to the next gripper command flip (close or open) in the demonstration, where the close command corresponds to action[6] binary value +1, open corresponds to -1, and teleoperation jitter shorter than 3 steps (0.3 seconds) is merged. If there is no corresponding flip after the current frame, the time is set to a sentinel value of 10000. This dataset is suitable for robot imitation learning, policy evaluation, and other tasks, and can expose the same key-value pairs in real time as LeRobots LiberoEnv during evaluation.

创建时间:
2026-07-29
原始信息汇总

数据集概述

  • 数据集名称:LIBERO with per-frame camera extrinsics and gripper-event timings
  • 许可证:MIT
  • 标签:LeRobot、libero
  • 任务类别:机器人学(robotics)

数据集描述

该数据集基于 lerobot/libero(标准v3视频存储格式),额外增加了四种逐帧特征:

1. 相机外参(Camera extrinsics)

  • 数据类型:float32,格式为 [位置(3), 四元数xyzw(4)],表示相机在世界坐标系中的位姿,采用OpenCV约定,与存储的图像匹配。
  • LeRobot的 LiberoEnv 在评估时暴露相同的键值:
    • observation.extrinsics.image:agentview相机位姿
    • observation.extrinsics.image2:腕部相机位姿

2. 夹爪事件时间(Gripper-event timings)

  • 数据类型:float32,单位为秒,表示直到演示中夹爪指令下一次翻转的后见时间(hindsight time)
  • 当片段的夹爪指令不再发生翻转时,使用哨兵值 1e4
  • 具体键值如下:
    • observation.gripper.time_to_close:下一次翻转为关闭(即下一次抓取)
    • observation.gripper.time_to_open:下一次翻转为打开(即下一次释放)

生成方式

该数据集由以下脚本生成:

  • lerobot_policy_framepick/scripts/augment_libero_extrinsics.py
  • augment_libero_gripper_events.py
  • rebase_libero_extrinsics_on_lerobot_libero.py

其中,最后一个脚本用于验证 lerobot/libero 与之前的图像存储修订版之间的状态/动作字节级一致性。

搜集汇总
数据集介绍
libero_extrinsics 数据集图片
构建方式
该数据集基于LeRobot框架下的LIBERO标准数据集构建,通过精心设计的脚本对原始数据进行增强处理。具体而言,研究者利用augment_libero_extrinsics.py为每一帧图像附加了相机外参信息,涵盖agentview与wrist摄像头在世界坐标系中的位置与四元数姿态,并遵循OpenCV约定以确保与存储图像严格对齐。同时,augment_libero_gripper_events.py计算了每个观测时刻至下一次夹爪指令翻转的剩余时间,分别记录到关闭与打开事件,当无后续翻转时以哨兵值标记。此外,rebase脚本验证了增强后数据与原始版本在状态和动作上的字节级一致性,确保了数据纯净性。
特点
此数据集的核心特色在于其双维度增强信息:一方面,逐帧相机外参为机器人学习提供了精确的视角几何关系,使得策略能够更好地理解环境结构;另一方面,夹爪事件的时间标记提供了操作时序的细粒度监督,有助于模型学习抓取与释放的时机。这些特征以float32格式存储,与原始视频数据无缝融合,且经过严格校验,保证了与原始LIBERO数据的兼容性与可靠性。
使用方法
使用者可直接利用LeRobot库加载该数据集,其结构与标准lerobot/libero一致,但额外包含了observation.extrinsics和observation.gripper字段。在训练或评估策略时,可访问这些新增特征以增强模型的感知与决策能力。值得注意的是,LeRobot的LiberoEnv环境在实时评估时会暴露相同的键,因此训练与部署环境保持一致。建议用户在数据加载阶段验证状态和动作的字节等同性,以确保与预期行为相符。
背景与挑战
背景概述
在机器人学习领域,具身智能体的感知与操控能力依赖于高质量的多模态数据集。LIBERO基准(Learning and Interactive Robot training for Embodied Robotics and Operations)由斯坦福大学等机构于2022年提出,旨在评估机器人操作技能的长时程泛化能力。该数据集的衍生版本libero_extrinsics由LeRobot社区于2023年创建,核心研究问题在于为视觉策略提供精确的相机外参(含位置与四元数姿态)以及夹爪事件时序(如闭合/开启的倒数时间),以增强模型对空间几何与操作时序的建模能力。通过补充这些细粒度标注,该数据集显著提升了后续策略在仿真环境中的可复现性与物理一致性,成为机器人模仿学习研究中连接视觉与动作的重要桥梁。
当前挑战
该数据集面临的挑战源于多维度:首先,原始LIBERO任务要求策略在多变场景中实现长程操作,涉及目标选择、工具使用与空间推理,而相机外参的引入虽提供了几何线索,却增加了状态表征的维度,要求策略能有效融合视觉与位姿信息。其次,构建过程中需精确同步高频视觉流与低频状态数据,确保每帧图像对应的外参数值无偏差,且夹爪事件时间的标注需在演示轨迹中准确捕捉翻转瞬间,任意时序误差将导致策略学习信号失真。此外,验证数据一致性时需逐字节比对原始数据,确保扩展不破坏既有兼容性,这一工程耗时且易出错。这些挑战共同制约着数据集在当前机器人学习范式下的应用潜力。
常用场景
经典使用场景
在机器人学习与操控领域,该数据集为多视角视觉模仿学习提供了关键补充。它基于LIBERO基准,为每个视频帧附加了相机外参(位置与四元数)和夹爪事件时序,使研究者能够直接获取agentview与wrist相机的精确位姿,以及夹爪闭合/开启的预测时刻。这一设计使得数据集成为评估视觉策略在空间感知与时间依赖操控任务中性能的标准平台,尤其适用于研究相机视角变化、视野遮挡或手眼协调等复杂场景下的鲁棒策略学习。
实际应用
在实际应用中,该数据集可直接用于训练和评估工业机械臂的精准抓取与装配操作,特别是在需要动态调整手爪开合以应对不同物体形状或柔性材料时。其相机外参与夹爪时序信息能够支撑视觉伺服系统在实时环境中的位姿估计与抓取时机决策,减少试错成本。此外,数据集的格式与LeRobot环境兼容,便于部署到真实机器人上,实现从仿真到实机的迁移,具有在仓储分拣、电子装配及家庭服务等场景中的应用潜力。
衍生相关工作
此数据集衍生了多项前沿工作,包括基于相机外参的视角不变策略蒸馏方法,利用夹爪事件时序的时序扩散模型,以及将外参集成到神经辐射场(NeRF)中进行隐式场景表示的学习框架。这些工作进一步拓展了数据集在具身智能、多智能体协同和因果表示学习中的适用性,并催生了如动态感知Transformer、时空注意力策略等新的模型架构。同时,数据集作为高质量微调数据,也被用于预训练视觉-语言-动作模型,在跨具身迁移方面展现出潜力,成为机器人基础模型训练中不可或缺的组成部分。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务