遇见数据集

vga_nota_dataset

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

LIBERO-3D 是一个为机器人操作任务设计的数据集,旨在为 openvla/modified_libero_rlds 数据集提供每个训练 episode 的度量深度图和相机位姿(内参 K 和外参 E)。深度和相机位姿直接从 LIBERO MuJoCo 模拟器渲染,并与 RLDS 的 episode 逐帧对齐。该数据集是自包含的:RGB 图像直接复制自源数据集,与深度、相机位姿、本体感知、动作和语言指令整合在一个 HDF5 文件中。数据集包含四个套件:spatial(432 个 episode,52970 帧)、object(454 个 episode,66984 帧)、goal(428 个 episode,52042 帧)和 long(libero_10,379 个 episode,101469 帧),总计 1693 个 episode,273465 帧。每个 episode 包含以下字段:图像(JPEG 编码的 RGB,256×256,两个视角:agentview 和 wrist)、深度图(float16,224×224,以米为单位的 z 深度)、外参(float32,每帧的相机到世界 4×4 矩阵)、内参(float32,每套件固定的 2×3×3 矩阵)、状态(float32,末端执行器位置、方向、夹爪宽度)和动作(float32,位置增量、旋转增量、夹爪控制)。此外,还提供了语言指令缓存(40 条指令的嵌入向量和文本)。该数据集适用于视觉-语言-动作(VLA)模型训练、机器人操作任务中的深度感知与相机位姿估计等场景。

LIBERO-3D is a dataset designed for robot manipulation tasks, aiming to provide metric depth maps and camera poses (intrinsic K and extrinsic E) for each training episode of the openvla/modified_libero_rlds dataset. Depth and camera poses are directly rendered from the LIBERO MuJoCo simulator and aligned frame-by-frame with RLDS episodes. The dataset is self-contained: RGB images are directly copied from the source dataset, integrated with depth, camera poses, proprioception, actions, and language instructions in a single HDF5 file. The dataset contains four suites: spatial (432 episodes, 52970 frames), object (454 episodes, 66984 frames), goal (428 episodes, 52042 frames), and long (libero_10, 379 episodes, 101469 frames), totaling 1693 episodes and 273465 frames. Each episode includes the following fields: images (JPEG-encoded RGB, 256x256, two views: agentview and wrist), depth maps (float16, 224x224, z-depth in meters), extrinsics (float32, camera-to-world 4x4 matrix per frame), intrinsics (float32, fixed 2x3x3 matrix per suite), state (float32, end-effector position, orientation, gripper width), and actions (float32, position delta, rotation delta, gripper control). Additionally, a language instruction cache (embedding vectors and text of 40 instructions) is provided. This dataset is suitable for visual-language-action (VLA) model training, depth perception in robot manipulation tasks, and camera pose estimation.

创建时间:
2026-08-05
原始信息汇总

LIBERO-3D (no-op aligned) 数据集总结

数据集概述

LIBERO-3D 是一个面向机器人学习(VLA)任务的数据集,为 openvla/modified_libero_rlds 数据集的每个训练片段提供了度量深度图和相机位姿(内参矩阵 K 和外参矩阵 E),并与 RLDS 片段逐帧对齐。该数据集是自包含的,RGB 图像直接复制自源数据集,深度和相机参数则通过 LIBERO MuJoCo 模拟器渲染生成。

  • 许可证: MIT
  • 任务类别: robotics
  • 标签: libero, depth, camera-pose, vla, openvla, 3d

数据内容与文件结构

数据集包含以下主要文件:

文件 大小 说明
libero_3d_no_noops_aligned.hdf5 ~19 GB 核心数据集(RGB + 深度 + K + E + 状态 + 动作)
lang_cache/libero_instructions.npy 0.24 MB 40 条指令的嵌入向量,形状 (40, 1536) float32
lang_cache/libero_instructions.instructions.json 2 KB 40 条指令字符串,与 .npy 行序对应
verify_alignment.ipynb 1.9 MB 对齐验证的可运行脚本

数据字段说明

数据按 4 个套件(spatial | object | goal | long)组织,每个片段以 RLDS 默认读取顺序编号,episode_<i>modified_libero_rlds 中的片段一一对应。相机索引规则:[0] = 正面静态相机(agentview),[1] = 腕部相机(eye-in-hand)

路径 形状 数据类型 说明
<suite>/intrinsics (2, 3, 3) float32 相机内参矩阵 K,每套件所有片段相同。agentview: fx=fy=270.39, cx=cy=111;wrist: fx=fy=145.96
<suite>/episode_<i>/image (L, 2) vlen uint8 JPEG 编码的 RGB 图像(256×256),[agentview, wrist],直接复制自源数据集
<suite>/episode_<i>/depth (L, 2, 224, 224) float16 以米为单位的深度图(z-depth),沿相机光轴方向到每个像素的距离
<suite>/episode_<i>/extrinsics (L, 2, 4, 4) float32 逐帧相机到世界的 4×4 位姿矩阵(OpenCV 约定,+Z 指向场景内)。agentview 固定,wrist 随机械臂移动
<suite>/episode_<i>/state (L, 8) float32 机器人本体感知:末端位置 (3) + 姿态 (3) + 夹爪 (2)
<suite>/episode_<i>/action (L, 7) float32 控制指令:Δ位置 (3) + Δ旋转 (3) + 夹爪 (1),与 RLDS 动作完全一致,用于对齐

逐片段属性

每个片段的 attrs 记录来源信息:

属性 类型 说明
language_instruction str 任务文本,如 "pick up the orange juice and place it in the basket"
source_demo str 源演示,格式为 <task>/demo_<k>
mode str contig(连续帧窗口)或 subseq(非连续帧)
orig_demo_len int 原始演示帧数(去除非操作帧之前)
length int 当前片段帧数(等于 RLDS 片段长度)
offset_k int contig 模式:被丢弃的前导帧数,源帧为 orig[k : k+L]
source_indices int32 (L,) subseq 模式:使用的原始演示帧索引

统计信息

套件 片段数 帧数
spatial 432 52,970
object 454 66,984
goal 428 52,042
long (libero_10) 379 101,469
总计 1,693 273,465

使用约定

  • 反投影公式world = E @ (z · K⁻¹ · [u, v, 1])
  • 方向对齐:深度/K/E 存储在 RLDS-RGB 坐标系中,depth[y, x]modified_libero_rldsimage[y, x] 完全匹配,无需翻转或旋转(已验证重投影误差为 0)
  • 分辨率:深度/K/E 为 224×224,RGB 图像为 256×256,若需结合使用需先将 RGB 缩放到 224

构建方法

  • 深度获取:在 LIBERO 模拟器中逐帧重放每个演示,通过 set_state 设置状态后调用 get_real_depth_map 获取度量深度,K/E 直接从模拟器读取,为精确地面真值而非估计值。
  • 对齐策略:由于 modified_libero_rlds 是去除非操作帧的重放且不含模拟器状态,其关节状态存在漂移(约 0.08 rad)无法匹配。记录的 action 为位精确数据,因此通过动作序列将每个 RLDS 片段匹配到对应演示——1609 个片段为 contig 模式,84 个为 subseq 模式,全部 1693 个片段均成功映射。
  • 验证结果:1691/1693 个片段的动作位精确(其余 2 个存在约 1e-3 的浮点噪声但不影响深度索引);subseq 对齐无分叉(深度无歧义);被丢弃的帧均为非操作帧(|action| ≈ 0)。

语言缓存

预计算了指令嵌入,避免训练时加载 1.5B 参数的文本编码器。libero_instructions.npy 形状为 (40, 1536) float32,每行对应一条指令;libero_instructions.instructions.json 以相同行序列出 40 条指令字符串。编码器采用 gte-Qwen2-1.5B-instruct,使用最后有效 token 池化。

来源说明

数据使用 LIBERO 及 robosuite/MuJoCo 渲染生成,并与 openvla/modified_libero_rlds 对齐。

搜集汇总
数据集介绍
vga_nota_dataset 数据集图片
构建方式
该数据集基于LIBERO模拟器与MuJoCo物理引擎,针对openvla/modified_libero_rlds数据集中的每个训练片段,逐帧重放演示并提取度量深度、相机内参及外参,通过动作序列精确对齐至RLDS片段,确保帧级一一对应。原始RGB帧未经重新渲染,而是直接从源数据集逐字节复制,实现多模态信息(RGB、深度、相机位姿、本体感知、动作及语言指令)的紧凑封装。
使用方法
使用时应直接读取HDF5文件中的episode条目,无需额外关联RLDS数据集。可通过提供的Python代码示例进行图像解码与深度数据获取;若要结合深度与RGB,需将RGB分辨率从256×256调整至224×224。此外,还附有验证脚本以确认对齐精度,确保数据使用的可靠性。
背景与挑战
背景概述
vga_nota_dataset(即LIBERO-3D)是在2023年由开放视觉语言行动模型(OpenVLA)团队构建的高保真机器人操作数据集,旨在为具身智能研究提供包含精确深度与相机位姿的多模态基准。该数据集基于LIBERO模拟器,通过MuJoCo引擎对1,693个专家演示任务进行逐帧重渲染,整合RGB、深度、相机内外参、本体感觉与语言指令,服务于视觉-语言-行动(VLA)模型的训练与评估。其核心贡献在于解决了原有RLDS数据集中缺乏几何信息的问题,为三维场景理解与空间推理提供了坚实基础,对机器人学习领域的发展起到了关键推动作用。
当前挑战
该数据集所应对的领域挑战在于,传统VLA模型训练依赖RGB图像,缺乏对三维空间结构的感知,难以处理复杂操作任务中的遮挡与物体堆叠问题;而构建过程中的挑战则体现在同步对齐上,由于原始RLDS数据经过no-op裁剪且不包含模拟器状态,关节状态漂移使得无法直接匹配,团队创新性地采用动作序列作为对齐锚点,通过位精确比对实现逐帧对应,并在1,693个片段中成功验证了对齐的可靠性,同时还需解决并行深度渲染的计算开销与多模态数据存储的格式兼容性问题。
常用场景
经典使用场景
该数据集为机器人学习领域提供了高精度的三维感知基准,其核心应用场景在于训练和评估视觉-语言-动作(VLA)模型。通过将LIBERO仿真环境中的RGB图像、度量深度、相机内外参、本体感觉与语言指令进行逐帧对齐,研究者得以构建多模态融合的决策系统。其自包含的数据结构免去了重新渲染或外部对齐的繁琐步骤,使得模型能够直接在统一的框架下学习从视觉-语言输入到动作输出的映射,尤其适用于研究三维空间理解、深度感知在操控任务中的作用,以及多视角(固定视角与腕部视角)信息融合等经典课题。
解决学术问题
该数据集解决了仿真到现实迁移中常见的模态对齐问题,以及缺乏精确度量深度信息导致的三维推理瓶颈。以往数据集往往仅提供RGB图像或估计深度,难以支撑对空间关系精确建模的研究。该数据集通过MuJoCo仿真器实时渲染度量深度和相机位姿,并借助位姿精确的动作序列实现了与RLDS轨迹的逐帧对齐,保证了数据的可靠性和一致性。这使得研究者能够深入探索深度信息对长时程任务泛化能力的影响,检验三维几何特征在策略学习中的有效性,并推动多模态感知与控制的交叉研究。
实际应用
在实际应用中,该数据集可直接用于训练具备三维感知能力的机器人操作模型,例如在家庭服务、工业分拣或物流场景中,机器人需要依据语言指令完成抓取、摆放等精细操作。其精确的深度和相机参数支持了从仿真到真实机器人的策略迁移,可显著提升视觉伺服和避障等环节的鲁棒性。此外,预计算的语言嵌入缓存优化了训练流程,使得大规模训练更为高效,适用于快速迭代的智能化机器人系统开发。
数据集最近研究
最新研究方向
该数据集聚焦于机器人操作领域中的视觉-语言-动作(VLA)模型研究,通过提供与RLDS episode逐帧对齐的精确深度图、相机内外参及语言指令嵌入,为多模态感知与策略学习提供了高保真训练资源。其前沿方向包括基于3D几何信息的场景理解与操作推理、利用深度和相机位姿进行跨视角特征融合、以及通过预计算语言嵌入加速训练流程。该数据集支持细粒度的动作-观测对齐验证,有助于推动具身智能体在复杂长时程任务中的鲁棒控制与泛化能力,对LIBERO基准上的VLA模型评估与改进具有重要价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务