遇见数据集

r3d-bench

收藏
Hugging Face2026-07-03 更新2026-07-04 收录
官方服务:

资源简介:

R3D-Bench是一个用于定量3D空间推理的基准测试数据集,基于自然第一人称RGB-D视频(来自Aria Digital Twin序列)。数据集包含3,033个问答标注,覆盖57个ADT序列,所有数据仅用于评估,无训练集,全部属于test分割。数据被组织为四个配置:默认配置qa_annotations提供每行一个问题,包括问题文本、真实答案、问题类型、序列ID、空间/时间描述以及嵌套的引用对象列表;segmentations提供每帧的SAM3掩码(RLE格式),用于跟踪场景中的相关对象,支持评估;meshes提供每个对象的SAM3D重建网格,包含GLB几何嵌入(glb字节),可用于R3D方法评估;gt_bboxes为可选的ADT真实定向边界框轨迹,主要用于调试目的。数据集适用于3D空间推理、视觉问答(VQA)、场景理解、对象跟踪和3D重建等任务。注意:RGB-D视频帧未在此分发,需从Project Aria ADT数据集单独下载;使用受ADT许可条款约束(基于CC-BY-NC-4.0许可证派生)。

R3D-Bench is a benchmark for quantitative 3D spatial reasoning based on natural first-person RGB-D videos (from Aria Digital Twin sequences). The dataset contains 3,033 question-answer annotations covering 57 ADT sequences, all data is for evaluation only with no training set, entirely in the test split. Data is organized into four configurations: the default qa_annotations provides per-row questions including question text, ground truth answer, question type, sequence ID, spatial/temporal description, and a nested list of referenced objects; segmentations provides SAM3 masks (RLE format) per frame for tracking relevant objects in scenes to support evaluation; meshes provides SAM3D reconstructed meshes per object with GLB geometry embeddings (glb bytes) for R3D method evaluation; gt_bboxes offers optional ADT ground truth oriented bounding box trajectories mainly for debugging. The dataset is suitable for tasks like 3D spatial reasoning, visual question answering (VQA), scene understanding, object tracking, and 3D reconstruction. Note: RGB-D video frames are not distributed here and must be downloaded separately from the Project Aria ADT dataset; usage is subject to ADT license terms (derived from CC-BY-NC-4.0 license).

提供机构:
AI at Meta
创建时间:
2026-07-03
原始信息汇总

数据集概述

R3D-Bench 是一个用于量化三维空间推理的基准数据集,专注于从自然的第一人称视角 RGB-D 视频中进行评估。该数据集不包含训练集,所有数据仅用于测试。

  • 来源:基于 Aria Digital Twin (ADT) 数据集。
  • 许可协议:CC-BY-NC-4.0,使用需遵守 ADT 的许可条款。
  • 规模:包含 57 个 ADT 视频序列,共计 3,033 个问答标注。

数据集配置

数据集提供四种配置文件,均仅包含 test 分割:

  1. qa_annotations (默认配置):

    • 内容:每行对应一个问题。字段包括 question_text (问题文本)、gt_answer (标准答案)、question_type (问题类型)、sequence_id (序列ID)、空间/时间描述以及嵌套的 referenced_objects 列表。
    • 用途:作为基准评估的核心数据。
  2. segmentations

    • 内容:按帧存储的 SAM3 掩码 (RLE 格式),用于追踪场景中的相关物体。
    • 用途:大多数评估方法的辅助数据,为可选配置。
  3. meshes

    • 内容:每个物体的 SAM3D 重建网格,以 GLB 格式嵌入 (glb 字节)。
    • 用途:用于评估 R3D 方法论,也可用于其他方法,为可选配置。
  4. gt_bboxes

    • 内容:来自 ADT 的 GT 有向边界框轨迹,是标准答案的原始依据。
    • 用途:主要用于调试,评估时不使用,为可选配置。

数据来源与使用

  • 源视频:RGB-D 帧数据未包含在数据集中。需从项目 Aria 网站 (https://www.projectaria.com/datasets/adt/) 单独获取 ADT 序列,并按照 R3D 代码仓库 (https://github.com/facebookresearch/r3d) 中的说明提取帧。
  • 使用方式:可通过 Hugging Face datasets 库加载。示例:load_dataset("facebook/r3d-bench", "qa_annotations", split="test")
搜集汇总
数据集介绍
r3d-bench 数据集图片
构建方式
R3D-Bench是一个专为量化评估三维空间推理能力而设计的基准数据集,其构建基于57个Aria Digital Twin (ADT) 序列,包含了3,033条问题-答案标注。数据集的构建强调精细化的空间与时间信息,每条标注包含问题文本、标准答案、问题类型、序列ID以及嵌套的引用对象列表。视频数据需从Project Aria平台单独获取,基准仅提供测试集,无训练集划分,确保评估的客观性与统一性。
使用方法
使用该数据集时,用户可通过HuggingFace的datasets库直接加载默认的qa_annotations配置,并指定测试集。首先需从Project Aria下载ADT序列视频并提取帧,再结合代码仓库中的指引完成环境配置。数据集支持灵活的评估方式,可选用提供的分割掩码或网格数据,但需注意边界框仅为调试辅助工具,不纳入最终评测流程。
背景与挑战
背景概述
三维空间推理是计算机视觉与机器人领域的一项核心挑战,旨在从感知数据中理解物体的位置、几何与语义关系。R3D-Bench数据集由Meta(Facebook)研究院于2024年创建,依托于Aria Digital Twin(ADT)项目,旨在评估从自然第一人称RGB-D视频中进行定量三维空间推理的能力。该数据集包含57个ADT序列上的3,033个问答标注,覆盖了物体的空间定位、相对关系与时空变化等多维度推理任务。作为评估专用基准,其设计强调真实场景的复杂性与时空连续性,推动了具身智能与增强现实中空间理解研究的发展,对评估多模态大语言模型与三维感知系统的融合具有重要影响力。
当前挑战
R3D-Bench所解决的领域挑战在于,传统视觉问答任务多聚焦于二维语义,缺乏对三维空间结构、尺度与遮挡关系的量化推理能力。该数据集要求模型从第一人称视频中理解物体在连续时空中的精确位置与交互关系,涉及深度感知、视角变化与动态场景的整合。构建过程中,挑战源自对ADT真实视频中物体运动轨迹的精确标注,包括从多传感器数据中提取地面实况边界框与网格,并设计涵盖位置、方向、距离及透视关系的问题模板。此外,数据集的纯评估性质要求避免训练数据泄露,确保基准的公正性与可重复性,这对标注一致性、噪声控制与跨序列泛化提出了高要求。
常用场景
经典使用场景
R3D-Bench数据集专为评估自然情境下自我中心RGB-D视频中的定量三维空间推理能力而设计。该数据集包含来自57段Aria Digital Twin序列的3,033条问答标注,覆盖物体位置、空间关系、时序变化等多样化的空间推理问题。研究者可通过对比模型预测与人工标注的答案,系统性地衡量模型在三维空间理解上的表现。
解决学术问题
该数据集解决了当前视觉与语言研究中缺乏真实场景三维空间推理评估基准的困境。传统二维视觉问答基准无法捕捉深度、视角和立体空间关系,而R3D-Bench通过自我中心RGB-D视频和细粒度三维标注,为模型的空间理解能力提供了定量评测工具。它的出现推动了从平面视觉到立体认知的学术范式转变,为研究视觉推理的真实三维感知能力奠定了基础。
实际应用
在实际应用中,R3D-Bench可用于评估和优化增强现实、机器人导航、智能助手等系统的三维场景理解能力。例如,AR设备需要精准理解用户视角下的物体空间布局,机器人需要基于实时视频推断路径中的障碍物位置,这些场景均可借助R3D-Bench的评测框架来衡量算法的鲁棒性和准确性。
数据集最近研究
最新研究方向
R3D-Bench作为首个专注于自然场景下自中心RGB-D视频中三维空间定量推理能力的基准,正在推动具身智能与空间理解的交叉前沿。该基准通过57个Aria数字双生序列构建了3033个问答标注,聚焦于空间关系、物体位置与几何属性的深度推理,回应了当前大模型在物理世界理解中的核心瓶颈。其评估指标强调定量精确性而非定性判别,为构建可泛化于真实环境的空间智能系统提供了严谨的测试平台。随着Project Aria等便携式感知设备的普及,该数据集正引领从静态图像理解到动态视频空间推理的范式转换,对机器人导航、增强现实交互及自主智能体开发具有重要奠基意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务