R3D-Bench
收藏数据链接:
官方服务:
资源简介:
R3D-Bench是一个用于量化3D空间推理的基准评估数据集,基于自然自我中心RGB-D视频,包含3,033个问答注释,并提供了每对象的每视频SAM3分割掩码和3D重建网格,用于评估。
R3D-Bench is a benchmark evaluation dataset for quantifying 3D spatial reasoning. It is based on natural egocentric RGB-D videos, contains 3,033 question-answer annotations, and provides per-video and per-object SAM3 segmentation masks as well as 3D reconstructed meshes for evaluation.
创建时间:
2026-07-03
原始信息汇总
数据集概述
R3D 是一个面向第一人称可穿戴设备的定量3D空间推理数据集和基准测试平台。
核心组成
- R3D-Bench:一个基于自然第一人称RGB-D视频的定量3D空间推理基准评估数据集,包含 3,033条 问答注释。
- R3D:一个具备工具调用功能的3D空间推理系统。
数据来源
R3D-Bench构建于 57个 Aria Digital Twin (ADT) 序列之上。
数据存储与访问
- 主要托管平台:Hugging Face Hub,仓库地址为
facebook/r3d-bench。 - 数据格式:Parquet格式。
- 数据集配置(Configs):
qa_annotations:3,033条问答注释。segmentations:用于评估的、每个对象在每段视频中的SAM3分割掩码。meshes:来自SAM3D的、每个对象的3D重建网格,用于评估。
任务与评估指标
数据集包含15种问题类型,按类别分为:
- 多项选择:评估平均准确率(Acc)。
- 类型:
gap_fit,nearest_from_set,top_higher,which_taller,which_longer_dim。
- 类型:
- 距离估计:评估平均相对准确率(MRA)。
- 类型:
global_how_far,global_how_far_from_me,global_how_long,how_much_taller,how_much_longer_dim,total_fly_distance,total_walk_distance。
- 类型:
- 体积估计:评估平均相对准确率(MRA)。
- 类型:
volume_estimation,pour_leftover,pour_room_left。
- 类型:
总体分数(OVERALL) 是所有15种问题类型得分的平均值。所有指标值均为百分比,越高越好。
基准性能
以下为在完整R3D-Bench数据集上,使用标准视觉语言模型(RGB-only)和R3D系统的性能表现。
标准视觉语言模型(RGB-only, 8B参数)
| 类别 | 指标 | RGB 8B |
|---|---|---|
| 多项选择平均 | Acc | 67.3 |
| 距离平均 | MRA | 35.1 |
| 体积平均 | MRA | 6.0 |
| 总体(15种) | — | 40.0 |
R3D系统
| 类别 | 指标 | R3D 8B | R3D 35B |
|---|---|---|---|
| 多项选择平均 | Acc | 85.4 | 92.2 |
| 距离平均 | MRA | 56.7 | 71.2 |
| 体积平均 | MRA | 38.4 | 38.1 |
| 总体(15种) | — | 62.6 | 71.6 |
许可协议
本项目采用 Creative Commons Attribution-NonCommercial 4.0 International (CC BY-NC 4.0) 许可。
搜集汇总
数据集介绍

构建方式
R3D-Bench数据集基于57段来自Aria Digital Twin(ADT)的自我中心RGB-D视频序列构建而成,共计包含3033条问答标注。数据集的生成流程首先从ADT序列中以3FPS频率提取512×512分辨率的RGB帧及对应深度图,随后借助SAM3模型分割出逐对象掩码,并通过SAM3D进行三维网格重建。在此基础上,利用深度提升与重力对齐的有向包围盒拟合技术,将二维掩码映射至三维空间,最终形成包含多类空间推理问题的结构化标注体系。整个构建过程严格遵循静态物体筛选、指向性消歧及最小可见性阈值等质量控制步骤。
特点
该数据集的显著特色在于其聚焦于量化三维空间推理能力的多维度评估框架,涵盖多项选择、距离估算和体积计算三大类共15种问题类型。不同于传统视觉问答数据集仅依赖RGB图像,R3D-Bench要求模型综合运用深度信息、相机位姿及三维场景重建结果,方能准确回答如物体间距、高度差、容纳空间等定量空间关系问题。数据集同时提供SAM3分割掩码、三维网格及重建场景数据库等丰富标注,支持对空间感知能力的细粒度诊断与分析。
使用方法
使用R3D-Bench时,研究人员需先完成ADT序列下载与帧提取,随后通过四步流程执行评估:首先使用build_scene脚本从分割掩码构建包含三维包围盒与点云的场景数据库;接着调用generate_responses接口驱动视觉语言模型进行多轮工具调用,获取空间属性(距离、位置、体积等);再通过generate_scores计算逐问题类型的准确率与平均相对精度;最终由generate_eval_table汇总成格式化的对比表格。数据集支持自定义模型集成,仅需修改评估命令中的模型参数与推理后端即可灵活接入新方法。
背景与挑战
背景概述
R3D-Bench是由Meta(Facebook)研究团队于2026年创建的大规模基准评测数据集,旨在评估自我中心可穿戴设备在真实世界场景中的定量三维空间推理能力。该数据集依托于Aria Digital Twin(ADT)的57个序列,包含3,033个细粒度问答标注,涵盖多重选择、距离估计与体积推算等15种空间关系问题。R3D-Bench的面世填补了现有视觉语言模型在三维连续深度空间中进行定量推理的评估空白,为可穿戴计算和增强现实领域奠定了重要的评测基础,并对后续空间智能系统的研究产生了深远影响。
当前挑战
R3D-Bench所解决的领域核心挑战在于:现有视觉语言模型普遍缺乏在三维连续空间中进行精确数值推理的能力,尤其是在自我中心视角下,难以理解物体间的绝对位置、距离与体积关系。而在构建过程中,该数据集面临的重重困难包括:从多视角RGB-D视频中提取高保真三维点云与网格,保证标注质量与物体可见性的一致性,设计涵盖空间关系多样性的问题类型,以及构建自动化重建与评测管线以支撑大规模系统性评估。这些挑战使得R3D-Bench成为推动三维空间推理发展的重要催化剂。
常用场景
经典使用场景
在可穿戴计算与增强现实领域,R3D-Bench作为首个面向第一人称佩戴设备的量化三维空间推理基准,被广泛用于评估视觉语言模型在真实环境中的空间感知能力。该基准基于Aria Digital Twin多模态数据集构建,包含3033个精心设计的问答对,涵盖间隙适配、最近物体判断、高度比较、绝对距离估计、容积计算等15种细粒度空间推理任务。研究者通过引入以自我为中心的RGB-D视频序列,驱动模型在三维重建场景中调用工具接口完成定量测量,从而系统评测模型对三维空间几何关系的理解与推理水平。
解决学术问题
这一数据集解决了可穿戴计算领域长期缺乏统一、量化、可复现的三维空间推理评估标准的问题。以往研究多依赖二维空间描述或简单相对关系判断,难以体现模型在真实第一人称视角下对距离、容积等连续变量的精细理解。R3D-Bench通过结构化的问题类型划分与基于物理真实性的多模态标注,使学术界能够首次对视觉语言模型在自我中心三维空间中的推理准确性进行系统诊断,推动了空间智能评测从定性向定量的跨越,为后续模型设计提供了客观比较基准。
衍生相关工作
基于R3D-Bench衍生出的代表性工作包括:一是提出的R3D系统,通过集成场景重建、有向包围盒拟合与多视角投票机制,首次实现了在无图像输入条件下仅凭文本与工具调用完成高精度空间推理的范式;二是基于该基准催生了一系列针对第一人称视角的RGB-D融合方法改进工作,如利用深度图提升了绝对距离与容积估计的准确率;此外,该数据集还推动了多模态大模型在三维定位、物体尺度预测等子任务上的专项研究,为后续如空间感知增强训练策略、点到三维的场景语言对齐等方向奠定了数据基础。
以上内容由遇见数据集搜集并总结生成



