E3D-Bench
收藏资源简介:
E3D-Bench数据集是一个用于评估端到端3D几何基础模型(GFMs)的基准数据集。该数据集涵盖了五个核心任务:稀疏视图深度估计、基于视频的深度估计、3D重建、多视图姿态估计、新视图合成,并跨越了标准数据和挑战性的数据集。该数据集旨在评估GFMs在真实世界场景中的有效性、鲁棒性和效率,以指导未来模型的扩展和优化。
The E3D-Bench dataset is a benchmark dataset for evaluating end-to-end 3D geometric foundation models (GFMs). It covers five core tasks: sparse-view depth estimation, video-based depth estimation, 3D reconstruction, multi-view pose estimation, and novel view synthesis, and spans both standard and challenging datasets. This dataset aims to evaluate the effectiveness, robustness, and efficiency of GFMs in real-world scenarios to guide the expansion and optimization of future models.
E3D-Bench: 端到端3D几何基础模型基准
数据集概述
- 目标:评估3D几何基础模型(GFMs)在多样3D任务和场景中的有效性、鲁棒性和效率
- 核心任务:
- 稀疏视图深度估计
- 视频深度估计
- 3D重建
- 多视角姿态估计
- 新颖视图合成
- 覆盖范围:标准数据集和分布外挑战数据集
关键评估维度
有效性 (Effectiveness)
多视角3D重建
- 评估指标:ACC ↓ | Comp ↓ | NC ↑
- 数据集:DTU, 7-Scenes, NRGBD, ScanNet, TUM-RGBD
- 表现最佳模型:VGGT (DTU: ACC=1.085, NC=94.305)
多视角相对姿态估计
- 评估指标:ATE ↓ | RPEtrans ↓ | RPErot ↓
- 数据集:CO3Dv2, ScanNet & ADT & TUM-Dyn., KITTI Odometry
- 表现最佳模型:Geo4D (Bonn: AbsRel=0.060, δ<1.25=97.8)
稀疏视图深度估计
- 评估指标:AbsRel ↓ | δ<1.03 ↑
- 数据集:DTU, ScanNet, KITTI, ETH3D, T&T
- 表现最佳模型:VGGT (DTU: AbsRel=1.085)
推理效率 (Inference Efficiency)
- 评估指标:时间(ms) ↓ | GPU显存(GB) ↓
- 测试规模:2-256视图
- 效率最佳模型:Fast3R (2视图: 0.13ms, 4.05GB)
主要发现与结论
-
任务难度影响:
- 多视角几何推理比双视角更困难
- 直接预测密集3D场景表示比估计单个属性更具挑战性
- 度量尺度深度估计仍是关键挑战
-
领域泛化能力:
- GFMs在数据稀缺领域泛化能力不足
-
架构设计启示:
- 无单一最优架构(ViT或扩散模型)
- 强大的2D特征提取器可显著提升3D性能
-
实时性现状:
- 当前GFMs尚不能满足实时3D应用的效率需求
引用格式
bibtex @article{cong2025e3dbench, title={E3D-Bench: An End-to-End Benchmark for 3D Geometric Foundation Models}, author={Cong, Wenyan and Liang, Yiqing and Zhang, Yancheng and Yang, Ziyi and Wang, Yan and Ivanovic, Boris and Pavone, Marco and Chen, Chen and Wang, Zhangyang and Fan, Zhiwen}, journal={arXiv preprint arXiv:2506.01933}, year={2025} }

- 1E3D-Bench: A Benchmark for End-to-End 3D Geometric Foundation Models德克萨斯大学奥斯汀分校, 布朗大学, 中佛罗里达大学, 英伟达研究院, 斯坦福大学 · 2025年



