SpatialBench
收藏资源简介:
SpatialBench是一个用于评估空间基础模型的确定性、密度感知基准,涵盖19个源数据集、540多个场景、40多个模型变体和六种重建范式(包括深度、相机姿态、轨迹、点云重建、长序列流和先验增强任务)。每个场景都标准化为RGB/度量深度/相机到世界姿态/内参,测试帧已预先计算并固定,确保所有用户评估相同的帧。
SpatialBench is a deterministic, density-aware benchmark for evaluating spatial foundation models. It covers 19 source datasets, over 540 scenes, more than 40 model variants, and six reconstruction paradigms including depth estimation, camera pose, trajectory, point cloud reconstruction, long-sequence flow, and prior-augmented tasks. Each scene is standardized to include RGB data, metric depth maps, camera-to-world poses and camera intrinsic parameters, while test frames are precomputed and fixed to ensure that all users evaluate on the identical set of frames.
数据集概述:SpatialBench
SpatialBench 是一个确定性、密度感知的基准测试,旨在全面评估空间基础模型在多范式、多领域下的性能。
核心特性
- 覆盖范围:整合了 19 个 源数据集,包含 540 多个 场景,支持 40 多个 模型变体。
- 重构范式:涵盖六种重构范式:深度、相机位姿、轨迹、点云重建、长序列流以及先验增强任务。
- 标准化:每个场景被归一化为 RGB / 度量深度 / 相机到世界位姿 / 内参格式。
- 确定性评估:每个场景的测试帧是预先计算并固定的,确保所有用户在完全相同的帧上进行评估。
- 统一接口:提供统一的 YAML 配置 + 模型适配器接口,用户只需实现一个
predict()方法即可纳入新模型。 - 排行榜:结果记录在
leaderboard.md中。
数据集构成与下载
基准测试的数据集以压缩包形式发布在 Hugging Face 上,按采样密度分为四个存档,以及一个可选的 ground-truth 点云存档。
| 存档 | 文件 | 大小 | 建议 |
|---|---|---|---|
| 单帧 | single.tar |
1.0 GiB | |
| 稀疏 | sparse.tar |
5.1 GiB | ✅ |
| 中等 | medium.tar |
19.4 GiB | ✅ |
| 密集 | dense.tar |
73.9 GiB | |
| 点云真值 | pointcloud.tar |
1.8 GiB | ✅(评估点云时) |
覆盖的源数据集
SpatialBench 统一了 19 个源数据集,涵盖室内/室外、真实/模拟、静态/动态及多种具身视角。
| 数据集 | 环境 | 类型 | 备注 |
|---|---|---|---|
| DROID | 室内 | 真实/动态 | 机器人操作(腕部视角) |
| DTU | 室内 | 真实/静态 | 多视角立体视觉 |
| ETH3D | 室内/室外 | 真实/静态 | 高精度 MVS |
| 7-Scenes | 室内 | 真实/静态 | 室内定位 |
| RLBench | 室内 | 合成 | 机器人仿真任务 |
| Ropedia | 室内 | 真实/动态 | 机器人第一人称视角 |
| NRGBD | 室内 | 真实/静态 | 神经 RGB-D |
| RoboTwin | 室内 | 合成 | 双臂机器人仿真 |
| Tanks & Temples | 室外 | 真实/静态 | 室外大场景 |
| TUM | 室内 | 真实/动态 | RGB-D SLAM |
| ADT | 室内 | 真实/动态 | Aria Digital Twin |
| OmniWorld | 室外 | 模拟/动态 | 游戏引擎虚拟室外场景 |
| Lingbot | 室内/室外 | 真实/动态 | 机器人单帧场景 |
| VKITTI | 室外 | 模拟/动态 | 虚拟驾驶仿真 |
| Waymo | 室外 | 真实/动态 | 自动驾驶数据(LiDAR 深度) |
| RoboLab | 室内 | 模拟/动态 | Isaac Sim 合成数据(腕部视角) |
| HiRoom | 室内 | 模拟/静态 | 合成室内场景 |
| ScanNet++ | 室内 | 真实/静态 | iPhone 子集 |
支持的模型与评估
SpatialBench 为 40 多种 空间基础模型变体提供了适配器,分为六大类别:
- 基于优化的模型:DUSt3R, MASt3R
- 端到端前馈模型:VGGT, Fast3R, DA3(多种规格), WorldMirror 等
- 在线模型:Spann3R, Stream3R, StreamVGGT, LingbotMap 等
- 分块模型:VGGT-Long, DA3-Streaming 等
- 基于SLAM的模型:MASt3R-SLAM, VGGT-SLAM
- 测试时训练模型:TTT3R, Scal3R, LoGeR, ZipMap, VGG-TTT
评估指标
| 类别 | 指标 |
|---|---|
| 深度 | abs_rel, sq_rel, rmse, log_rmse, delta_1.03/1.05/1.10 |
| 相机位姿(成对) | racc_3/5, tacc_3/5, auc_3/5/15/30 |
| 轨迹 | ATE, RPE (Sim(3) 对齐后) |
| 点云 | chamfer_distance, f_score (τ=0.05) |
预测位姿会通过 Procrustes 分析与真值对齐,深度指标也会根据模型是否输出度量深度,报告有无尺度对齐的结果。
待办事项
- ✅ 在 arXiv 发布技术报告
- ✅ 在 Hugging Face 发布基准数据集
- ✅ 发布 DA-Next 训练脚本
- [ ] 发布 DA-Next 检查点
- [ ] 发布 DA-Next-5M 数据集
- [ ] 更新更多模型适配器





