遇见数据集

SpatialBench

收藏
github2026-05-28 更新2026-05-29 收录
官方服务:

资源简介:

SpatialBench是一个用于评估空间基础模型的确定性、密度感知基准,涵盖19个源数据集、540多个场景、40多个模型变体和六种重建范式(包括深度、相机姿态、轨迹、点云重建、长序列流和先验增强任务)。每个场景都标准化为RGB/度量深度/相机到世界姿态/内参,测试帧已预先计算并固定,确保所有用户评估相同的帧。

SpatialBench is a deterministic, density-aware benchmark for evaluating spatial foundation models. It covers 19 source datasets, over 540 scenes, more than 40 model variants, and six reconstruction paradigms including depth estimation, camera pose, trajectory, point cloud reconstruction, long-sequence flow, and prior-augmented tasks. Each scene is standardized to include RGB data, metric depth maps, camera-to-world poses and camera intrinsic parameters, while test frames are precomputed and fixed to ensure that all users evaluate on the identical set of frames.

创建时间:
2026-05-12
原始信息汇总

数据集概述:SpatialBench

SpatialBench 是一个确定性、密度感知的基准测试,旨在全面评估空间基础模型在多范式、多领域下的性能。

核心特性

  • 覆盖范围:整合了 19 个 源数据集,包含 540 多个 场景,支持 40 多个 模型变体。
  • 重构范式:涵盖六种重构范式:深度、相机位姿、轨迹、点云重建、长序列流以及先验增强任务。
  • 标准化:每个场景被归一化为 RGB / 度量深度 / 相机到世界位姿 / 内参格式。
  • 确定性评估:每个场景的测试帧是预先计算并固定的,确保所有用户在完全相同的帧上进行评估。
  • 统一接口:提供统一的 YAML 配置 + 模型适配器接口,用户只需实现一个 predict() 方法即可纳入新模型。
  • 排行榜:结果记录在 leaderboard.md 中。

数据集构成与下载

基准测试的数据集以压缩包形式发布在 Hugging Face 上,按采样密度分为四个存档,以及一个可选的 ground-truth 点云存档。

存档 文件 大小 建议
单帧 single.tar 1.0 GiB
稀疏 sparse.tar 5.1 GiB
中等 medium.tar 19.4 GiB
密集 dense.tar 73.9 GiB
点云真值 pointcloud.tar 1.8 GiB ✅(评估点云时)

覆盖的源数据集

SpatialBench 统一了 19 个源数据集,涵盖室内/室外、真实/模拟、静态/动态及多种具身视角。

数据集 环境 类型 备注
DROID 室内 真实/动态 机器人操作(腕部视角)
DTU 室内 真实/静态 多视角立体视觉
ETH3D 室内/室外 真实/静态 高精度 MVS
7-Scenes 室内 真实/静态 室内定位
RLBench 室内 合成 机器人仿真任务
Ropedia 室内 真实/动态 机器人第一人称视角
NRGBD 室内 真实/静态 神经 RGB-D
RoboTwin 室内 合成 双臂机器人仿真
Tanks & Temples 室外 真实/静态 室外大场景
TUM 室内 真实/动态 RGB-D SLAM
ADT 室内 真实/动态 Aria Digital Twin
OmniWorld 室外 模拟/动态 游戏引擎虚拟室外场景
Lingbot 室内/室外 真实/动态 机器人单帧场景
VKITTI 室外 模拟/动态 虚拟驾驶仿真
Waymo 室外 真实/动态 自动驾驶数据(LiDAR 深度)
RoboLab 室内 模拟/动态 Isaac Sim 合成数据(腕部视角)
HiRoom 室内 模拟/静态 合成室内场景
ScanNet++ 室内 真实/静态 iPhone 子集

支持的模型与评估

SpatialBench 为 40 多种 空间基础模型变体提供了适配器,分为六大类别:

  • 基于优化的模型:DUSt3R, MASt3R
  • 端到端前馈模型:VGGT, Fast3R, DA3(多种规格), WorldMirror 等
  • 在线模型:Spann3R, Stream3R, StreamVGGT, LingbotMap 等
  • 分块模型:VGGT-Long, DA3-Streaming 等
  • 基于SLAM的模型:MASt3R-SLAM, VGGT-SLAM
  • 测试时训练模型:TTT3R, Scal3R, LoGeR, ZipMap, VGG-TTT

评估指标

类别 指标
深度 abs_rel, sq_rel, rmse, log_rmse, delta_1.03/1.05/1.10
相机位姿(成对) racc_3/5, tacc_3/5, auc_3/5/15/30
轨迹 ATE, RPE (Sim(3) 对齐后)
点云 chamfer_distance, f_score (τ=0.05)

预测位姿会通过 Procrustes 分析与真值对齐,深度指标也会根据模型是否输出度量深度,报告有无尺度对齐的结果。

待办事项

  • ✅ 在 arXiv 发布技术报告
  • ✅ 在 Hugging Face 发布基准数据集
  • ✅ 发布 DA-Next 训练脚本
  • [ ] 发布 DA-Next 检查点
  • [ ] 发布 DA-Next-5M 数据集
  • [ ] 更新更多模型适配器
搜集汇总
数据集介绍
SpatialBench 数据集图片
构建方式
SpatialBench是一个面向空间基础模型的全方位评估基准。其构建过程严谨而系统化:首先,从19个涵盖室内外、真实与仿真、静态与动态场景的源数据集中精心筛选出540余个场景;其次,将每个场景的RGB图像、度量深度、相机位姿及内参统一规范化;最后,为每一场景预先计算并固定测试帧,确保所有用户在完全相同的帧上进行评估,从而消除了评估中的随机性。数据集按照视图密度划分为single、sparse、medium、dense四个采样层级,并可选配点云真值,以支持多样化的评估需求。
特点
SpatialBench的突出特点在于其确定性与密度感知能力。它集成了40余种模型变体,横跨六种重建范式:优化法、端到端前馈法、在线法、分块法、SLAM法和测试时训练法,覆盖深度估计、相机位姿、轨迹、点云重建、长序列流式处理及先验增强任务。统一的YAML配置与模型适配器接口使得新模型仅需实现一个predict()方法即可接入。此外,丰富的场景标签体系支持用户按数据集、视图密度、环境类型、动态属性等维度进行灵活筛选与针对性评估。
使用方法
使用SpatialBench极为便捷。用户首先通过Hugging Face下载所需的采样层级归档文件,并解压至本地目录。随后,通过pip安装基准测试框架及所选模型的依赖项。运行评估时,仅需执行一条命令,例如针对VGGT基线模型,使用'python benchmark/evaluation/run_benchmark.py --config benchmark/configs/end2end/vggt_eval.yaml'即可启动全量评估。用户还可以通过命令行参数覆盖配置,如限制场景数量、启用可视化或应用标签过滤器,从而进行快速实验。评测结果涵盖深度、位姿、轨迹及点云等多个维度的详尽指标。
背景与挑战
背景概述
空间基础模型(Spatial Foundation Models)作为三维视觉领域的前沿范式,旨在从单目或多视图图像中联合推断深度、相机位姿与三维点云,为机器人导航、自动驾驶及增强现实等应用提供核心空间感知能力。然而,现有评测体系多局限于特定任务或单一数据集,难以全面反映模型在不同场景、密度与动态条件下的泛化性能。为此,由Peng等研究人员于2026年提出的SpatialBench基准,整合了19个涵盖室内外、真实与仿真、静态与动态场景的源数据集,构建了包含540余个场景、40余种模型变体的统一评测平台。该基准通过标准化RGB、深度、相机位姿与内参格式,并固定每场景的测试帧,确保了评测的确定性与可复现性,推动了空间感知领域从碎片化评估向系统性比较的关键转变。
当前挑战
SpatialBench所面临的挑战首先源于空间基础模型评测的领域复杂性:现有方法在多样性场景(如动态物体、多视角密度差异、仿真与真实域迁移)中的泛化能力仍不充分,且深度、位姿与点云等多任务联合评估缺乏统一的度量校准标准,导致模型间性能难以公平比较。在基准构建过程中,亦遭遇多重技术难题:整合19个异构源数据集时需处理不同传感器标定参数、坐标系统与数据格式的兼容性问题;预计算并固定每场景测试帧要求精确的帧对齐与场景划分,以避免采样偏差;此外,点云真值的高精度获取(如激光雷达扫描与密集重建融合)及大规模数据存储与分发(总规模超100 GiB)也构成了显著的工程挑战。
常用场景
经典使用场景
在三维视觉与空间智能领域,SpatialBench作为首个确定性、密度感知的综合性基准,被广泛用于评估空间基础模型在多范式、多领域的泛化能力。其经典使用场景涵盖深度估计、相机姿态回归、轨迹预测、点云重建、长序列流式处理以及先验增强任务。通过整合19个源数据集、540余个场景与40多种模型变体,SpatialBench为六大重建范式提供了统一的评估框架,使得研究者能够在同一组固定的测试帧上公平、可复现地对比不同模型的表现。这一设计不仅消除了数据预处理差异带来的干扰,还支持通过YAML配置与模型适配器接口快速集成新模型,从而显著降低了基准测试的门槛,推动了空间基础模型的规范化评价。
解决学术问题
SpatialBench有效解决了空间基础模型评估中长期存在的碎片化与不可复现问题。此前,不同研究团队往往采用各自的测试集与评价协议,导致结果难以横向比较,且缺乏对模型在密度、动态性、环境类型等维度上各向异性的细粒度分析。SpatialBench通过引入密度感知的分层采样(稀疏/中等/密集/单帧)与多标签场景索引(环境、动态性、视角类型、数据类型),使得研究者能够精确剖析模型在特定条件下的瓶颈所在。此外,该基准统一了深度、姿态、轨迹与点云的评价指标,并采用Procrustes对齐确保度量标准的一致性。这对厘清各类空间基础模型的真实能力边界、推动从单体任务向全栈空间理解范式的演进具有重要意义。
衍生相关工作
SpatialBench衍生了一系列重要的后续工作,主要体现在模型架构创新与训练策略优化两个层面。在模型侧,DA-Next作为官方扩展工作,在Depth Anything 3基础上引入尺度回归头、相机编码器与基于射线的位姿解码,实现了对度量深度的端到端支持,并发布了DA-Next-5M大规模训练集。此外,VGGT-SLAM与MASt3R-SLAM等SLAM派生的适配器,将前馈式空间理解与经典时序优化框架结合,催生了高精度实时里程计方案。在评估方法论上,该基准促成了多项关于密度感知、跨域泛化与在线适应性的专项研究,例如针对稀疏输入场景的LongStream模型与针对测试时微调的Scal3R、LoGeR等方法。这些工作共同推动了空间基础模型从静态单帧预测向动态持续理解的全方位跃升。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务