遇见数据集

scene-extrapolation-benchmark

收藏
Hugging Face2026-06-29 更新2026-06-30 收录
官方服务:

资源简介:

Scene-Extrapolation Benchmark Suite 是一个用于评估生成式新视角合成模型的综合性基准测试套件,特别关注传统逐场景3D高斯泼溅重建方法失效的挑战性场景。该套件围绕四个核心评估轴线构建:1) 外推性:评估模型在未观测视角下的生成能力,而非密集采集视角间的插值。2) 动态性:处理包含运动前景内容的场景。3) 长时程:测试模型在链式或闭环相机轨迹下,累积漂移的影响。4) 记忆/重访:评估当相机返回先前观测过的位姿时,模型是能准确回忆场景还是重新产生幻觉。套件包含12个基准测试,分布在上述轴线下,具体包括静态场景的DL3DV(50个剪辑)、作为主要动态评估的Kubric-4D(提供完美GT,无深度/尺度/形变混淆)、作为次要动态检查的NVIDIA动态场景、真实动态的SpatialVID(30个剪辑)、用于评估漂移/闭环的长时程LH-DL3DV(42个剪辑)、Stanford WorldScore聚合指标,以及分别在Kubric-4D、DL3DV和SpatialVID上评估的重访一致性(multi_visit)和返回保真度(moving_back)记忆测试。评估使用广泛的定量指标,包括全帧和动态掩码的PSNR/SSIM/LPIPS、FID、TSED、MEt3R、COLMAP位姿误差、长时程漂移指标以及专门的记忆指标。同时,基于SLURM任务记录的推理时间(秒/帧)也被纳入评估。套件以自包含、可离线可视化的形式提供,包含HTML页面、内联SVG图表、JSON数据文件和视频对比面板,用于定性和定量分析。评估涵盖了多种前沿方法,包括基于形变+修复的VACE模型、多种扩散基线、逐场景4D高斯拟合方法以及长时程世界模型,旨在提供一个统一且诚实的性能衡量标准。

The Scene-Extrapolation Benchmark Suite is a comprehensive benchmark suite for evaluating generative novel view synthesis models, with a particular focus on challenging scenarios where traditional per-scene 3D Gaussian splatting reconstruction methods fail. The suite is structured around four core evaluation axes: 1) Extrapolation: Assessing the models ability to generate views from unobserved perspectives, rather than interpolating between densely sampled viewpoints. 2) Dynamism: Handling scenes containing moving foreground content. 3) Long-term: Testing the impact of accumulated drift in chained or looped camera trajectories. 4) Memory/Revisitation: Evaluating whether the model can accurately recall a scene or re-hallucinate when the camera returns to previously observed poses. The suite includes 12 benchmark tests distributed across these axes, specifically: DL3DV for static scenes (50 clips), Kubric-4D as the primary dynamic evaluation (providing perfect ground truth without depth/scale/deformation confusion), NVIDIA dynamic scenes as a secondary dynamic check, real-world dynamic SpatialVID (30 clips), long-term LH-DL3DV for evaluating drift/loops (42 clips), the Stanford WorldScore aggregate metric, and memory tests such as multi-visit and moving-back evaluated on Kubric-4D, DL3DV, and SpatialVID. Evaluation employs a wide range of quantitative metrics, including PSNR/SSIM/LPIPS for full-frame and dynamic masks, FID, TSED, MEt3R, COLMAP pose error, long-term drift metrics, and specialized memory metrics. Additionally, inference time (seconds per frame) recorded via SLURM tasks is included. The suite is provided in a self-contained, offline-visualizable format, including HTML pages, inline SVG charts, JSON data files, and video comparison panels for qualitative and quantitative analysis. The evaluation covers various state-of-the-art methods, including deformation+inpainting-based VACE models, multiple diffusion baselines, per-scene 4D Gaussian fitting methods, and long-term world models, aiming to provide a unified and honest performance measurement standard.

创建时间:
2026-06-29
原始信息汇总

数据集概述

基本信息

  • 数据集名称: Scene-Extrapolation Benchmark Suite
  • 许可证: CC-BY-4.0
  • 标签: novel-view-synthesis, scene-extrapolation, benchmark, dynamic-nvs, long-horizon, video-diffusion

核心目标

该基准测试旨在对生成式新视角合成(NVS)在 3D高斯泼溅(3D-GS)重建失败 的四种场景下进行统一、诚实的评估:

  • 外推性(Extrapolative) — 对未观测到的、保留的视角进行生成(非密集捕获之间的插值)
  • 动态性(Dynamic) — 包含移动的前景内容
  • 长时程(Long-horizon) — 链条式/闭环相机轨迹,会产生累积漂移
  • 记忆/重访(Memory / Revisit) — 当相机返回到之前观测过的位姿时,模型是否记得场景,还是重新生成幻觉

数据集内容

可视化包包含一个自包含的离线页面(viz_pkg/index.html),分为四个部分:

  1. Kubric-4D 难度曲线(标题) — 无混淆因素的动态场景主要评估。内联SVG折线图,展示不同相机角度区间(30°/60°/90°/120°/180°)下的指标变化
  2. 覆盖矩阵(Coverage matrix) — 展示哪些方法在哪些基准上已完成评分、正在运行、不适用或待处理
  3. 定量结果(Quantitative) — 每个基准的指标表格,包括静态、动态、长时程和记忆/重访指标
  4. 定性结果(Qualitative) — 并排视频对比面板

基准测试(12个,分布在4个维度)

维度 基准 说明
静态 DL3DV(50个保留片段) 外推至未观测区域
动态 Kubric-4D 主要基准,无混淆因素,完美GT,按角度分档
动态 NVIDIA Dynamic Scenes 次要真实动态检查,12相机静态支架
动态 SpatialVID(30个片段) 野外动态场景
长时程 LH-DL3DV(42个片段) GVS风格漂移/闭环测试
长时程 WorldScore 斯坦福世界生成聚合
记忆/重访 multi_visit × {Kubric-4D · DL3DV · SpatialVID} 重访一致性 — 评估重访固定观测位姿时的GT保真度和跨访问自一致性漂移
记忆/重访 moving_back × {Kubric-4D · DL3DV · SpatialVID} 返回保真度 — 远离到未观测空间后返回,评估返回vs GT

评估方法

包含多种方法,分为几类:

  • 本文方法(warp+inpaint VACE): vace14b 及其微调版本
  • 扩散基线: gen3c, voyager, flexworld, viewcrafter, framecrafter, nvs_solver, viewextrapolator, trajcrafter
  • 逐场景3D-GS: shape_of_motion
  • 长时程世界模型: lyra2, matrix3d, spmem, vmem, matrixgame3

评估指标

  • 静态: PSNR/SSIM/LPIPS(空洞/外推 + 全帧)、FID、TSED、MEt3R、COLMAP
  • 动态: Kubric-4D(主要,角度分档指标)、NVIDIA动态区域掩码mPSNR/mSSIM/mLPIPS、SpatialVID
  • 长时程: 漂移(ATE/旋转/闭环)、WorldScore聚合
  • 记忆/重访: mv_*(重访一致性)和 mb_*(返回保真度)指标表

当前状态

这是一个实时快照(2026-06-29),部分作业仍在运行中。未评分的单元格会显示为 running / pending / N/A从不生成虚构的数字

搜集汇总
数据集介绍
scene-extrapolation-benchmark 数据集图片
构建方式
该基准测试数据集围绕生成式新视角合成中三维高斯泼溅方法失效的四大挑战性场景进行构建,涵盖外推视角、动态前景、长程轨迹以及重访记忆。研究团队精心挑选了六个具有代表性的子基准,包括用于静态外推的DL3DV、作为无混杂动态锚点的Kubric-4D、真实动态场景NVIDIA与SpatialVID、以及长程漂移与重访一致性测试集。每个子基准均设计了严格的协议,例如Kubric-4D采用完美真值的角度分箱评估,而重访记忆轴则分别计算返回保真度与遗忘信号。所有指标均通过统一的代码流水线从逐片段结果聚合而成,并生成可视化的困难曲线与覆盖矩阵。
特点
数据集的显著特色在于其诚实性与全面性。它首次将外推、动态、长程与重访四个维度的评估统一在同一框架下,并明确区分了基于显式几何缓存的方法与纯学习型记忆模型的性能差异。所有实验结果均以实时快照形式呈现,未完成的运行状态被诚实标记为计算中或待定,绝不捏造数据。特别地,Kubric-4D的困难曲线揭示了所有方法在大视角外推下的性能退化规律,而重访记忆轴则实证了当前最强外推模型普遍缺乏有效的学习型记忆能力,唯有显式几何缓存能够保持场景忠诚度。
使用方法
研究者可通过直接打开项目中的index.html文件离线浏览完整的可视化评估套件,无需服务器支持。页面分为四个核心部分:困难曲线、覆盖矩阵、定量指标表以及定性视频对比面板。定量表格按基准分组,清晰呈现各方法在静态与动态指标上的得分,并附有基于SLURM作业记账系统生成的诚实推理时间。定性面板则通过并列视频直观对比输入视图、基线方法、本方法及真值之间的生成质量。对于复现实验,用户可运行代码仓库中的构建脚本,从逐片段结果重新聚合指标并生成更新的可视化报告。
背景与挑战
背景概述
Scene-Extrapolation Benchmark Suite 是由研究团队于近期创建的一个综合性基准测试数据集,旨在系统评估生成式新视角合成(Novel View Synthesis, NVS)技术在三维高斯泼溅(3D Gaussian Splatting, 3D-GS)方法失效的复杂场景下的表现。该数据集聚焦于四个核心研究问题:外推性视图生成(从从未观测到的视角合成图像)、动态前景内容处理、长序列相机轨迹下的漂移累积,以及相机重访已观测视角时的记忆一致性。通过整合静态、动态、长程及记忆四个维度的评估协议,该基准填补了现有NVS评测在极端视角和动态场景中的空白,为视频扩散模型和世界模型等前沿方法提供了统一的、诚实的评价平台,对推动生成式三维视觉领域的发展具有重要影响力。
当前挑战
该数据集所解决的领域挑战主要在于:传统3D-GS方法在处理外推性视图、动态场景、长程轨迹漂移及记忆重访时表现脆弱,而现有扩散模型在这些极端条件下常出现质量退化、幻觉或遗忘现象。构建过程中面临的挑战包括:设计无混淆的基准协议(如Kubric-4D提供完美真实数据以消除深度/尺度/扭曲混淆)、在多个动态和静态数据集上统一评测流程、确保不同方法之间的公平比较(如消除推理时间测量中的并行任务干扰)、以及引入记忆轴评测时需区分真实几何缓存与学习记忆的效果。此外,数据集还需处理不同方法之间的协议差异(如长宽比限制、场景类型差异),并确保评测透明度,避免虚构未完成的结果。
常用场景
经典使用场景
在神经渲染与三维视觉领域,场景外推基准(scene-extrapolation-benchmark)为评估生成式新视角合成(novel-view synthesis, NVS)方法在极具挑战性的极端条件下的表现提供了统一且严苛的测试平台。其经典使用场景聚焦于三维高斯泼溅(3D-Gaussian-Splatting, 3DGS)等传统方法力所不及的领域:外推性未观测视角生成、动态前景内容合成、长程链条式相机轨迹下的漂移抑制,以及相机回访先前位置时的场景一致性记忆。通过涵盖12个精心设计的基准测试(跨越静态、动态、长程和记忆四大维度),该数据集能够全面度量一个NVS模型在真实世界退化条件下的鲁棒性与可靠性。
解决学术问题
该数据集系统性地揭示并量化了当前主流生成式NVS方法在传统静态插值场景之外的脆弱性,有效解决了学术界长期存在的评估标准不统一与基准缺失问题。它精准地刻画了如Kubric-4D动态场景中,随着视角角度从30°扩展至180°,几乎所有方法在PSNR、LPIPS等指标上呈现的显著性能衰退,从而厘清了生成模型在外推、动态与记忆维度上的真实能力边界。这一工作不仅为后续研究者提供了一个无歧义、可复现的“诚实”比较框架,更深刻阐明了显式几何缓存对于实现稳定场景记忆的关键作用,推动了该领域从单纯生成质量向全维度鲁棒性研究的范式转型。
衍生相关工作
依托该基准评测框架,研究社区衍生出了一系列具有深远影响力的工作,特别是在显式几何先验与扩散模型融合的方向上。其中,基于深度图扭曲与视频修复的VACE系列方法(如vace14b)在该基准上展现了优异的外推性能,其经过长程微调的变体(vace14b_ft_lh)更是针对轨迹漂移与回访记忆做了专门的强化。同时,如Gen3C等引入了显式三维点缓存机制的生成器,被证实是唯一在静态、合成动态与真实动态三类场景的记忆回访任务中表现稳定的方法,这直接挑战了全隐式记忆模型(如spmem)的有效性,并激励了像Lyra-2、Matrix-Game 3.0等长程世界模型向更高效、更鲁棒的架构演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务