遇见数据集

MetricScenes

收藏
github2026-06-03 更新2026-06-06 收录
官方服务:

资源简介:

MetricScenes 将来自 MegaScenes、Aerial-MegaDepth 和 Stereo4D 的场景整合到一个统一的度量尺度训练语料库中。对于每张图像,它提供 RGB、来自 SfM/MVS 或几何先验的部分深度、通过两阶段泊松方法完成的深度以及相机元数据。深度 PNG 采用 16 位对数编码。

MetricScenes integrates scenes from MegaScenes, Aerial-MegaDepth, and Stereo4D into a unified metric-scale training corpus. For each image, it provides RGB data, partial depth derived from SfM/MVS or geometric priors, depth completed via a two-stage Poisson method, and camera metadata. Depth PNGs are encoded with 16-bit logarithmic encoding.

创建时间:
2026-06-01
原始信息汇总

数据集概述:MetricScenes

数据集简介

MetricScenes 是一个聚合了多个公开数据集的度量尺度训练语料库,旨在为计算机视觉任务提供高质量的深度图训练数据。

数据集组成

  • 数据集来源于三个公开场景数据集:
    • MegaScenes
    • Aerial-MegaDepth
    • Stereo4D

数据集内容

对数据集中每张图像提供以下信息:

  • RGB 图像
  • 部分深度图(来自 SfM/MVS 或几何先验)
  • 完整深度图(通过两阶段泊松方法生成)
  • 相机元数据

深度 PNG 采用 16 位对数编码,解码格式详见 depth_completion/README.md 文档。

实现内容

本仓库包含以下两个主要实现:

  1. 两阶段泊松深度补全方法
    将 MVS 深度图(背景)与模型预测深度图(前景)融合,生成完整的深度图。

  2. 图像配准流程
    改编自 MASt3R-SfM,并集成 Doppelgangers++ 分类器,用于将地理参考的街景视图配准到 SfM 模型,从而将几何结构缩放到物理尺寸。

目录结构

目录 描述
depth_completion 边缘感知的两阶段泊松深度补全
mast3r_sfm 改编自 MASt3R-SfM 的图像配准流程(含 Doppelgangers++)

每个子目录均包含独立的 README 文档,说明安装、依赖及使用方法。

模型:WildMoGe

  • 模型类型:MoGe-2 ViT-Large-Normal
  • 训练数据:基于 MetricScenes 数据集进行微调
  • 推理与评估:请参照 MoGe 项目说明

许可证

  • MetricScenes 数据集:采用 CC BY 4.0 许可
  • 原始来源图像:保留其自身许可证
  • 组件代码:可能附带额外的上游许可证(例如 MASt3R、DUSt3R、Doppelgangers++),详见各子目录及上游仓库

资源链接

  • 项目主页:https://metricscenes.github.io/
  • 数据集:https://huggingface.co/datasets/yx642/MetricScenes
  • 模型权重(WildMoGe):https://huggingface.co/yx642/WildMoGe
搜集汇总
数据集介绍
MetricScenes 数据集图片
构建方式
三维视觉领域,精确的度量尺度深度估计对于场景理解至关重要。MetricScenes数据集通过聚合MegaScenes、Aerial-MegaDepth和Stereo4D等多个公开场景库,构建了一个统一的度量尺度训练语料库。针对每张图像,研究人员不仅提供了RGB图像、来自运动恢复结构或多视图立体匹配的局部深度图,还利用提出的两阶段泊松融合方法,将模型预测的前景深度与多视图立体匹配生成的背景深度无缝结合,生成完整深度图。此外,通过引入增强的MASt3R-SfM图像配准流程并结合Doppelgangers++分类器,将地理参考的街景视图精准注册到SfM模型中,从而实现几何结构的物理尺度缩放。深度PNG以16位对数编码存储,确保了深度信息的精度与存储效率。
特点
MetricScenes数据集的独特之处在于其综合性和度量准确性。它整合了来自不同来源的场景,覆盖了广泛的地理位置和视觉外观,为深度学习模型提供了丰富的训练样本。数据集不仅包含RGB图像和标准相机元数据,还提供了局部与完整两种深度图,其中完整深度图通过创新的两阶段泊松方法融合了背景与前景信息,有效解决了传统方法在深度不连续区域的不完整问题。这种设计使得模型能够同时学习场景的局部细节和整体结构,提升了深度估计的鲁棒性。数据集统一以度量尺度呈现,确保了学习到的几何关系能够直接映射到真实世界的物理尺寸,避免了尺度模糊性带来的困扰。
使用方法
研究者通过访问Hugging Face平台即可获取MetricScenes数据集及配套的WildMoGe模型权重。使用前需安装相关依赖环境,并参照仓库中depth_completion子目录的说明理解深度PNG的对数编码格式以正确解码深度值。对于模型训练与评估,可直接基于MoGe框架加载WildMoGe模型进行推理。若需复现数据集的构建过程,可深入探索两阶段泊松深度补全算法和增强的图像配准流程,相关代码与使用说明分别位于depth_completion与mast3r_sfm子目录中。数据集以CC BY 4.0许可发布,但原始图像保留各自版权,使用时需注意合规性。
背景与挑战
背景概述
在三维视觉与几何计算领域,恢复场景的真实物理尺度是连接虚拟重建与真实世界的核心挑战。MetricScenes数据集由Yuanbo Xiangli、Hanyu Chen等研究人员于近期提出,汇聚了MegaScenes、Aerial-MegaDepth与Stereo4D三个子集的资源,构建了一个统一的公制尺度训练语料库。每个图像均配备RGB图像、来自运动恢复结构或多视图立体的部分深度、经两阶段泊松方法修补的完整深度以及相机元数据,旨在解决无尺度几何估计中的多源数据融合问题。该数据集的发布为单目深度估计与场景理解开辟了新路径,尤其推动了可泛化度量深度模型的发展。
当前挑战
MetricScenes所应对的核心挑战在于如何从互联网级非结构化图像集合中提取并统一物理尺度信息。传统SfM方法产出的三维重建缺乏绝对尺度,而融合多源传感器的度量数据又面临几何不一致与噪声干扰。构建过程中,研究者必须克服从街景图像与航拍模型中配准注册的困难,借助增强的MASt3R-SfM流程与Doppelgangers++分类器实现高精度对齐。此外,深度补全程式中,前景与背景深度分布的差异导致空洞与边缘模糊,两阶段泊松方法需在保持结构锐利度的同时实现平滑过渡,这对算法鲁棒性与计算效率提出了严峻考验。
常用场景
经典使用场景
在计算机视觉与三维重建领域,MetricScenes数据集为从互联网海量图像中恢复场景的度量尺度几何结构提供了关键支撑。该数据集整合了MegaScenes、Aerial-MegaDepth与Stereo4D三大经典资源,通过为每张图像提供RGB、来自SfM/MVS的部分深度图、经由两阶段泊松补全方法生成的完整深度图以及相机元数据,构建起一套统一且具备真实世界物理尺度的训练语料库。其经典使用场景聚焦于单目深度估计与度量尺度重建模型的训练与评估,研究者可借助该数据集的稠密度量深度标注,引导模型突破相对深度预测的局限,习得对场景真实尺度的感知能力。
解决学术问题
MetricScenes数据集直面长期困扰三维视觉领域的核心难题——从无约束互联网图像中恢复具有物理意义的度量尺度几何信息。传统MVS方法虽能生成精细深度,却难以覆盖前景区域;而学习型深度估计虽能补全细节,却常陷于尺度模糊的困境。该数据集通过创新的两阶段泊松融合策略,将MVS背景深度与模型预测的前景深度无缝结合,生成了兼顾完整性与准确性的度量深度真值。这一突破性数据资源使研究者能够从数据驱动角度系统性地攻克尺度不确定性顽疾,推动了基于大规模学习的度量三维重建理论从实验室可控场景向真实世界非结构化环境的跃迁,为场景理解、空间智能等学术分支奠定了坚实的度量基准。
衍生相关工作
以MetricScenes数据集为基石,学术界已衍生出一系列富有影响力的经典工作。其中最具代表性的是WildMoGe模型,它基于MoGe-2架构并在MetricScenes上进行了精细微调,通过大规模度量深度数据的监督学习,显著提升了在复杂野外环境下的单目度量深度估计性能,其权重与推理代码已完整开源。此外,该数据集配套的两阶段泊松深度补全方法与集成Doppelgangers++分类器的MASt3R-SfM图像配准流程,分别作为独立的技术贡献被后续研究所借鉴与拓展,推动了度量深度补全与地理参考图像配准两个子方向的快速发展。MetricScenes还激励了更多研究者重新审视数据在整个三维视觉生态中的核心杠杆作用,催生了一批围绕度量尺度数据构建的新型算法与基准测试。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务