遇见数据集

DepthVLM-Bench

收藏
Hugging Face2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

DepthVLM-Bench是一个专为视觉语言模型设计的统一室内外度量深度估计基准。它提供了多样化的室内和室外场景,并以统一的、与视觉语言模型兼容的格式提供了度量深度标注。其核心目标是使大规模多模态模型能够联合学习密集的几何(深度)预测与多模态理解能力。数据集的主要特点包括:支持统一的室内和室外环境度量深度估计;数据格式专门适配视觉语言模型;为多模态基础模型提供密集的深度监督信号;整体设计旨在支持可扩展的多模态训练。该数据集与题为《Unlocking Dense Metric Depth Estimation in VLMs》的研究论文相关联。

DepthVLM-Bench is a unified indoor-outdoor metric depth estimation benchmark designed for vision-language models. It provides diverse indoor and outdoor scenes with metric depth annotations in a unified format compatible with vision-language models. The core goal is to enable large-scale multimodal models to jointly learn dense geometric (depth) prediction and multimodal understanding capabilities. Key features of the dataset include: support for unified indoor and outdoor metric depth estimation; data format specifically adapted for vision-language models; provision of dense depth supervision signals for multimodal foundation models; and overall design aimed at supporting scalable multimodal training. This dataset is associated with the research paper titled Unlocking Dense Metric Depth Estimation in VLMs.

创建时间:
2026-05-14
原始信息汇总

数据集概述

DepthVLM-Bench 是一个为视觉语言模型(VLM)设计的统一室内外度量深度估计基准数据集。

核心特征

  • 统一室内外场景:包含多样化的室内和室外场景,并提供度量深度标注。
  • VLM兼容格式:数据采用统一的、与视觉语言模型兼容的格式。
  • 密集深度监督:提供密集的深度信息,用于多模态基础模型的训练。
  • 可扩展的多模态训练:专为大规模多模态联合学习而设计。

相关论文

  • 论文标题:Unlocking Dense Metric Depth Estimation in VLMs
  • 论文地址:https://arxiv.org/abs/2605.15876

使用方式

官方代码仓库(https://github.com/hanxunyu/DepthVLM)提供了数据处理、评估脚本和可视化示例等资源。

引用信息

bibtex @article{yu2026unlocking, title={Unlocking Dense Metric Depth Estimation in VLMs}, author={Hanxun Yu and Xuan Qu and Yuxin Wang and Jianke Zhu and Lei Ke}, journal={arXiv preprint arXiv:2605.15876}, year={2026} }

许可信息

  • 开源许可:Apache-2.0
搜集汇总
数据集介绍
DepthVLM-Bench 数据集图片
构建方式
DepthVLM-Bench是一个专为视觉语言模型(VLM)设计的统一室内外公制深度估计基准数据集。该数据集整合了来自多种室内与室外场景的深度标注信息,所有数据均经过统一格式转换,以适配VLM的输入需求。构建过程中,研究者从现有深度估计数据集中筛选并标准化了公制深度标签,确保每一张图像均附带稠密、精确的深度监督信号,从而支持多模态大模型在几何感知与理解能力上的联合学习。
特点
DepthVLM-Bench的核心特点在于其统一的室内外场景覆盖与VLM兼容的数据结构。与传统的深度估计基准不同,该数据集专门针对视觉语言模型设计,格式上充分考虑多模态任务的输入输出规范,使得大规模多模态模型能够在训练过程中同时学习稠密几何预测与语义理解。此外,数据集的稠密深度标注为模型提供了高精度的空间信息监督,有效弥补了现有VLM在三维几何感知方面的不足。
使用方法
使用DepthVLM-Bench时,研究者需从其官方仓库获取数据预处理与评估脚本。数据集提供了标准的训练与测试划分,可直接用于VLM的微调或作为下游任务的评估基准。用户应按照仓库中的说明进行数据加载与格式转换,并利用附带的评估工具计算深度预测的定量指标。该数据集的设计初衷是作为统一基准,支持跨场景、跨模态的深度估计性能对比与模型迭代优化。
背景与挑战
背景概述
DepthVLM-Bench是一个面向视觉语言模型(VLM)的室内外统一度量深度估计基准,由Hanxun Yu、Xuan Qu、Yuxin Wang、Jianke Zhu和Lei Ke等研究人员于2026年创建。该数据集的核心研究问题在于弥合深度估计与多模态理解之间的鸿沟,旨在为大型多模态模型提供统一的度量深度标注,使模型能够同时学习密集几何预测与多模态语义理解。通过整合室内外多样化场景并采用VLM兼容的数据格式,DepthVLM-Bench为多模态基础模型的深度感知能力评估提供了标准化平台,对推动三维视觉与多模态学习的交叉领域发展具有重要影响力。
当前挑战
DepthVLM-Bench所解决的核心领域挑战是视觉语言模型在度量深度估计任务上的缺失,即现有VLM多聚焦于语义理解而缺乏对密集几何信息的精确感知能力,导致其在需要精细空间推理的场景(如机器人导航、增强现实)中表现不足。构建过程中的挑战主要体现在两方面:一是将来自不同室内外数据集(如NYUv2、KITTI)的深度标注统一转化为VLM兼容格式,需处理度量尺度不一致和标注密度的差异;二是在确保深度标注物理精度的同时,保持与多模态输入(图像、文本)的对齐,以实现稠密深度监督与语义理解的联合学习。
常用场景
经典使用场景
DepthVLM-Bench作为首个面向视觉语言模型的统一室内外度量深度估计基准,其经典使用场景在于评估和微调多模态大模型在稠密几何感知任务上的性能。研究者可借助该基准中涵盖丰富室内外场景的度量深度标注数据,对模型进行联合训练,使其同时掌握深度估计与多模态语义理解能力。该基准的统一数据格式打破了视觉模型与语言模型之间的模态壁垒,为探索视觉感知与语言推理的深度融合提供了关键支撑,成为相关领域模型性能比对与能力提升的标准平台。
衍生相关工作
DepthVLM-Bench的发布激发了多个方向的相关经典工作。在其核心论文《Unlocking Dense Metric Depth Estimation in VLMs》基础上,研究者进一步探索了将度量深度提示融入视觉语言模型预训练阶段的方法,衍生出融合深度适配器的多模态骨干网络设计。同时,该基准催生了面向特定场景的深度-语言联合推理任务,如基于深度信息的视觉问答与场景描述生成。此外,围绕该基准的数据增强策略与跨模态对齐机制,涌现了一系列提升稠密预测与语义理解协同效率的创新工作,为未来的统一视觉基础模型奠定了方法论基础。
数据集最近研究
最新研究方向
DepthVLM-Bench作为首个统一室内外度量深度估计的视觉语言模型评测基准,标志着多模态感知与空间几何理解的深度融合正成为前沿热点。该数据集通过提供VLM兼容的密集深度标注,突破了传统深度估计任务与多模态语义理解之间的壁垒,为构建具备稠密几何推理能力的基础模型开辟了新路径。其在三维视觉与多模态交互的交叉领域具有里程碑意义,不仅推动着自动驾驶、具身智能等场景中对场景结构的精准认知,还促进了以度量深度为导向的跨模态对齐研究,有力地支撑了下一代多模态基础模型从二维语义感知向三维结构化理解的跃迁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务