遇见数据集

DL3DV-OVS

收藏
github2026-08-07 更新2026-08-09 收录
官方服务:

资源简介:

DL3DV-OVS是一个包含四个场景的数据集和评估基准,用于大规模、复杂室内外环境中的开放词汇3D场景理解。

DL3DV-OVS is a dataset and evaluation benchmark containing four scenes, tailored for open-vocabulary 3D scene understanding in large-scale, complex indoor and outdoor environments.

创建时间:
2026-08-06
原始信息汇总

数据集概述

DL3DV-OVS 是一个面向开放词汇表三维场景理解(Open-Vocabulary 3D Scene Understanding)的基准数据集,专为大型复杂的室内外场景设计。该数据集基于 DL3DV 原始场景,并结合了 LightSplat 方法引入的标注与模型输入,用于评估在五秒内快速、内存高效地进行开放词汇表三维场景理解任务的性能。

数据集组成

数据集包含四个场景,具体构成如下:

组成部件 Park Shop Road Office 总计 来源
RGB/COLMAP 帧 314 407 317 378 1,416 DL3DV
标注帧 5 3 3 3 14 本数据集
GT 掩码 12 17 18 11 58 本数据集
SAM/CLIP 对 314 407 317 378 1,416 本数据集
文本嵌入 5 8 7 5 22 个唯一 本数据集
RGB 3DGS 检查点 1 1 1 1 4 本数据集

数据内容与结构

  • 原始数据:包含 RGB 图像(960×540)和 COLMAP 数据,来源于 DL3DV,不重新分发。
  • 标注信息:包括 GT 掩码(以 8 位灰度 JPEG 格式存储,前景区域为像素值大于 10)、语言特征(SAM/CLIP 对)、文本嵌入及 RGB 3DGS 检查点。
  • 目录布局
    • images/:RGB 图像(PNG 格式,经 COLMAP 去畸变)
    • sparse/0/:COLMAP 稀疏重建数据
    • language_features/:每帧的 SAM/CLIP 特征文件(如 frame_00001_s.npyframe_00001_f.npy
    • checkpoints/:每个场景的 3DGS 检查点(如 chkpnt30000.pth
    • text/:文本特征 JSON 文件
    • label/:GT 掩码,按场景和帧组织(如 label/park/gt/<frame>/<query>.jpg

快速开始

  • 环境要求:Linux 系统、Python 3.10、COLMAP 3.7,以及 40 GB 可用磁盘空间(不需要 GPU)。
  • 安装步骤
    1. 安装 COLMAP 并克隆仓库
    2. 创建并激活 Conda 环境(使用 environment.yml
    3. 申请访问 Hugging Face 上的三个数据集(DL3DV-ALL-960P、DL3DV-ALL-ColmapCache、DL3DV-OVS)
    4. 运行 dl3dv-ovs setup data/dl3dv-ovs 命令下载、组装并验证完整基准

兼容性

DL3DV-OVS 遵循与 LERF-OVS 相同的场景和标注接口规范,主要区别在于:

  • RGB 图像格式为 PNG(而 LERF-OVS 为 JPEG)
  • COLMAP 数据、GT 掩码格式及掩码像素判断标准均保持一致(前景为像素值 > 10)

因此,现有基于 LERF-OVS 的加载器可以直接适配使用。

引用与许可

  • 引用:使用该数据集时,请引用论文《LightSplat: Fast and Memory-Efficient Open-Vocabulary 3D Scene Understanding in Five Seconds》(CVPR 2026)以及 DL3DV-10K 数据集论文。
  • 许可
    • 准备代码:Apache-2.0
    • DL3DV-OVS 掩码、特征、检查点和基准元数据:CC BY-NC 4.0
    • 原始 DL3DV 数据不重新分发,需遵守 DL3DV-10K 使用条款

资源链接

  • 论文:https://openaccess.thecvf.com/content/CVPR2026/html/Bang_LightSplat_Fast_and_Memory-Efficient_Open-Vocabulary_3D_Scene_Understanding_in_Five_CVPR_2026_paper.html
  • arXiv:https://arxiv.org/abs/2603.24146
  • 项目页面:https://vision3d-lab.github.io/lightsplat/
  • 代码仓库:https://github.com/vision3d-lab/lightsplat
  • 数据集页面:https://huggingface.co/datasets/devappendcbangj/DL3DV-OVS
搜集汇总
数据集介绍
DL3DV-OVS 数据集图片
构建方式
DL3DV-OVS数据集源自DL3DV-10K大规模场景库,精选公园、商店、道路与办公室四个复杂室内外场景,涵盖1416帧RGB图像与COLMAP稀疏重建数据。构建流程通过自动化脚本整合原始DL3DV数据,经COLMAP去畸变处理生成PNG图像,并配套引入人工标注的14帧关键帧及58个真实掩膜,同时利用SAM与CLIP模型提取逐帧语言特征,生成22条唯一样本文本嵌入。此外,数据集提供预训练的3D高斯泼溅(3DGS)检查点,确保模型输入与评估接口无缝衔接,构建出兼顾原始视觉信息与语义标注的完整基准。
使用方法
使用者需在Linux环境配置Python 3.10与COLMAP 3.7,并申请DL3DV原始数据及DL3DV-OVS的Hugging Face访问权限。克隆仓库后,通过`dl3dv-ovs setup`命令一键下载、组装并验证数据集,生成包含图像、稀疏模型、语言特征、文本嵌入、检查点及GT掩膜的标准化目录结构。评估时,需结合LightSplat官方代码库,输入RGB图像与对应特征,即可在开放词汇下进行场景理解任务的推理与性能评测,亦可直接复用提供的数据加载器接口。
背景与挑战
背景概述
DL3DV-OVS数据集诞生于2026年,由韩国蔚山国立科技大学与浦项科技大学的研究团队联合构建,旨在应对开放词汇三维场景理解在大型复杂室内外环境中的评估缺失问题。该数据集精选自DL3DV-10K大规模场景库,涵盖公园、商店、道路与办公室四种典型环境,包含1416帧RGB图像及配套的COLMAP稀疏重建数据,并提供了手工标注的掩膜、文本嵌入及三维高斯泼溅(3DGS)检查点,形成了完整的训练与评估基准。作为CVPR 2026论文LightSplat的配套资源,DL3DV-OVS严格遵循LERF-OVS的评估协议,为开放词汇三维场景理解提供了标准化的测试平台,推动了该领域从单一场景向复杂真实环境的跨越。
当前挑战
构建DL3DV-OVS面临双重挑战。领域层面,开放词汇三维场景理解需在无预定义类别约束下精准识别并定位任意文本描述的对象,而大型室内外场景存在光照剧变、几何遮挡、尺度悬殊与语义模糊等问题,对模型的泛化性与鲁棒性提出了严苛要求;同时,现有基准多聚焦于小型或合成场景,缺乏对真实复杂环境的覆盖,导致评估结果难以反映实际部署性能。构建层面,DL3DV-OVS的创建需整合多源数据,包括原始图像、COLMAP稀疏重建、手工掩膜与多模态特征,并确保各组件间的一致性;此外,还需设计可复现的装配流程,处理原数据集未分发的许可限制,并兼容多种模型输入格式,这要求精密的数据协调与标准化工作,显著增加了数据集构建的复杂度。
常用场景
经典使用场景
DL3DV-OVS作为面向大规模复杂室内外场景的开放词汇三维场景理解基准,其经典使用场景聚焦于评估模型在真实世界大尺度环境中的语言引导分割与查询能力。该数据集精心选取了公园、商店、道路和办公室四种具有高度语义多样性和空间复杂性的场景,提供了1416帧RGB/COLMAP数据、14帧人工标注的文本-掩码对以及58个细粒度真值掩码,为开放词汇三维语义分割、文本驱动的目标定位和视觉-语言导航等任务提供了标准化的评测平台。研究者可利用其统一的数据接口和评估协议,直接对比不同模型在复杂场景语义理解上的性能表现,推动该领域向更贴近实际应用的方向发展。
解决学术问题
该数据集切实回应了开放词汇三维场景理解中长期存在的基准缺失困境,尤其是在处理大规模、非结构化室内外环境时,之前的数据集规模有限且场景单一,难以验证模型的泛化能力。DL3DV-OVS通过提供包含10种以上自然语言查询、跨场景的密集标注以及与之配套的RGB三维高斯溅射检查点,使得研究者能够系统性地评测模型对未见类别的识别、对模糊语言描述的解析以及在复杂背景下的空间感知能力,从而有效推动了对三维开放词汇学习中尺度鲁棒性、跨域迁移和高效推理等核心学术问题的深入探究。
实际应用
在实际应用层面,DL3DV-OVS所支撑的开放词汇三维场景理解技术可无缝迁移至机器人自主导航、增强现实交互以及智能安防监控等前沿领域。例如,服务机器人可在大型商场或办公室中依据自然语言指令精准定位并操作目标物体,而自动驾驶系统则能利用该数据集的室外道路场景动态理解交通标志和障碍物语义。此外,该数据集提供的轻量化模型输入(语言特征、文本嵌入)和快速部署协议,有助于在边缘设备上实现实时场景理解,为虚拟现实内容生成、智慧城市管理等应用提供关键的技术验证与数据基础。
数据集最近研究
最新研究方向
当前,开放词汇三维场景理解领域正经历从静态语义标注向动态、可泛化的语言-视觉融合范式的深刻转型。DL3DV-OVS数据集的发布恰逢其时,其核心贡献在于首次将大规模复杂室内外场景与开放词汇查询机制相结合,为评估模型在未见类别上的零样本分割与检索能力提供了标准化基准。该数据集紧密衔接了近期多模态大模型与三维高斯溅射技术的融合浪潮,尤其针对现有基准在场景规模、语言歧义及计算效率上的不足,提出了包含公园、商铺、道路、办公室等多元场景的精细标注集合。其轻量化评估协议与现成的模型输入接口,极大降低了研究门槛,有望推动实时、内存高效的开放词汇三维理解系统在自主导航、增强现实及机器人交互等前沿应用中的落地。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务