遇见数据集

DF3DV-1K Dataset and DI²FIX Dataset

收藏
github2026-06-18 更新2026-06-19 收录
数据链接:
官方服务:

资源简介:

DF3DV-1K是一个大规模数据集,包含一千个场景的干净和杂乱图像,用于无干扰三维视觉研究。DI²FIX是另一个相关数据集。数据集提供了详细的目录结构,包括图像、稀疏数据和变换文件,适用于新颖视图合成和三维重建任务。

DF3DV-1K is a large-scale dataset containing clean and cluttered images of 1,000 scenes, designed for unperturbed 3D vision research. DI²FIX is another relevant dataset. The dataset provides a detailed directory structure comprising images, sparse data, and transformation files, tailored for novel view synthesis and 3D reconstruction tasks.

创建时间:
2026-06-02
原始信息汇总

数据集概述

DF3DV-1K 是一个大规模数据集和基准,专为无干扰新颖视角合成(Distractor-Free Novel View Synthesis)研究而设计。

核心数据集:DF3DV-1K Dataset

  • 规模: 包含1000个场景,每个场景提供干净图像(clean images)和杂乱图像(cluttered images)两种版本。
  • 用途: 支持无干扰3D视觉研究。
  • 数据内容: 每个场景提供 COLMAP 输入图像、COLMAP 稀疏重建结果(包括相机参数、图像和3D点云)、图像分割信息(clean/clutter列表)、Instant-NGP 格式的JSON文件以及去畸变后的图像和稀疏重建结果。
  • 子集划分:
    • DF3DV-1K-Star: 包含约1000个场景的较大子集。
    • DF3DV-41: 包含41个场景的子集。
  • 下载:
    • 已掩码数据集: 可从 Hugging Face 或 Google Cloud 下载,约1TB。
    • 原始数据集: 需填写表单并同意使用条款后,再从 Hugging Face 或 Google Cloud 下载。

辅助数据集:DF3DV-1K-Fixer

  • 用途: 提供配对的3DGS(3D高斯溅射)和无干扰3DGS渲染结果,以及对应的真实图像,用于干扰物移除和修复(fixer)研究。
  • 结构: 分为训练集(Train)和验证集(Val)。验证集包含DF3DV-41-Fixer子集和 on-the-go 子集。
  • 数据内容: 包含多种模型(如3DGS、WILDGS)的渲染结果和真实图像、图像最近邻信息以及COLMAP结果。
  • 下载:
    • 已掩码数据集: 可从 Hugging Face 或 Google Cloud 下载,约0.2TB。
    • 原始数据集: 需填写表单并同意使用条款后,再从 Hugging Face 或 Google Cloud 下载。

基准(Benchmark)

  • 提供在线排行榜(Leaderboard),用于评估无干扰新颖视角合成方法。
  • 支持提交结果参与排行榜排名。

快速开始

  • DF3DV-1K 快速开始: 提供基准代码库。
  • DI²FIX 快速开始: 提供用于干扰物修复的代码库和演示页面。

数据定制

  • 提供数据准备工具,用于自定义 DF3DV-1K 和 DI²FIX 数据集。

引用信息

  • 论文: arXiv:2604.13416
  • 引用格式: 提供了 BibTeX 引用。
搜集汇总
数据集介绍
DF3DV-1K Dataset and DI²FIX Dataset 数据集图片
构建方式
在三维视觉领域中,新视角合成任务常因场景中的动态干扰物而面临巨大挑战。为此,研究者构建了DF3DV-1K数据集,它包含了精心采集的一千个场景,每个场景均同时提供干净与含干扰物的图像对。为了获取这些图像,采集过程采用了间隔拍摄的方式,部分早期批次的数据采集较为随意、质量稍低。数据随后经过COLMAP结构从运动恢复技术进行特征提取与稀疏重建,并生成矫正后的图像和相机参数文件。此外,配套的DI²FIX数据集则专门为干扰物去除任务而设计,它提供了由传统3D高斯泼溅方法及去干扰版本渲染的成对图像,以及对应的真实图像,从而为训练干扰修复模型奠定了坚实基础。
特点
该数据集最显著的特点在于其庞大规模与专一性,包含千个场景的海量图像对,能够有力支撑去干扰新视角合成领域的深度研究。每个场景的数据均被细致划分为“干净”与“杂乱”两类候选图像,并通过split.json文件对训练和评估所用的干净图像与干扰图像进行明确划分。数据集中涵盖了多种格式的预处理结果,如Instant-NGP兼容的transforms JSON文件、COLMAP的稀疏重建输出以及矫正后的图像集,极大地方便了研究者的直接使用。DI²FIX子集进一步整合了多种三维重建模型的渲染结果与最近邻索引,为去除干扰物提供了丰富的训练素材。
使用方法
研究者可以直接从Hugging Face或Google Cloud平台下载蒙版处理后的数据集压缩包,其总容量约为1TB,而DI²FIX子集约为0.2TB。下载后,数据集目录按照场景-采集批次组织,每个批次文件夹内含有多幅图像及其元数据。如需使用原始图像数据,需先填写协议表单并获得许可。在代码层面,数据集提供了快速开始指南,可以结合DF3DV_Benchmark和DI²FIX两个代码仓库进行模型评估与训练。此外,研究者还可参照数据定制指南自行扩展或调整数据采集与预处理流程,以适应特定任务需求。
背景与挑战
背景概述
在三维视觉领域,新视角合成技术虽已取得长足进步,但真实场景中行人、车辆等干扰物的存在严重制约了合成质量的提升。由悉尼科技大学、悉尼大学与阳明交通大学联合团队于2026年提出的DF3DV-1K数据集,旨在填补大规模无干扰新视角合成基准的空白。该数据集精心收集了超过一千个室内外场景,每个场景均包含干净与含干扰物的图像对,并提供结构化的目录划分与基于COLMAP的稀疏重建结果。其规模之大、场景之丰富,为评估与推动去除干扰的三维重建算法奠定了坚实的数据基础,迅速成为相关研究领域的重要资源。
当前挑战
该数据集所面临的核心挑战集中在两大方面:一是领域问题的复杂性,如何从含干扰物的多视角图像中精确复原出无干扰的三维场景,并生成逼真的新视角视图,对现有算法的鲁棒性与泛化能力提出了严苛考验。二是数据集构建过程中的技术难题,包括大规模场景下干扰物与静态背景的精准分离、不同光照与拍摄条件下图像对的一致性维护,以及近千个场景中数据采集与标注流程的标准化与质量控制。此外,数据集的庞大体量(约1TB)也对存储与高效访问构成了物理层面的挑战。
常用场景
经典使用场景
在三维视觉与神经渲染领域,从杂乱场景中合成无干扰的新视角图像始终是一项极具挑战性的任务。DF3DV-1K数据集以其庞大的规模与精心设计的场景结构,为研究者提供了一个绝佳的试验场,广泛用于训练和评估去干扰新视角合成(Distractor-Free Novel View Synthesis)模型。通过提供同一场景下成对的干净与杂乱图像,该数据集使得模型能够学习如何从含有目标物遮挡、行人穿梭或环境噪声的杂乱输入中,推理并重建出纯净、整洁的新视角画面。这种设计不仅考验了模型在复杂现实环境下的鲁棒性,也推动了神经辐射场(NeRF)与三维高斯溅射(3DGS)等方法在干扰抑制方面的技术进步。
实际应用
在实际应用层面,DF3DV-1K数据集所驱动的技术展现出广阔的社会与经济价值。在增强现实与虚拟现实领域,用户常常需要在人流密集的公共场所(如博物馆、车站或商业街)捕捉并重建三维场景,该技术能够自动移除画面中的临时行人或杂物,从而生成纯净的数字化资产,用于沉浸式导航或虚拟文化遗产保护。在电影与广告制作中,它允许后期团队从实景拍摄素材中智能清除不需要的背景元素,大幅降低人工修图成本。此外,在机器人导航与自动驾驶中,对路况中动态干扰物的消除有助于构建更稳定的环境认知地图,提升决策系统的可靠性。
衍生相关工作
基于DF3DV-1K数据集,学术界已涌现出一系列具有影响力的衍生工作。经典的DI²FIX方法即直接借助该数据集中的配对渲染与真实图像,训练一个轻量级的后处理修复模块,专门用于消除由粗糙渲染带来的伪影与残留干扰,成为了该方向上的重要基线。此外,研究者们还基于该数据集提出了多种干扰感知的三维重建框架,例如通过引入注意力机制对杂乱区域进行动态加权,以及结合扩散模型进行语义级别的干扰消除。这些工作不仅在学术基准排行榜上不断刷新纪录,其思想也被广泛借鉴于后续的无监督与自监督场景理解研究中,充分彰显了DF3DV-1K数据集在催生创新方法上的关键价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务