遇见数据集

MODEST

收藏
Hugging Face2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

MODEST(Multi-Optics DOF Stereo Dataset)是一个用于计算摄影的大规模数据集,专注于景深渲染、立体视觉和光学场景理解。该数据集是首个系统捕捉焦距和光圈变化的高分辨率立体单反相机数据集,旨在解决现有景深数据集的关键限制。数据集包含20,000张超高分辨率(5472×3648,2000万像素)的立体图像,覆盖10个多样化的室内真实世界场景。每个场景均通过系统变化的光学参数进行拍摄:使用10种不同的焦距,每种焦距下设置5个不同的光圈值,并包含多个视角。这种设计使得能够全面分析景深、散焦模糊、光学像差、焦距依赖的外观变化以及多视图场景理解。此外,MODEST为每个焦距提供了专用的高分辨率棋盘格校准图像集,支持使用未来校准算法进行重新校准,并促进相机几何研究。数据集中包含具有挑战性的视觉内容,如反射和半透明表面、光学错觉、模糊的深度关系、精细结构、强烈的亮度过渡以及复杂的光照条件,适合在真实条件下评估现代计算机视觉和计算摄影方法。数据集支持的研究方向包括:景深渲染、散焦去模糊、立体匹配、多视图学习、计算摄影、相机校准、光学场景理解、图像恢复和3D重建。数据采集使用由两台佳能6D单反相机组成的同步立体支架系统,确保了场景几何和视角的一致性。

MODEST (Multi-Optics DOF Stereo Dataset) is a large-scale dataset for computational photography, focusing on depth-of-field rendering, stereo vision and optical scene understanding. This dataset is the first high-resolution stereo SLR camera dataset that systematically captures variations in focal length and aperture, aiming to address the key limitations of existing depth-of-field datasets. The dataset contains 20,000 ultra-high-resolution (5472×3648, 20-megapixel) stereo images, covering 10 diverse indoor real-world scenes. Each scene is captured with systematically varied optical parameters: 10 distinct focal lengths, 5 different aperture values for each focal length, and multiple viewpoints. This design enables comprehensive analysis of depth of field, defocus blur, optical aberrations, focal-length-dependent appearance changes and multi-view scene understanding. Additionally, MODEST provides dedicated high-resolution checkerboard calibration image sets for each focal length, supporting recalibration with future calibration algorithms and facilitating camera geometry research. The dataset contains challenging visual content such as reflective and translucent surfaces, optical illusions, ambiguous depth relationships, fine-grained structures, strong brightness transitions and complex lighting conditions, making it suitable for evaluating modern computer vision and computational photography methods under real-world conditions. Supported research directions of the dataset include: depth-of-field rendering, defocus deblurring, stereo matching, multi-view learning, computational photography, camera calibration, optical scene understanding, image restoration and 3D reconstruction. Data collection was conducted using a synchronized stereo rig system consisting of two Canon 6D SLR cameras, ensuring consistency in scene geometry and viewpoints.

创建时间:
2026-06-03
原始信息汇总

MODEST 数据集概述

MODEST(Multi-Optics DOF Stereo Dataset) 是一个大规模计算摄影数据集,专注于景深渲染、立体视觉和光学场景理解。该数据集通过专业相机光学系统,系统性地捕捉了焦距和光圈的变化,旨在解决现有景深数据集的局限性。


核心特点

  • 高分辨率立体图像:包含 20,000 张 立体图像,分辨率为 5472 × 3648(20MP)
  • 多样化场景:涵盖 10 个不同真实世界场景,包括反射表面、半透明材料、光学错觉、模糊深度关系、精细结构、强亮度过渡和复杂光照条件。
  • 系统光学参数变化:每个场景使用 10 种焦距 和每个焦距下的 5 种光圈设置 进行拍摄。
  • 同步立体捕捉:使用两台 Canon 6D DSLR 相机组成的同步立体设备采集。
  • 专用校准图像集:为每个焦距提供高分辨率棋盘校准图像集,支持未来校准算法和相机几何研究。

数据集统计

属性 数值
总图像数 20,000 张
分辨率 5472 × 3648
室内场景数 10
相机型号 Canon 6D DSLR
焦距数量 10
光圈设置数量 5
深度范围 0.5m – 10m
光学配置数量 50
数据集大小 约 142 GB

数据集结构

数据集按场景和相机组织,目录结构如下:

MODEST/ ├── Global_calibration_set/ │ ├── EOS6D_A_Left/ │ │ └── fl_<focal_length>/ │ │ ├── calibration/ │ │ └── inference/ │ └── EOS6D_B_Right/ │ └── fl_<focal_length>/ │ ├── calibration/ │ └── inference/ │ ├── Scene<id>/ │ ├── EOS6D_A_<Left|Right>/ │ │ └── fl_<focal_length>/ │ │ ├── calibration/ │ │ └── inference/ │ │ └── F<aperture>/ │ └── EOS6D_B_<Left|Right>/ │ └── fl_<focal_length>/ │ ├── calibration/ │ └── inference/ │ └── F<aperture>/ └── ...

参数说明

  • <id>:场景编号,取值范围 {1, 2, 3, 4, 5, 6, 7, 8, 9, 10}
  • <focal_length>:焦距,取值范围 {28mm, 32mm, 36mm, 40mm, 45mm, 50mm, 55mm, 60mm, 65mm, 70mm}
  • <aperture>:光圈,取值范围 {F2.8, F5.0, F9.0, F16.0, F22.0}

研究应用

MODEST 支持以下领域的研究:

  • 景深渲染
  • 散焦去模糊
  • 立体匹配
  • 多视角学习
  • 计算摄影
  • 相机标定
  • 光学场景理解
  • 图像复原
  • 3D 重建

项目资源

  • 项目网站:https://modest-dataset.netlify.app/
  • 论文:https://arxiv.org/abs/2511.20853

许可协议

该数据集基于 CC BY 4.0 许可证 发布,允许用户共享和改编,但需给予适当署名。

搜集汇总
数据集介绍
MODEST 数据集图片
构建方式
MODEST数据集采用两台佳能6D DSLR相机搭建同步立体采集系统,针对10个真实室内场景,在10种焦距(28mm至70mm)和5种光圈设置(F2.8至F22)的组合下,共拍摄20,000张分辨率高达5472×3648(20MP)的立体图像。每个场景均涵盖50种光学配置,并包含专用的高分辨率棋盘格标定图像集,为相机几何与后续重标定研究提供支持。
使用方法
数据集按场景ID、相机左右视图及光学配置进行层级组织,用户可通过路径访问不同焦距和光圈下的图像与标定数据。适用于景深渲染、去模糊、立体匹配、多视角学习、相机标定及3D重建等研究领域。完整数据集及标定材料已开放用于非商业学术研究,用户需引用原始论文并遵循CC BY 4.0许可协议。
背景与挑战
背景概述
在计算摄影与立体视觉领域,景深效应与光学散焦模糊的建模长期受限于合成数据或低分辨率实拍数据的局限性。MODEST数据集由Nisarg K. Trivedi、Vinayak A. Belludi与Li-Yun Wang于2026年创建,旨在填补真实世界中多光学参数系统变化下的高分辨率立体景深数据空白。该数据集采用两台Canon 6D DSLR相机组成的同步立体平台,在10个复杂真实场景中系统采集了20,000张超高清(5472×3648)立体图像,覆盖10种焦距与5种光圈设置,并附有每焦距下的高分辨率标定板图像。MODEST的核心研究问题聚焦于多光学配置条件下的景深渲染、散焦去模糊、立体匹配与光学场景理解,其引入的受控光学变量与真实世界挑战性内容(如反射面、半透明材质、细碎结构)为相关领域提供了前所未有的基准资源,对推动计算摄影与立体视觉方法在真实光学条件下的评估与改进具有重要影响力。
当前挑战
MODEST数据集所应对的领域挑战在于:现有景深与散焦模糊数据集多采用合成生成或固定光学参数的低分辨率采集,无法反映真实光学系统中焦距与光圈协同变化产生的非线性散焦模式、猫眼渐晕效应与非均匀散景结构,导致算法在泛化至复杂真实场景时性能严重退化。构建过程中,团队面临多重技术挑战:需在10组焦距与5组光圈组合下,于10个场景中精确控制立体相机的同步触发与视角一致性,同时保证超高清分辨率下的光照稳定性、景深连续性及运动伪影抑制;此外,需针对反射、透明、高光与细密纹理等挑战性视觉现象设计富有歧义性的深度关系场景,并建立每焦距下的独立标定体系以支持后续重标定算法验证。最终数据集以142GB体量呈现,为光学场景理解与图像复原任务提供了高保真度的实拍测试床。
常用场景
经典使用场景
MODEST数据集作为首个系统性地改变焦距与光圈参数的高分辨率立体DSLR数据集,在计算摄影领域开辟了崭新的研究范式。其核心应用场景涵盖景深渲染与离焦去模糊两大经典任务,研究者在获取同一场景下50种不同光学配置(10种焦距×5种光圈)的立体图像对后,可精准分析光学参数对图像模糊程度和景深效果的定量影响。该数据集的独特价值在于同时提供了超高清分辨率(20MP)、立体几何约束以及真实世界光学的退化特性(如猫眼渐晕与非均匀散景),使其成为评估和训练深度学习方法在处理复杂光学效应时的关键基准。
解决学术问题
MODEST数据集直击了现有景深数据集的共性问题——缺乏真实世界光学参数的协同变化记录,从而有效解决了多光学场景下图像复原与立体匹配研究所面临的数据瓶颈。该数据集允许研究者深入探索反射表面、半透明材质、精细纹理和强光照条件等复杂视觉现象对算法性能的干扰机制,为解释模型在不同焦距和光圈配置下的泛化能力提供了宝贵素材。通过系统性的光学参数采样,它弥合了合成数据与真实成像物理过程之间的鸿沟,推动了计算摄影理论从理想化假设向现实复杂场景建模的重要转变。
实际应用
在实际应用中,MODEST数据集为高端相机系统与移动摄影设备的算法优化注入了全新可能。基于该数据集训练的离焦去模糊模型能够显著提升手机双摄模组在拍摄人像模式时的背景虚化质量,同时精准恢复因景深变化导致的边缘模糊。在立体视觉与三维重建领域,该数据集提供的多焦距标定图像集支持更精确的相机几何校准,进而增强增强现实(AR)设备在复杂照明环境下对场景深度信息的实时感知能力。此外,影视制作中利用其多光学配置数据可自动化生成逼真的景深特效,大幅降低后期合成对人工调参的依赖。
数据集最近研究
最新研究方向
MODEST数据集为计算摄影与立体视觉领域开辟了新的研究范式,聚焦于多光学参数耦合下的真实场景深度感知与图像复原。前沿研究方向涵盖基于可变焦距与光圈的散焦渲染与去模糊、非均匀散景建模、立体匹配中的光学畸变补偿,以及端到端的多视图场景理解。该数据集首次在20MP高分辨率下同步捕捉10种焦距与5档光圈的组合变化,揭示了镜头像差、焦外光斑与景深渐变对视觉算法的影响,推动了如反射面、半透明材质等复杂光学现象下的鲁棒建模。与神经辐射场(NeRF)和动态场景重建等热点事件相结合,MODEST为评估光学物理模型与深度学习方法的协同潜力提供了标准化基准,其意义在于弥合仿真数据与真实光学复杂性之间的鸿沟,促进计算成像系统在智能手机摄影、自动驾驶及机器视觉中的工程落地。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务