AnyMatch (Any-syn)
收藏资源简介:
AnyMatch 是一个从单视角图像合成大规模多模态对(RGB-IR/深度/法线/事件)的数据集,通过深度估计、重投影、修复和跨模态转换实现3D一致性。该数据集用于增强通用多模态图像匹配,通过在Any-syn上微调LoFTR/EDM/RoMa等模型,实现了最先进的跨模态匹配和零样本泛化。
AnyMatch is a dataset that synthesizes large-scale multimodal pairs (RGB-IR/Depth/Normal/Event) from single-view images, achieving 3D consistency via depth estimation, reprojection, inpainting and cross-modal translation. This dataset is designed to enhance general-purpose multimodal image matching, and by fine-tuning models such as LoFTR, EDM and RoMa on Any-syn, it achieves state-of-the-art cross-modal matching and zero-shot generalization.
AnyMatch 数据集详情
概述
AnyMatch 是 ECCV 2026 收录的工作,旨在通过大规模单视图图像增强通用多模态图像匹配能力。其核心是通过数据引擎(AnyMatch Data Engine),从单视图图像合成具有3D一致性的多模态图像对(RGB-IR/Depth/Normal/Event),用于训练通用多模态匹配模型。
数据生成流程
AnyMatch 数据引擎包含三大模块:
- 视图变换模块(View Transformation):通过单目深度估计将单张2D图像提升至3D空间,再重投影至新视角并进行修复,生成几何一致的多视图图像对,无需依赖SfM-MVS。
- 模态变换模块(Modality Transformation):将原始可见光图像转换为多种目标模态(红外、深度、法线、事件),使用专用跨模态翻译模型(如RGB-to-IR扩散模型、单目深度/法线估计器、基于运动的事件合成),生成模拟真实传感器差异的多模态图像对。
- SGCV模块:质量控制步骤,利用预训练的密集匹配模型(RoMa)计算渲染对应与真实几何投影之间的关键点正确百分比(PCK),筛选高质量图像对。
单视图数据库(Single-View Database)
- 来源:来自公开数据集 GLDv2 和 SA-1B 的大规模真实世界RGB图像。
- 预处理:所有图像统一调整大小并中心裁剪至512×512分辨率。
- 用途:作为基础输入库,替代昂贵的多视图或多传感器采集,用于后续视图变换和模态变换。
- 训练子集基于 GLDv2,测试子集基于 SA-1B。
评估数据集(Real Multimodal Scenarios)
AnyMatch 使用多个真实多模态场景数据集进行评估:
- METU_VisTIR:可见光-红外图像对
- MMIM:包含遥感、医学、计算机视觉子集的多模态图像匹配数据集
- RGB-Depth:RGB-深度图像对
- RGB-EVENT:RGB-事件图像对
- RGB-Normal:RGB-法线图像对
数据组织结构
推荐的数据目录结构:
data/ ├── test_data_preparation.sh ├── Any-syn-test/ ├── Single-View-Data/ ├── RealDataset/ ├── METU_VisTIR/ │ ├── index/ │ ├── cloudy/ │ └── sunny/ ├── MMIM/ │ ├── RemoteSensing/ │ ├── Medical/ │ └── ComputerVision/ ├── RGB-Depth/ │ └── val/ ├── RGB-EVENT/ │ └── DSEC/ └── RGB-Normal/ └── val/
支持的多模态匹配方法
AnyMatch 支持以下方法在多模态图像匹配基准上进行评估:
- LoFTR
- EDM
- RoMa
相关资源




