遇见数据集

ReasonMatch

收藏
Hugging Face2026-06-07 更新2026-06-08 收录
官方服务:

资源简介:

ReasonMatch-Bench是一个用于评估多模态大语言模型在复杂空间推理能力上的基准数据集。它由论文《通过宽基线匹配激发MLLMs中的复杂空间推理》引入,核心任务是评估模型在宽基线视角变化、几何变换、细粒度视觉证据以及遮挡等挑战下,对图像点对应关系进行视觉推理的能力。数据集包含两个主要部分:主评测集(ReasonMatch-Bench),涵盖dl3dv、re10k、scannet和uco3d等多个源数据集,并包含one_to_one、one_to_multi和multi_to_multi等多种对应关系注释类型;以及域外评测集(OOD evaluation),包含eth3d、imc2022、imc2024和unrealstereo4k等数据集,用于评估模型泛化能力。数据以图像对(view_a, view_b)的形式呈现,每个样本附带有结构化的答案(answer_json)和元数据(metadata_json)。数据集的字段信息完整,包括域、源数据集、注释类型、子集、样本ID、阶段ID、匹配数量、图像数据、答案JSON、元数据JSON、归档文件路径等14个特征。该数据集适用于图像-文本到文本的多模态任务,专注于视觉推理、宽基线匹配和空间推理等研究领域。

ReasonMatch-Bench is a benchmark dataset for evaluating the complex spatial reasoning capabilities of multimodal large language models (MLLMs). It was introduced in the paper titled "Unlocking Complex Spatial Reasoning in MLLMs via Wide-Baseline Matching". Its core task is to evaluate the visual reasoning ability of models on image point correspondences under challenges including wide-baseline viewpoint changes, geometric transformations, fine-grained visual evidence, and occlusion. The dataset consists of two main parts: the main evaluation set (ReasonMatch-Bench) and the out-of-distribution (OOD) evaluation set. The main evaluation set covers multiple source datasets such as dl3dv, re10k, scannet and uco3d, and contains multiple correspondence annotation types such as one_to_one, one_to_multi and multi_to_multi. The OOD evaluation set includes datasets such as eth3d, imc2022, imc2024 and unrealstereo4k, which is designed to evaluate the generalization ability of models. The data is presented in the form of image pairs (view_a, view_b), with each sample accompanied by structured answer_json and metadata_json. The dataset has complete field information, covering 14 features including domain, source dataset, annotation type, subset, sample ID, stage ID, number of matches, image data, answer JSON, metadata JSON, archive file path and other related items. This dataset is applicable to image-text-to-text multimodal tasks, and focuses on research areas including visual reasoning, wide-baseline matching and spatial reasoning.

创建时间:
2026-06-04
原始信息汇总

数据集概述:ReasonMatch

主页:https://aim-uofa.github.io/reasonmatch/ 许可证:Apache-2.0

任务类别:图像-文本到文本 (image-text-to-text)

标签:reasonmatch, visual-reasoning, wide-baseline-matching, multimodal, spatial-reasoning

简介:ReasonMatch-Bench 是一个用于评估多模态大语言模型(MLLMs)在宽基线匹配场景下进行复杂空间推理能力的数据集。其核心任务涉及在存在大幅视角变化、几何变换、细粒度视觉证据和遮挡的情况下,对点对应关系进行视觉推理。该数据集由论文《Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching》提出。

数据集结构

  • ReasonMatch-Bench 评估集reasonmatch_bench.tar.gz,包含域内评估数据。
  • OOD 评估集ood_dataset.tar.gz,包含域外评估数据。
  • 预览样本data/viewer_samples.parquet,包含 40 个代表性样本,仅用于浏览。

预览样本覆盖范围

  • ReasonMatch-Bench 部分dl3dv, re10k, scannet, uco3d 子集,涵盖 one_to_one, one_to_multi, multi_to_multi 任务类型。
  • OOD 评估部分eth3d, imc2022, imc2024, unrealstereo4k 子集,涵盖 alphanumeric 任务类型。

数据特征:每个样本包含以下字段:

  • domain:领域
  • source_dataset:源数据集
  • annotation_type:标注类型
  • subset:子集
  • sample_id:样本ID
  • stage_id:阶段ID
  • num_matches:匹配点数量
  • view_a:视角A图片
  • view_b:视角B图片
  • answer_json:答案(JSON格式)
  • metadata_json:元数据(JSON格式)
  • archive:归档
  • metadata_path:元数据路径
  • view_a_path:视角A图片路径
  • view_b_path:视角B图片路径

下载与使用: 完整评估需要使用 reasonmatch_bench.tar.gzood_dataset.tar.gz 两个压缩包。可通过 huggingface_hub 工具下载,并解压后获得 reasonmatch_bench/ood_dataset/ 两个目录。

相关资源

  • 项目页:https://aim-uofa.github.io/reasonmatch/
  • 代码库:https://github.com/aim-uofa/ReasonMatch
  • 论文:https://arxiv.org/abs/2606.03577
  • 原始 ModelScope 数据集:https://www.modelscope.cn/datasets/jxzh2020/ReasonMatchBench

引用

@InProceedings{Zhong_2026_CVPR, author = {Zhong, Hao and others}, title = {Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching}, booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)}, month = {June}, year = {2026}, pages = {16768-16778} }

搜集汇总
数据集介绍
ReasonMatch 数据集图片
构建方式
ReasonMatch数据集源自一项发表于CVPR 2026的前沿研究,旨在探索多模态大语言模型在宽基线匹配场景下的复杂空间推理能力。该数据集通过精心挑选来自DL3DV、Re10K、ScanNet、UCO3D等多个三维重建与视觉定位领域的经典数据源,构建了涵盖一对一、一对多、多对多等多种匹配模式的图像对。每个样本均包含两幅不同视角的图像及其对应的点对应关系,并辅以元数据与结构化标注,形成了兼具挑战性与多样性的评估基准。
特点
ReasonMatch的核心特色在于其高度仿真的宽基线场景设计,能够有效评估模型在面对剧烈视角变化、几何形变、精细视觉证据以及遮挡等复杂情况下的空间推理与点匹配能力。数据集同时提供了域内(in-domain)与域外(out-of-domain)两套评测子集,前者聚焦于已知数据分布下的细粒度匹配,后者则引入ETH3D、IMC2022等全新场景以检验模型的泛化鲁棒性。这种内外结合的架构使其成为衡量MLLMs空间智能水平的理想试金石。
使用方法
用户可通过Hugging Face Hub便捷获取该数据集。首先利用`huggingface_hub`库下载两个压缩档案`reasonmatch_bench.tar.gz`与`ood_dataset.tar.gz`,解压后分别获得域内与域外的评测数据集。每个子集内含完善的标注索引文件(annotation_index.json),使用时可按照官方提供的代码仓库与项目文档,将图像对与对应标注加载至MLLM推理流程中,并参考论文中的评估协议进行性能度量与结果解析。
背景与挑战
背景概述
ReasonMatch数据集诞生于多模态大语言模型(MLLMs)空间推理能力评测的迫切需求之中。由浙江大学、阿里巴巴等机构的研究人员钟浩、朱慕之等人在2026年CVPR会议上提出,该数据集聚焦于广基线匹配(wide-baseline matching)这一视觉与推理的交叉难题。其核心研究问题在于评估MLLMs在视角大幅变化、几何变换、细粒度视觉证据及遮挡条件下,对点对应关系的空间推理能力。通过构建包含室内外场景、多视图立体数据及跨域测试集的ReasonMatch-Bench,该数据集填补了现有视觉推理基准在空间对应关系评估上的空白,为衡量多模态模型的空间智能提供了标准化平台,在计算机视觉与具身智能领域产生了显著影响。
当前挑战
ReasonMatch所解决的领域挑战在于,当前多模态大模型在处理广基线视觉匹配时,往往无法应对视角剧烈变化引发的几何畸变、纹理遮挡导致的对应关系断裂,以及多视图间复杂空间关系的逻辑推导。构建过程中,研究团队面临的首要挑战是跨数据集一致性的保持,需将来自DL3DV、RE10K、ScanNet等多个数据源的图像在统一标注框架下对齐,并定义多对一、多对多等复杂匹配模式。此外,生成高保真度的答案标注、确保域内与域外测试集的分离,以及设计能区分视觉记忆与真正空间推理的评估协议,均构成了数据集建设的核心难点。
常用场景
经典使用场景
ReasonMatch数据集专为评估多模态大语言模型在宽基线匹配任务中的复杂空间推理能力而设计。其经典使用场景聚焦于视觉对应关系推理,要求模型在遭遇大幅视角变化、几何变换、精细视觉证据及遮挡等挑战性条件下,精准匹配两幅图像中的同名点。数据集涵盖域内与域外两类评估归档,域内样本来自dl3dv、re10k、scannet及uco3d等场景,支持一对一、一对多及多对多的匹配模式;域外评估则囊括eth3d、imc2022等真实与合成数据,进一步检验模型的泛化能力。研究者通过该基准可系统剖析模型对空间结构的理解深度与鲁棒性。
实际应用
在实际应用中,ReasonMatch数据集所评测的能力直接服务于诸多需要精密空间对应关系的视觉场景。例如,在自主导航与机器人操作中,智能体需跨视角稳健匹配环境特征点以完成定位与建图;在三维重建领域,宽基线图像匹配是实现高精度点云融合的核心技术;而增强现实系统则依赖此类推理实现虚拟物体与真实场景的无缝叠加。此外,该基准对于卫星遥感图像配准、多视角监控系统协同分析以及医学影像时序比对等专业领域亦具有显著指导意义,为部署具有空间智能的AI系统提供了关键验证平台。
衍生相关工作
围绕ReasonMatch数据集,已衍生出一系列具有深远影响的经典工作。首先,数据集的发布论文系统阐述了宽基线匹配中空间推理的理论框架,并基于该基准对比了多种主流多模态大语言模型的性能瓶颈。其次,开源代码库提供了完整的评测流水线与可视化工具,促进了社区对模型空间认知缺陷的深入诊断。此外,该工作催生了面向空间推理的多模态数据增强策略研究,以及将几何先验知识融入模型训练的创新方法。数据集本身亦作为迁移学习与域适应研究的优秀测试床,推动了跨场景空间对应能力的泛化性探索,形成了从基准构建到模型优化再到理论反思的完整研究闭环。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务