遇见数据集

Time-Aware Multi-View MRI Benchmark

收藏
arXiv2026-08-13 更新2026-08-15 收录
官方服务:

资源简介:

Time-Aware Multi-View MRI Benchmark是一个由穆罕默德·本·扎耶德人工智能大学等机构联合创建的纵向MRI疾病进展推理基准,旨在评估视觉语言模型在时空推理中的能力。该基准包含3,920个专家验证的问答对,来源于890名患者的3,200多个时间点,覆盖胶质母细胞瘤、脑转移、神经退行性疾病和听神经鞘瘤七种临床队列。数据集通过GPT-5自动生成候选问题,经两名认证放射科医师独立验证,最终72%的样本通过审核。该基准旨在解决现有单时间点、单视图基准的局限性,推动模型在疾病进展跟踪、时间序列排序和结构化定位引导等临床关键任务上的发展。

The Time-Aware Multi-View MRI Benchmark is a longitudinal MRI disease progression reasoning benchmark co-developed by institutions including Mohammed bin Zayed University of Artificial Intelligence, designed to evaluate the capabilities of vision-language models in spatiotemporal reasoning. This benchmark contains 3,920 expert-validated question-answer pairs, sourced from over 3,200 time points of 890 patients, covering seven clinical cohorts including glioblastoma, brain metastases, neurodegenerative diseases, and vestibular schwannoma. Candidate questions were automatically generated using GPT-5, then independently verified by two board-certified radiologists, with 72% of the samples ultimately passing the review. This benchmark aims to address the limitations of existing single-time-point, single-view benchmarks, and advance model performance on critical clinical tasks such as disease progression tracking, time series ranking, and structured localization guidance.

创建时间:
2026-08-13
原始信息汇总

🧠 Time-Aware Multi-View MRI Benchmark 数据集详情

数据集简介

Time-Aware Multi-View MRI Benchmark 是一个用于评估视觉语言模型(VLMs)在纵向、多视角、临床级 MRI 推理能力上的大规模基准测试集。该数据集由 MBZUAI、阿布扎比卫生部、Fatima 健康科学学院和林雪平大学联合构建,论文已被 MICCAI 2026 早期接收(前 9%),并获选 SpotLight 展示。

核心规模

指标 数值
患者数量 890
纵向时间点 3,200+
队列数量 7
专家验证的 QA 对 3,920
影像序列 T1, T2, FLAIR, T1CE, DWI, ADC
每时间点视角 轴位、冠状位、矢状位(9–12 张图像)
扫描间隔 4 个月至 18+ 个月
审核专家 2 名委员会认证放射科医生
双重批准通过率 72%

任务类型

任务 格式 QA 数量 测试内容
时间推理 开放型 1,101 时间点间变化识别
疾病进展 开放型 942 轨迹与治疗反应预测
结构化定位引导 多选题 828 解剖变化区域、边界与特征
时间序列排序 二元 487 系列扫描的时间先后重建
随时间变化定位 多选题 562 最大变化时间点与位置

来源队列

数据集整合了 7 个纵向 MRI 队列,涵盖脑转移瘤、胶质母细胞瘤、神经退行性疾病、前庭神经鞘瘤等病理类型。来源包括:

  • Yale-Brain-Mets-Longitudinal(脑转移瘤,TCIA)
  • UCSF-ALPTDG(治疗后弥漫性胶质瘤,DOI 10.1148/ryai.230182)
  • UCSD-PTGBM(治疗后胶质母细胞瘤,TCIA)
  • LUMIERE(纵向胶质母细胞瘤 + RANO,Figshare)
  • OASIS-2(神经退行性疾病,oasis-brains.org)
  • ADNI(阿尔茨海默病神经影像,adni.loni.usc.edu)
  • Vestibular-Schwannoma-MC-RC(前庭神经鞘瘤随访,TCIA)

⚠️ 源 MRI 图像不在此仓库中重新分发,需从官方渠道下载并遵守相应许可协议。

评估模型与关键结果

基准评估了 16 个视觉语言模型,包括闭源的 GPT-4o、GPT-5.2、o4-mini、Gemini-2.5/3 Pro & Flash,以及开源的 Qwen3-VL、Llama-4 Scout/Maverick、InternVL3.5、MedGemma 等。

最佳整体表现:InternVL3.5-Inst 在最终准确率(35.15%)、推理分数(6.68)、TAC(0.800)、Trend-F1(0.631)等多项指标上领先。所有模型在临床关键的变化方向识别任务上普遍表现不佳,最高 Sign Acc 仅为 74.0%。

多视角分析

多视角输入(轴位+冠状位+矢状位)对空间定位有明显提升(最高达 97.3% 的进展定位准确率),但在紧凑型开源模型中会降低时间排序能力(如 Qwen3-VL-8B 下降 8.0 pp,MedGemma-4B 下降 5.8 pp)。所有模型的体积量化准确率均低于 16%。

使用与复现

仓库提供预处理脚本(配准、强度归一化、多视角提取)、评估代码(分步推理生成、表 1 主结果复现、表 2 多视角分析复现),以及安装和 API 密钥配置说明。

联系方式

搜集汇总
数据集介绍
Time-Aware Multi-View MRI Benchmark 数据集图片
构建方式
该基准的构建过程严谨而系统,整合了七个纵向MRI队列,涵盖胶质母细胞瘤、脑转移瘤、神经退行性疾病及前庭神经鞘瘤等多种病理类型。数据经过多阶段预处理,包括图像配准、方向标准化、肿瘤感知的切片提取及序列特异性强度归一化,确保跨队列的影像质量一致性。在此基础上,采用自动化生成与放射科专家验证相结合的方式,借助GPT-5生成问题候选,并由两位认证放射科医师独立审核,最终形成3,920个专家验证的问答对,覆盖开放式、多项选择及二值三种格式。
特点
该基准的核心特色在于其时间感知与多视角融合的设计,突破了传统单时间点、单视角的评估局限。它要求模型在横断面、冠状面及矢状面等多解剖平面上,对跨时间点的MRI序列进行综合推理,包括变化定位、进展特征描述及结构化引导的生成。基准涵盖五项互补任务,全面评估时间顺序重建、疾病进展分类、变化方向识别及体积量化等能力。此外,其结构化定位引导机制,明确要求模型输出边界、影像特征及混杂因素,旨在模拟放射科医生的完整工作流程,为纵向MRI理解提供了系统而严格的评测框架。
使用方法
使用时,该基准以零样本方式评估各类视觉语言模型,输入为多序列、多视角的MRI图像及时间元数据。模型需依据提供的图像序列,回答涉及时间推理、疾病进展、变化定位等问题的开放性或选项式询问。性能评估采用三个互补指标:最终答案准确率、推理得分及时间感知复合指标,后者综合了时序依赖、趋势检测、方向判断及覆盖度,以全面衡量模型的时序推理能力。评测代码、数据划分及数据集均公开于GitHub,便于研究者复现结果并进行监督微调等进一步研究,从而推动医学影像时序推理的发展。
背景与挑战
背景概述
Time-Aware Multi-View MRI Benchmark由穆罕默德·本·扎耶德人工智能大学的研究团队于2026年提出,旨在弥补现有视觉-语言基准在纵向MRI分析中的关键缺失。该基准整合了来自七个临床队列(涵盖胶质母细胞瘤、神经退行性疾病、前庭神经鞘瘤和脑转移瘤)的890名患者、超过3200个纵向MRI时间点的数据,构建了包含3920个专家验证的问答对,覆盖时序推理、疾病进展、结构化定位引导、时序排序和随时间变化定位五大任务。这一基准首次将多视角解剖输入、跨时间点的时序推理与结构化定位引导统一于一个评估框架中,为医学影像基础模型在纵向疾病进展推理上的能力提供了系统性衡量标准,对推动临床可部署的医学AI研究具有重要影响力。
当前挑战
该基准面临的挑战首要在于领域问题的复杂性:纵向MRI解读需要模型整合多视角(轴位、冠状位、矢状位)和多序列(T1、T2、FLAIR等)信息,理解疾病的时间演变轨迹,并进行精确的局部变化定位,而现有视觉-语言模型普遍缺乏时空推理能力,尤其是在变化方向识别和体积量化方面表现系统性不足。构建过程中的挑战同样严峻,包括跨队列数据的预处理标准化(如图像配准、强度归一化)、多视角与时间维度的有效融合,以及确保问答对在临床上的准确性和合理性。此外,多视角输入虽能提升空间定位,却在紧凑模型中损害时序推理,凸显了在有限计算资源下平衡信息冗余与推理效率的难题。
常用场景
经典使用场景
该数据集的核心应用场景在于构建多视角、多时间点的核磁共振影像推理任务,模拟放射科医师在纵向随访中整合轴位、冠状位、矢状位多平面解剖信息,对病灶演变进行时空定位与动态追踪的认知过程。其设计涵盖五项互补性任务——时间推理、疾病进展评估、结构化定位指导、时间序列排序及跨时间变化定位,旨在全面评测视觉语言模型在复杂临床情境下的时序-空间推理能力。该基准为模型提供了统一的评测框架,使其能够在贴近真实临床工作流的条件下检验其解读连续医学影像的综合素养。
实际应用
在实际应用中,该基准可用于筛选、验证并改进用于临床辅助诊断的智能系统,尤其适用于肿瘤治疗反应评估、神经退行性疾病进展监测以及术后复发预警等场景。通过模拟放射科医生在连续随访中对病灶变化的精确描述与定位需求,该数据集为开发能够提供结构化、可解释性报告的AI工具提供了可靠的评测土壤,促进了模型在真实临床工作流中的可用性与安全性验证,为远程医疗、自动报告生成和临床决策支持系统的落地提供了数据依据。
衍生相关工作
该基准的提出催生了若干衍生研究方向,包括多视角输入对时序推理影响的消融分析、针对紧凑型模型的时序与空间信息融合策略优化,以及基于时间感知复合指标(TAC)的推理质量评估方法。其公开的数据划分与代码鼓励了后续监督微调与多任务学习的探索,推动了具备3D几何先验或跨时间注意力机制的下一代医学视觉语言模型设计,也促进了跨中心、多疾病纵向数据集构建标准的建立,为医学影像领域从静态识别转向动态智能评估奠定了基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务