Time-Aware Multi-View MRI Benchmark
收藏资源简介:
Time-Aware Multi-View MRI Benchmark是一个由穆罕默德·本·扎耶德人工智能大学等机构联合创建的纵向MRI疾病进展推理基准,旨在评估视觉语言模型在时空推理中的能力。该基准包含3,920个专家验证的问答对,来源于890名患者的3,200多个时间点,覆盖胶质母细胞瘤、脑转移、神经退行性疾病和听神经鞘瘤七种临床队列。数据集通过GPT-5自动生成候选问题,经两名认证放射科医师独立验证,最终72%的样本通过审核。该基准旨在解决现有单时间点、单视图基准的局限性,推动模型在疾病进展跟踪、时间序列排序和结构化定位引导等临床关键任务上的发展。
The Time-Aware Multi-View MRI Benchmark is a longitudinal MRI disease progression reasoning benchmark co-developed by institutions including Mohammed bin Zayed University of Artificial Intelligence, designed to evaluate the capabilities of vision-language models in spatiotemporal reasoning. This benchmark contains 3,920 expert-validated question-answer pairs, sourced from over 3,200 time points of 890 patients, covering seven clinical cohorts including glioblastoma, brain metastases, neurodegenerative diseases, and vestibular schwannoma. Candidate questions were automatically generated using GPT-5, then independently verified by two board-certified radiologists, with 72% of the samples ultimately passing the review. This benchmark aims to address the limitations of existing single-time-point, single-view benchmarks, and advance model performance on critical clinical tasks such as disease progression tracking, time series ranking, and structured localization guidance.
🧠 Time-Aware Multi-View MRI Benchmark 数据集详情
数据集简介
Time-Aware Multi-View MRI Benchmark 是一个用于评估视觉语言模型(VLMs)在纵向、多视角、临床级 MRI 推理能力上的大规模基准测试集。该数据集由 MBZUAI、阿布扎比卫生部、Fatima 健康科学学院和林雪平大学联合构建,论文已被 MICCAI 2026 早期接收(前 9%),并获选 SpotLight 展示。
核心规模
| 指标 | 数值 |
|---|---|
| 患者数量 | 890 |
| 纵向时间点 | 3,200+ |
| 队列数量 | 7 |
| 专家验证的 QA 对 | 3,920 |
| 影像序列 | T1, T2, FLAIR, T1CE, DWI, ADC |
| 每时间点视角 | 轴位、冠状位、矢状位(9–12 张图像) |
| 扫描间隔 | 4 个月至 18+ 个月 |
| 审核专家 | 2 名委员会认证放射科医生 |
| 双重批准通过率 | 72% |
任务类型
| 任务 | 格式 | QA 数量 | 测试内容 |
|---|---|---|---|
| 时间推理 | 开放型 | 1,101 | 时间点间变化识别 |
| 疾病进展 | 开放型 | 942 | 轨迹与治疗反应预测 |
| 结构化定位引导 | 多选题 | 828 | 解剖变化区域、边界与特征 |
| 时间序列排序 | 二元 | 487 | 系列扫描的时间先后重建 |
| 随时间变化定位 | 多选题 | 562 | 最大变化时间点与位置 |
来源队列
数据集整合了 7 个纵向 MRI 队列,涵盖脑转移瘤、胶质母细胞瘤、神经退行性疾病、前庭神经鞘瘤等病理类型。来源包括:
- Yale-Brain-Mets-Longitudinal(脑转移瘤,TCIA)
- UCSF-ALPTDG(治疗后弥漫性胶质瘤,DOI 10.1148/ryai.230182)
- UCSD-PTGBM(治疗后胶质母细胞瘤,TCIA)
- LUMIERE(纵向胶质母细胞瘤 + RANO,Figshare)
- OASIS-2(神经退行性疾病,oasis-brains.org)
- ADNI(阿尔茨海默病神经影像,adni.loni.usc.edu)
- Vestibular-Schwannoma-MC-RC(前庭神经鞘瘤随访,TCIA)
⚠️ 源 MRI 图像不在此仓库中重新分发,需从官方渠道下载并遵守相应许可协议。
评估模型与关键结果
基准评估了 16 个视觉语言模型,包括闭源的 GPT-4o、GPT-5.2、o4-mini、Gemini-2.5/3 Pro & Flash,以及开源的 Qwen3-VL、Llama-4 Scout/Maverick、InternVL3.5、MedGemma 等。
最佳整体表现:InternVL3.5-Inst 在最终准确率(35.15%)、推理分数(6.68)、TAC(0.800)、Trend-F1(0.631)等多项指标上领先。所有模型在临床关键的变化方向识别任务上普遍表现不佳,最高 Sign Acc 仅为 74.0%。
多视角分析
多视角输入(轴位+冠状位+矢状位)对空间定位有明显提升(最高达 97.3% 的进展定位准确率),但在紧凑型开源模型中会降低时间排序能力(如 Qwen3-VL-8B 下降 8.0 pp,MedGemma-4B 下降 5.8 pp)。所有模型的体积量化准确率均低于 16%。
使用与复现
仓库提供预处理脚本(配准、强度归一化、多视角提取)、评估代码(分步推理生成、表 1 主结果复现、表 2 多视角分析复现),以及安装和 API 密钥配置说明。
联系方式
- 数据集页面:https://github.com/wafaAlghallabi/Time-Aware-MRI
- 主要联系人:Wafa Al Ghallabi — wafa.alghallabi@mbzuai.ac.ae




