遇见数据集

MRareBench

收藏
github2026-08-31 更新2026-09-01 收录
数据链接:
官方服务:

资源简介:

MRareBench是一个多模态基准数据集,用于评估多模态大语言模型在弱先验临床环境下对罕见疾病的诊断能力和患者特异性视觉证据的定位能力。该数据集包含两个互补的评估任务:前向诊断(T1)和证据验证(T2),覆盖多种医学成像模态,如放射学、病理学、皮肤病学、眼科学等,每个病例包含多张医学图像。

创建时间:
2026-08-31
原始信息汇总

MRareBench 数据集概述

数据集简介

MRareBench 是一个面向罕见病的多模态基准数据集,用于评估多模态大语言模型(MLLMs)在弱先验临床场景下的表现。该数据集的核心研究问题是:模型能否将患者特定的视觉证据与罕见病诊断对应起来。

数据集规模

  • T1·前向诊断(Forward Diagnosis):300 个病例,涵盖 FD / LC / TO 三种条件,共 900 个输入
  • T2·证据验证(Evidence Verification):608 个项目,涵盖 Grd / Rec / NoDx 三种条件,共 1,824 个输入
  • 总计:908 个发布项目,2,724 个项目-条件输入

任务设计

T1·前向诊断

  • 输入:临床上下文 + 多张医学图像
  • 输出:排名前十的罕见病鉴别诊断
  • 评价指标:Recall@1/3/5/10、MRR

T2·证据验证

  • 输入:指定诊断 + 临床上下文 + 多张医学图像
  • 输出:符合评分标准的可见证据
  • 评价指标:分层必需证据召回率(Hierarchical required-evidence recall)

数据特点

  • 多模态覆盖:涵盖病理显微、CT、MRI、超声、放射摄影、皮肤病学和眼科学等多种影像与检查模态
  • 多图像证据:每个发布项目包含至少两张医学图像,体现跨视图、时间点和模态的分布式证据
  • 证据-诊断对应:将排名诊断与证据验证配对,共同评估模型在相同来源病例上的预测与视觉证据一致性

构建流程

数据集基于 PubMed Central(PMC)病例报告构建,采用可追溯的九阶段流水线,包含三个层面:

  1. 来源接地:结构化提取、疾病角色标注、任务构建、ORPHA 标准化
  2. 多模态完整性:图像证据价值过滤、诊断遮蔽、文本-图像泄漏控制、图表链接修复
  3. 质量控制:基于来源的判定、人工验证、确定性过滤、冻结发布清单

主要结果

  • 最佳图像接地诊断:T1 LC Recall@1 达 54.7%
  • 最佳诊断证据评分:T2 全层级召回率达 80.5%
  • 图像对 T1 的贡献:LC 比 TO 高出 11.5 / 5.8 / 5.0 分(分别对应闭源/开源/医学模型)
  • 诊断条件对 T2 的影响:平均 Level-1 增益 24.7 分,全部 37 个模型均呈正向
  • 证据-诊断对应:仅 26.3% 的 T2 阳性模型-病例对同时拥有正确的 T1 Top-1 诊断

模型评估

共评估 37 个多模态大语言模型,分为三个队列:14 个闭源模型、13 个开源通用模型、10 个医学专用模型。所有模型均在相同的受控证据视图下进行评估。实验表明,移除图像后全部 37 个模型的证据报告能力均下降(闭源模型队列平均下降 45.5 分,开源模型 26.6 分,医学模型 15.1 分)。

获取方式

数据集已发布在 Hugging Face 平台上,可通过以下链接获取:
https://huggingface.co/datasets/junzhin/MRareBench

搜集汇总
数据集介绍
MRareBench 数据集图片
构建方式
MRareBench基准的构建依托于PubMed Central上的真实病例报告,通过一条可追溯的九阶段流水线精细打磨而成。该流程整合了三个核心层:首先,通过结构化抽取、疾病角色标注、任务构造及ORPHA标准化,确保源数据的医学严谨性;其次,进行多模态完整性控制,包括图像证据价值筛选、诊断遮蔽、文本-图像泄漏抑制及图像链接修复,以保障数据纯净;最后,实施基于源头的评判、人工核验、确定性过滤和冻结发布清单,确保最终数据集的高质量与可复现性。整个流程从原始报告出发,最终产出300个T1案例与608个T2项目,为罕见病多模态评估奠定了坚实的数据基础。
特点
MRareBench的鲜明特色在于其针对罕见病设计的弱先验临床评估环境。每个发布条目均包含多幅医学图像,覆盖病理、CT、MRI、超声、放射、皮肤及眼科等广泛模态,且刻意避免单一权威图像,以模拟临床中证据分散于不同视图、时间点或模态的真实情境。基准通过双轨设计(T1正向诊断与T2证据验证)协同评估模型的推理能力:T1要求模型基于临床上下文与图像给出排名前十的鉴别诊断,T2则固定诊断,要求模型识别支持该诊断的可视证据。这一设计不仅考察诊断准确性,更强调诊断与患者特异性视觉证据之间的对应关系,填补了现有基准忽视证据归因的空白。
使用方法
使用者可通过Hugging Face平台获取完整数据集,并借助VLMEvalKit工具包进行标准化评估。评估体系涵盖37个多模态大语言模型,分为闭源、开源通用及医学专用三个群体。T1任务采用Recall@1/3/5/10、平均倒数排名等指标量化诊断排序质量;T2任务采用分层必需证据召回率,优先评分可见发现,其次考虑跨图像关系与诊断归因。此外,基准还提供跨轨对应指标,用于衡量同时满足T2证据阈值且T1 Top-1诊断正确的案例比例,从而全面解析模型在证据-诊断一致性方面的表现。研究者可依据这些指标,在统一受控条件下对比不同模型的临床推理能力。
背景与挑战
背景概述
MRareBench是一个面向罕见疾病的多模态基准测试,由junzhin等研究人员创建,旨在评估多模态大语言模型在弱先验临床环境中的表现。该基准测试基于PubMed Central的真实病例报告,构建了包含908个发布条目的数据集,覆盖放射学、病理学、皮肤科和眼科等多种影像模态。其核心研究问题是模型能否将患者特定的视觉证据与罕见疾病诊断对应起来,通过T1前向诊断和T2证据验证两个互补任务,衡量诊断预测与视觉证据的一致性。MRareBench的发布填补了罕见疾病多模态评估的空白,推动了多模态模型在长尾疾病诊断中的研究,对临床AI领域具有重要影响力。
当前挑战
MRareBench面临的挑战包括:罕见疾病本身个体稀疏,视觉证据分布广泛且复杂,多图像证据可能跨越不同视图、时间点和模态,要求模型具备整合多源信息的能力。构建过程中,需从真实病例报告中提取结构化数据,进行疾病角色标注、ORPHA标准化及图像证据过滤,同时严格控制文本-图像泄漏,确保评估的纯净性。此外,模型需在不依赖常见疾病先验知识的情况下,仅凭视觉证据进行诊断,而当前最佳模型在T1任务中的Recall@1仅为54.7%,表明多模态模型在罕见疾病诊断与证据验证的对应关系上仍存在显著不足,证据与诊断的一致性率仅为26.3%,凸显了该领域的挑战性。
常用场景
经典使用场景
MRareBench作为一项多模态罕见病基准,其核心应用场景在于严格评估多模态大语言模型(MLLMs)在弱先验临床情境下的诊断性能。该基准通过双轨设计(T1前向诊断与T2证据验证),要求模型不仅要从临床上下文和多种医学图像中给出排序的鉴别诊断,还需在指定诊断下,从图像中提取可见的支撑性证据。这一场景模拟了真实罕见病诊疗中医师面对的复杂信息整合任务,尤其强调跨模态、跨视图的证据关联能力。
解决学术问题
该数据集解决了罕见病研究领域中一个关键学术难题:现有医学视觉语言基准多聚焦于常见病,难以评估模型对长尾疾病的泛化能力,且通常仅衡量诊断准确性,忽视了诊断与视觉证据之间的对应关系。MRareBench通过引入多图像证据、证据-诊断联动评估,以及严格的质量控制流程,填补了多模态模型在罕见病证据归因能力评估上的空白,为量化模型在图像贡献、诊断条件化效应及证据-诊断一致性方面提供了标准化范式。
衍生相关工作
MRareBench的发布催生了多项后续研究。其一,其双轨评估框架被用于改进多模态模型的可解释性训练策略,如引入证据对齐损失。其二,基于其T2证据验证任务,衍生出面向医学图像证据抽取的专用模型和提示方法。其三,其构建管线启发了一系列半自动医学基准生成工具,用于低成本扩展其他罕见病种。此外,该基准与VLMEvalKit的集成促进了医学多模态评测工具链的标准化,为后续跨数据集比较提供了基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务