MerlinPlus
收藏数据链接:
官方服务:
资源简介:
Merlin Plus是首个大规模公开的CT数据集,包含放射科医生标注的肿瘤掩膜,覆盖9个器官(脾脏、膀胱、胆囊、胃、十二指肠、前列腺、肾上腺、食管和子宫),在Stanford Merlin数据集基础上增加了1,153个逐体素肿瘤掩膜。
Merlin Plus is the first large-scale public computed tomography (CT) dataset containing radiologist-annotated tumor masks covering 9 organs: the spleen, bladder, gallbladder, stomach, duodenum, prostate, adrenal gland, esophagus, and uterus. It adds 1,153 voxel-wise tumor masks based on the Stanford Merlin dataset.
创建时间:
2026-06-26
原始信息汇总
数据集概述:MerlinPlus
该数据集(MerlinPlus)与一篇 MICCAI 2026 论文相关联,旨在推动多肿瘤早期检测的人工智能研究。数据集由多个部分组成,部分已发布,部分待发布。
已发布内容
- AI制作的器官分割掩码:用于训练 R-Super 模型。该部分数据已发布,托管在 Hugging Face 平台。
- 地址:https://huggingface.co/datasets/AbdomenAtlas/MerlinPlus
- 纵向元数据:包含去标识化的患者 ID 和检查日期,支持识别同一患者的多次 CT 扫描并计算检查间隔,适用于纵向模型训练与评估。此外,还提供了以下信息:
- 去标识化的患者年龄、种族、性别
- 扫描仪制造商和型号
- CT 体素间距、对比剂状态、对比剂相位
- kVp、X 射线管电流
- 该元数据以 CSV 文件(
merlin_longitudinal_metadata.csv)形式发布在此代码仓库中。
即将发布内容
- 放射科医生制作的肿瘤分割掩码:计划在未来发布。
引用信息
使用该数据集或相关代码时,需引用以下两篇论文:
- Bassi et al., "Scaling Artificial Intelligence for Multi-Tumor Early Detection with More Reports, Fewer Masks", arXiv 2025.
- Blankemeier & Kumar et al., "Merlin: a computed tomography vision-language foundation model and dataset", Nature 2026. DOI: 10.1038/s41586-026-10181-8.
致谢
该工作得到了 McGovern 基金会和 Lustgarten 胰腺癌研究基金会的支持。论文内容受待审批专利保护。
搜集汇总
数据集介绍

构建方式
MerlinPlus数据集是对先前Merlin数据集的扩展与深化,其构建聚焦于多维度医学影像信息的整合。该数据集包含由人工智能生成的全器官分割掩码,这些掩码用于训练R-Super模型,目前已发布于Hugging Face平台。此外,数据集提供了详尽的纵向元数据,涵盖去标识化的患者ID与检查日期,从而能够追踪同一患者的多次CT扫描并计算时间间隔,支持对疾病演化过程的纵向建模。数据集还囊括了放射科医生标注的肿瘤分割掩码,尽管这部分数据尚在准备中。整体来看,MerlinPlus通过整合合成掩码、结构化元数据和专业标注,形成了多层次的数据体系。
特点
MerlinPlus的显著特点在于其纵向数据能力与丰富的临床元数据。通过提供去标识化的患者身份和检查日期,研究者能够识别同一患者的多次扫描记录,从而构建时序分析模型,这在肿瘤早期检测研究中尤为珍贵。元数据还包含了患者年龄、种族、性别、扫描仪型号、CT体素间距、对比剂状态与期相、千伏峰值及X射线管电流等参数,为模型训练中的协变量控制与域适应提供了关键信息。数据集同时提供AI生成的器官分割与未来将发布的专家肿瘤标注,这种混合标注策略兼顾了规模化生产与诊断精度。
使用方法
使用MerlinPlus数据集时,研究者可直接从Hugging Face下载AI生成的器官分割掩码,并配合本仓库提供的merlin_longitudinal_metadata.csv文件进行实验。该元数据文件支持通过患者ID构建纵向样本序列,并可结合检查日期计算不同时间点的扫描间隔,适用于训练时序预测模型或评估跨时段变化。对于需要肿瘤分割标注的任务,可等待放射科医生标注数据的后续发布。数据使用须遵循相关引用规范,引用包括Bassi等人关于多肿瘤早期检测的论文与Blankemeier等人关于Merlin基础模型的Nature文章。
背景与挑战
背景概述
MerlinPlus数据集由斯坦福大学等机构的研究人员于2025年创建,是Merlin数据集的扩展版本,旨在推动医学影像人工智能在早期多肿瘤检测领域的发展。该数据集的核心研究问题在于如何通过更少的标注数据实现更精准的多肿瘤检测,其发布的人工智能生成器官分割掩码及纵向元数据,为模型训练与评估提供了关键支持。MerlinPlus通过提供去标识化的患者年龄、种族、性别、扫描设备参数等丰富信息,突破了传统数据集在纵向研究中的局限,对推动多肿瘤早期筛查与精准医疗具有重要影响力。
当前挑战
MerlinPlus数据集面临的挑战包括:在领域问题层面,多肿瘤早期检测需从大量正常组织中识别微小病灶,现有算法对低对比度、异质性肿瘤的敏感性与特异性不足;纵向数据的引入虽支持时序分析,但跨时间点的图像配准与病变演化建模仍是难题。构建过程中,数据集需整合多中心、多设备来源的CT扫描,面临数据标注一致性维护、去隐私化处理与伦理合规等挑战。此外,放射科医生制作的肿瘤分割掩码尚未发布,标注成本高昂且需保证标注质量,这限制了数据集的规模化扩展与应用验证。
常用场景
经典使用场景
MerlinPlus数据集在医学影像人工智能领域具有里程碑式的意义,它被广泛用于训练和评估面向腹部CT影像的器官分割与肿瘤检测模型。研究者依托该数据集提供的AI生成的器官分割掩码,可以高效地对多类腹部器官(如肝脏、肾脏、胰腺等)进行像素级定位与形态学分析。这一场景的核心价值在于其大规模、高质量的标注资源,使得深度学习模型能够在复杂的解剖结构间实现精准的边界划分,为后续的疾病诊断和手术规划奠定坚实的基础。
解决学术问题
该数据集巧妙地解决了医学影像领域长期面临的两个核心学术困境:标注数据匮乏与患者隐私保护。传统上,获取放射科医生手工标注的大规模三维CT数据集成本高昂且耗时,而MerlinPlus通过AI算法生成器官分割掩码,大幅降低了数据构建门槛。同时,其提供的去标识化纵向元数据(包括患者ID、检查日期、年龄、种族、扫描参数等)支持跨时间点的模型训练与评估,有效解决了疾病进展分析、治疗效果追踪等动态医学问题中的数据可追溯性与隐私安全的冲突,推动了可复现的纵向研究范式。
衍生相关工作
MerlinPlus数据集的发布催生了一系列具有影响力的衍生研究工作,推动了医学影像AI领域的理论创新。例如,研究者基于其提供的AI掩码与放射科医生标注的肿瘤掩码,探索了弱监督学习与自训练范式,提出了诸如R-Super等高效训练框架,在减少手工标注需求的同时提升了肿瘤检测的敏感性。此外,结合其丰富的纵向元数据,衍生了针对时间序列建模的Transformer架构和对比学习算法,用于预测疾病进展风险。这些工作不仅验证了数据集的质量,也为未来开发通用型腹部CT基础模型奠定了技术与方法论基础。
以上内容由遇见数据集搜集并总结生成




