遇见数据集

3D-MIR

收藏
arXiv2023-11-23 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

3D-MIR数据集是由微软健康与生命科学团队创建的,专注于3D医学图像检索的基准数据集。该数据集包含281个来自CT扫描的3D图像,涵盖肝脏、肺、胰腺和结肠四个器官系统。数据集的构建过程涉及使用TotalSegmentator模型进行器官分割,并通过OpenAI的GPT模型生成器官病变的详细描述。3D-MIR数据集旨在支持临床决策,通过提供精确的3D图像检索,帮助医生快速找到与特定病例相关的历史病例,从而提高诊断的准确性和效率。

The 3D-MIR dataset was developed by the Microsoft Health & Life Sciences team as a benchmark dataset dedicated to 3D medical image retrieval. It contains 281 3D images sourced from CT scans, covering four organ systems: the liver, lung, pancreas, and colon. The construction of this dataset involved two key processes: first, performing organ segmentation using the TotalSegmentator model, and second, generating detailed descriptions of organ lesions via OpenAI's GPT models. The 3D-MIR dataset aims to support clinical decision-making: by providing precise 3D medical image retrieval, it helps clinicians quickly locate historical cases relevant to specific current cases, thereby improving the accuracy and efficiency of diagnosis.

创建时间:
2023-11-23
搜集汇总
数据集介绍
3D-MIR 数据集图片
构建方式
3D-MIR数据集的构建源于对放射学中三维医学影像检索需求的深刻洞察。研究团队以公开的Medical Segmentation Decathlon(MSD)数据集为基石,精选其中包含肝脏、结肠、胰腺和肺部病灶标注的胸部CT影像,共计281个三维体数据。构建过程分为三个精密的步骤:首先,利用TotalSegmentator多器官分割模型对每个CT体数据进行104个器官的精准分割与索引,生成器官级别的裁剪体数据;其次,通过单连通成分分析从三维标签中分离出每个独立病灶,并量化其与各器官的空间重叠,实现病灶至器官的精确映射;最后,依据美国癌症联合委员会TNM分类标准,提取病灶的数目、长度、体积等形态学指标,并利用GPT-4生成描述性文本,最终形成一个集三维体数据、器官标签、病灶形态度量与自然语言描述于一体的多模态基准数据集。
使用方法
在使用3D-MIR数据集时,研究者可将其划分为训练集与测试集,其中训练集用于构建检索索引,测试集作为查询输入。数据集支持三种主流检索范式的评估:基于二维切片的检索,将每个三维体数据的二维切片通过BiomedCLIP等视觉语言模型编码,构建切片级向量数据库,再通过频次、最大相似度或相似度求和等聚合策略返回三维体数据级别的结果;基于三维体素的检索,通过中位数、平均池化等方法聚合切片嵌入生成体数据级表征,直接进行体数据间的相似性搜索;多模态检索,则利用GPT-4生成的文本描述作为查询,通过对比学习框架匹配切片嵌入,或将文本检索结果与切片检索结果进行集成排序。研究者可依据Precision@k和平均精度等指标,系统比较不同方法在病灶存在性检测与病灶分组识别上的性能差异。
背景与挑战
背景概述
随着医学影像在临床实践中的广泛应用,放射科医师的工作负荷日益加重,如何高效利用海量影像数据辅助诊断成为亟待解决的关键问题。三维医学图像检索技术通过快速定位诊断相似或相关的病例,有望显著减轻医师负担并提升诊断精准度。然而,该领域尚处于萌芽阶段,缺乏统一的评估基准与全面的数据集。2023年,微软健康与生命科学团队的研究人员Ben Abacha等人首次提出了3D-MIR基准数据集,涵盖肝脏、结肠、胰腺和肺部四种解剖结构的CT影像,旨在填补三维医学图像检索领域的研究空白。该数据集通过整合医学分割十项全能(MSD)数据集与TotalSegmentator器官分割模型,系统性地构建了包含病灶形态学标注与文本描述的多模态检索基准,为三维医学图像检索的标准化评估与临床转化奠定了重要基础。
当前挑战
三维医学图像检索面临多重挑战。首先,领域问题层面,现有方法多局限于二维图像检索,难以捕捉三维影像中丰富的空间结构与病灶形态信息,导致检索结果缺乏临床相关性。此外,三维数据体量庞大、尺寸不一,传统二维嵌入技术在处理三维任务时易丢失细粒度特征,如病灶分组与大小分类。其次,数据集构建过程中,三维标注与医学报告生成耗时费力,需依赖公开数据集与开源模型进行病灶定位与形态学量化,但不同器官间的解剖差异与图像分辨率变化显著影响检索性能。当前基础模型虽能识别粗粒度语义(如病灶存在),但在区分病灶大小分组等精细任务上表现欠佳,且尚无单一方法能跨器官一致适用,凸显了三维医学图像检索领域在方法泛化性与细粒度表征上的严峻挑战。
常用场景
经典使用场景
3D-MIR数据集在医学影像检索领域开辟了崭新的评估范式,专注于基于计算机断层扫描(CT)的四类不同解剖结构(肝脏、结肠、胰腺、肺)的三维图像检索。该数据集通过整合器官分割、病灶索引及形态学量化,构建了涵盖病灶标志与病灶分组的精细化标签体系,支持从粗粒度器官级到细粒度病灶级的多层次检索任务。研究者可借助该基准系统性地评估基于2D切片聚合、3D体积嵌入及多模态融合等多种检索策略的性能,为三维医学图像检索领域提供了标准化的实验平台与可复现的对比框架。
解决学术问题
该数据集有效填补了三维医学图像检索领域长期缺乏标准评估基准与综合性数据集的学术空白。传统研究多局限于2D图像检索或逐切片分析,难以捕捉三维影像中病灶的空间分布与形态复杂性。3D-MIR通过引入器官级病灶定位、TNM启发的病灶分组以及多模态语义描述,解决了检索任务中尺度变异性大、三维数据量庞大及评价标准缺失等核心挑战。其意义在于为临床决策支持系统提供了从数据到检索的完整验证链路,推动了三维医学影像智能检索从概念验证向标准化研究的跨越。
实际应用
在实际临床场景中,3D-MIR数据集赋能放射科医生通过自然语言或图像查询快速定位诊断相似的病例,显著降低影像复查的认知负荷与时间成本。例如,医生可输入“肝脏内存在大于5厘米的单个肿瘤”等文本描述,系统即从海量CT数据库中精准检索出匹配的容积影像,辅助鉴别诊断与治疗规划。该数据集支持的检索方法可无缝集成至现有医院影像归档与通信系统(PACS),为放射科工作流注入智能化决策支持能力,最终提升诊断效率与患者预后质量。
数据集最近研究
最新研究方向
当前,三维医学影像检索领域正迎来关键突破,3D-MIR数据集的问世填补了该方向长期缺乏标准化评估基准的空白。该基准涵盖肝脏、结肠、胰腺和肺部四种CT解剖结构,率先将多模态基础模型(如BiomedCLIP)引入三维检索任务,系统比较了基于二维切片聚合、三维体积嵌入及多模态融合等多种检索策略的效能。研究揭示,现有基础模型虽擅长粗粒度病变检测,但在细粒度病变分组(如按大小分类)上仍显不足,而体积式方法在全局分类上优于切片式方法,后者则在捕获细节特征上更具潜力。这一工作不仅为放射科医生提供了从海量影像数据中快速定位相似病例的决策支持工具,更推动了三维医学图像检索从理论走向临床应用的进程,为智能医疗数据管理开辟了新路径。
相关研究论文
  • 1
    3D-MIR: A Benchmark and Empirical Study on 3D Medical Image Retrieval in Radiology微软健康与生命科学 · 2023年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务