遇见数据集

Angelou0516/UPENN-GBM

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

宾夕法尼亚大学胶质母细胞瘤(UPenn-GBM)队列:包含新诊断胶质母细胞瘤患者的结构性多参数磁共振成像(mpMRI)数据及肿瘤亚区分割标签。这是来自TCIA的NIfTI格式发布版本——图像已去除颅骨并共同配准到SRI24图谱,分割标签与之对齐。

University of Pennsylvania Glioblastoma (UPenn-GBM) Cohort: contains structural multi-parametric magnetic resonance imaging (mpMRI) data and tumor sub-region segmentation labels from patients with newly diagnosed glioblastoma. This is a NIfTI-format released version sourced from The Cancer Imaging Archive (TCIA): the images have been skull-stripped and co-registered to the SRI24 atlas, with the segmentation labels aligned correspondingly.

提供机构:
Angelou0516
搜集汇总
数据集介绍
Angelou0516/UPENN-GBM 数据集图片
构建方式
该数据集源自宾夕法尼亚大学胶质母细胞瘤(UPenn-GBM)队列,聚焦于新诊断GBM患者的结构性多参数MRI(mpMRI)数据及其肿瘤亚区分割掩膜。数据来自TCIA的NIfTI版本,所有图像均已进行去颅骨处理并配准至SRI24图谱空间,体素尺寸为1 mm等距,分辨率为240×240×155。数据集包含671次结构扫描(对应630名患者,含21次随访),提供两类分割掩膜:147例经委员会认证神经放射科医师手动修正的专家标注(推荐金标准),以及611例基于多种顶尖深度学习模型集成的自动分割结果。此外,60次随访扫描仅有图像数据。HuggingFace镜像仅包含结构MRI序列与分割掩膜,完整DICOM数据需从TCIA获取。
特点
数据集遵循BraTS标签规范,背景为0,坏死/非增强肿瘤核心为1,瘤周水肿/浸润组织为2,增强肿瘤为4,并据此定义全肿瘤(WT=1+2+4)、肿瘤核心(TC=1+4)和增强肿瘤(ET=4)评估区域。所有图像与掩膜共享完全一致的坐标网格,无需重采样或轴置换即可直接对齐。推荐的金标准策略是优先使用手动标注掩膜,若无则回退至自动分割掩膜。数据集还包含临床与基因组元数据文件(CSV格式)及清单JSON文件,后者记录每次扫描的四种模态路径、掩膜可用性及最终金标准来源,极大简化了加载流程。
使用方法
使用时,用户可根据清单JSON文件确定每次扫描的金标准掩膜路径,直接加载T1、T1-Gd、T2和FLAIR四个模态的NIfTI图像,并对应读取同一空间下的分割掩膜。由于图像与掩膜尺寸及空间位置完全一致,可将其堆叠为多通道输入(BraTS风格)用于深度学习模型训练。数据集已按手动标注、自动分割和无分割掩膜分为三个子集,可通过HuggingFace的`load_dataset`接口直接加载配置。对于需要完整临床信息或原始DICOM数据的场景,应访问TCIA官方合集并引用相关论文。
背景与挑战
背景概述
脑胶质母细胞瘤作为成人中枢神经系统最具侵袭性的恶性肿瘤,其异质性高、预后极差的临床特点使得精准的医学影像分析成为诊疗关键。UPenn-GBM数据集由宾夕法尼亚大学Spyridon Bakas团队于2022年创建,基于癌症影像档案库(TCIA)发布,旨在为多参数磁共振成像(mpMRI)下的胶质母细胞瘤亚区分割提供标准化基准。该数据集收录了630名患者的671次结构性扫描,涵盖T1、T1增强、T2及T2-FLAIR四种模态,并采用BraTS共识标签体系对肿瘤坏死区、水肿区和增强区进行标注。其核心研究问题在于弥合自动化分割算法与专家临床判断之间的鸿沟,为脑肿瘤分割模型提供大规模、高质量的训练与评估素材,已被广泛引用于医学影像分析及深度学习领域的相关研究。
当前挑战
该数据集所解决的领域问题聚焦于多模态脑肿瘤分割的临床困境:胶质母细胞瘤病灶边界模糊、亚区结构复杂且个体间差异显著,传统手工标注耗时且主观性强,亟需自动化模型实现精准亚区分割。在构建过程中,团队面临两大挑战:其一,数据标准化难题,需将来自多中心、不同扫描协议的原始DICOM影像进行颅骨剥离、SRI24空间配准及各向同性重采样,以保证图像几何一致性;其二,高质量标注获取,全手动专家标注仅覆盖147例扫描(占总数的21.9%),其余611例依赖顶尖深度学习模型集成融合(STAPLE)生成的自动标注,虽经专家校正但仍为弱标注标准,手动标注与自动标注间的质量差异对模型鲁棒性提出了严苛考验。
常用场景
经典使用场景
在神经肿瘤学与医学影像分析的交叉领域,UPENN-GBM数据集作为针对新诊断胶质母细胞瘤患者的多参数MRI结构影像与肿瘤亚区分割金标准,已成为评估和训练深度学习分割模型的经典基准。该数据集包含671次结构扫描,涵盖T1、T1增强、T2及FLAIR四种模态,所有图像均已去颅骨并配准至SRI24标准空间,形成240×240×155各向同性体素网格。其核心使用场景在于多类脑肿瘤亚区分割任务,依据BraTS国际协作标准,将肿瘤区域精细划分为坏死/非增强核心、瘤周水肿及强化肿瘤三类,并进一步聚合为全肿瘤、肿瘤核心和强化肿瘤三个评估指标。研究者依托其中147例由认证神经放射科医师手工校正的高质量分割标签进行模型训练与验证,1520例自动分割作为补充弱标注数据,形成了一套层次清晰、规模适中的实验设计范式。
解决学术问题
该数据集旨在回应胶质母细胞瘤影像分割研究中长期存在的两大核心困境:一是在临床实践中,肿瘤边界的精确界定依赖于专家手工勾画,耗时费力且主观性强,亟需自动化工具的辅助;二是现有公开数据集多为标注数量有限或模态单一,难以支撑稳健深度学习模型的训练与泛化能力验证。UPENN-GBM通过提供147例专家校正的手工分割金标准与611例基于BraTS顶级算法集成(DeepMedic、DeepSCAN、nnU-Net)的自动标注,构建了兼具高质量与大规模的双层标注体系,使研究者能在监督学习、半监督学习及伪标签优化等方向展开系统性探索。此数据集的发布显著推动了脑肿瘤影像组学与深度学习技术的交叉融合,为胶质母细胞瘤的术前无创评估、治疗反应监测及预后预测研究奠定了坚实的影像学基础。
衍生相关工作
UPENN-GBM数据集的发布催生了一系列具有代表性的后续研究工作。在方法学层面,该数据集被广泛应用于验证基于Transformer架构(如Swin UNETR、UNETR)与卷积神经网络(如nnU-Net、DeepMedic)的脑肿瘤分割性能对比。在数据增强策略上,研究者基于该数据集的四模态结构影像,探索了跨模态合成与多任务学习框架,显著提升了标注数据匮乏场景下的分割鲁棒性。在临床关联分析方面,围绕该数据集衍生了肿瘤影像组学特征与生存期预测、IDH基因分型及复发模式挖掘等主题的论文,部分工作已发表在《Scientific Data》、《Neuro-Oncology》及《IEEE Transactions on Medical Imaging》等顶级期刊。此外,数据集的双层标注结构启发了弱监督与伪标签校正技术的研究,推动了半监督分割方法在医学影像领域的创新突破。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务