遇见数据集

GLI-AL (BraTS-GLI Anatomy-Lesion)

收藏
arXiv2026-07-24 更新2026-07-28 收录
官方服务:

资源简介:

GLI-AL是一个基于BraTS 2023-GLI训练队列构建的多模态脑胶质瘤MRI标注资源,由西安交通大学研究团队开发,旨在解决原始数据集中未系统标注共存白质高信号的问题。该资源包含1251个四模态MRI案例的统一八类解剖-病变标签,总体积达15.1亿体素,其中新增病变体素220万,数据来源于BraTS挑战赛的受控访问数据。创建过程通过专家标注与自动工具融合,建立了包含394例净化子集和857例扩展子集的分层结构。该资源主要应用于医学图像联合分割研究,支持在统一标签空间中同时监督健康脑组织与病变结构,有效缓解标签噪声对模型训练的干扰,并促进脑肿瘤MRI分析的可靠性和可重复性评估。

GLI-AL is a multi-modal glioma MRI annotated resource constructed based on the BraTS 2023-GLI training cohort, developed by the research team from Xi'an Jiaotong University. It aims to address the issue that coexistent white matter hyperintensities were not systematically annotated in the original dataset. This resource contains unified eight-category anatomical-lesion labels for 1251 four-modal MRI cases, with a total volume of 1.51 billion voxels, including 2.2 million newly added lesion voxels. The data is sourced from the controlled-access data of the BraTS Challenge. The creation process fuses expert annotation with automatic tools, and establishes a hierarchical structure consisting of 394 purified subsets and 857 expanded subsets. This resource is mainly applied to medical image joint segmentation research, supporting simultaneous supervision of healthy brain tissue and lesion structures in a unified label space, effectively alleviating the interference of label noise on model training, and promoting the reliability and reproducibility evaluation of brain tumor MRI analysis.

创建时间:
2026-07-24
搜集汇总
数据集介绍
GLI-AL (BraTS-GLI Anatomy-Lesion) 数据集图片
构建方式
GLI-AL数据集基于BraTS 2023-GLI训练队列构建,针对成人胶质瘤MRI中未被标注的白质高信号(WMH)共病异常问题。首先,利用Rudie等人提供的285例专家WMH标注,训练MedNeXt模型进行五折交叉验证,筛选出394例纯净子集(含52例专家阴性及342例模型阴性病例),并对116例阳性病例进行图像修复。其次,对剩余的857例扩展子集,融合DeepWMH与LST-AI工具的预测交集,形成统一的病变标签。最后,采用TumorSynth对四模态MRI生成概率图,经四分位距离群检测与熵加权融合,生成涵盖6类健康脑组织及1类病变的统一八分类标注。
特点
该数据集的核心特点在于首次在BraTS框架内实现了健康组织与病变区域的联合标注,共包含1251套四模态MRI的衍生标签(1367个NIfTI文件)。其创新性体现在三点:一是通过纯净/扩展子集分层,明确区分不同来源的标注噪声;二是引入图像修复标签(116例),支持WMH病变的分离研究;三是提供详尽的元数据记录(包括标注来源、质量控制状态、SHA-256校验码等),确保每例标注的可追溯性。与原始BraTS标注相比,新增15.1亿体素的前景标签(占释放前景的92.7%),其中857例包含额外的共病病变约束。
使用方法
使用该数据集需首先通过Synapse平台获取上游BraTS 2023-GLI影像数据访问权限,再申请GLI-AL衍生标签的受控访问。标签已与原始影像保持空间对齐(SRI24模板、1mm³分辨率),无需额外配准。研究人员可直接加载NIfTI文件,利用八分类编码(0-7分别对应背景、皮层灰质、基底节、白质、病变、脑室、小脑、脑干)进行联合分割训练。推荐使用T1与FLAIR模态输入,结合MedNeXt或nnUNet框架开展实验。通过元数据标识符可区分纯净子集与扩展子集,支持标签噪声敏感性分析及分层评估设计。
背景与挑战
背景概述
GLI-AL(BraTS-GLI Anatomy-Lesion)数据集由西安交通大学的向星宇、郝爽、王帆、马建华和廉春峰等研究人员于2026年提出,旨在解决脑胶质瘤MRI分割中一个长期被忽视的问题:现有BraTS-GLI数据集仅标注肿瘤亚区域,而对共存的脑白质高信号(WMH)等异常未予系统标注,导致联合分割任务中模型将病理区域视为正常组织,引入了标签噪声。该数据集基于BraTS 2023-GLI训练队列,构建了统一的八类解剖-病变标签,覆盖1251例多模态MRI病例,并区分为394例纯化子集和857例扩展子集,提供可追溯的标签来源和质量控制元数据。GLI-AL的发布为脑肿瘤MRI联合分割、标签噪声分析和可重复评估提供了重要基准,有力推动了医学图像分割领域的发展。
当前挑战
GLI-AL数据集所应对的核心挑战在于,原有BraTS-GLI任务定义仅聚焦肿瘤分割,未纳入共存的WMH等异常,导致联合分割中模型将病理区域误判为正常脑组织,产生标签噪声。构建过程中面临多重困难:首先,需要从1251例病例中识别并分层WMH阴性样本,借助专家注释和模型筛选构建纯化子集;其次,为扩展子集补充病变约束时,需融合DeepWMH和LST-AI等自动工具的预测结果,以降低假阳性风险;此外,健康组织标签需通过TumorSynth在四种模态上生成概率图,并经熵加权融合和异常检测后得到,确保解剖结构的准确性。最后,所有标签需经过严格的质量控制,包括病例级性能记录和文件完整性校验,以保障数据资源的可信度和可复现性。
常用场景
经典使用场景
GLI-AL数据集的核心应用场景在于为脑胶质瘤MRI分割任务提供统一的解剖-病灶联合标签空间,使得健康脑组织(如皮质灰质、白质、基底节等)与肿瘤病灶及共存的脑白质高信号(WMH)可在同一标注框架下协同建模。研究者可利用该数据集训练单一模型同时完成脑组织解剖结构分割与多类型病灶分割,而无需在多个独立标签系统间切换。特别地,该资源支持对含未标注WMH的原始BraTS-GLI数据进行标签噪声感知的训练与评估,从而揭示隐性共病病灶对模型性能的影响机制。
解决学术问题
该数据集系统性地解决了脑胶质瘤MRI分割中因未标注共病WMH导致的标签噪声问题。在传统BraTS-GLI数据中,仅标注肿瘤亚区域,而对WMH等常见共病变异不作任何标记,导致在联合分割训练时模型将这些病理区域误判为正常组织。GLI-AL通过构建包含纯净子集与扩展子集的层级化标签体系,为学术界提供了可控的标签噪声分析平台。研究者可据此量化标签噪声对解剖结构分割保真度与病灶检出敏感性的影响,并探索数据清洗策略与鲁棒学习方法的有效性,推动了医学影像中弱监督与噪声标签研究方向的发展。
衍生相关工作
GLI-AL数据集的发布催生了多项衍生研究工作。在方法论层面,基于该资源发展了标签噪声感知的联合分割框架,如利用纯净子集进行预训练再微调的Two-stage训练策略,以及基于熵加权的多模态概率融合算法以提升解剖结构预测的置信度。在工具层面,该数据集促进了TumorSynth等自动解剖标注工具在胶质瘤场景下的适配与验证,并推动了DeepWMH、LST-AI等WMH分割软件在共病场景中的联合评估。此外,该资源为BRATS相关挑战赛提供了新的基准范式,启发了后续工作对多种脑部病变(如微出血、腔隙性梗死)进行系统性标签扩展的研究方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务