遇见数据集

LIDC-IDRI; RIGA; GleasonXAI Harvard Dataverse; MouseTumor; MMIS; MAMA-MIA

收藏
arXiv2026-06-15 更新2026-06-17 收录
官方服务:

资源简介:

该基准套件整合了六个具有真实世界标注噪声的医学图像分割数据集,由德国癌症研究中心等机构联合构建,涵盖胸部CT、视网膜眼底摄影、前列腺组织病理学显微镜、小鼠肿瘤微CT及多器官MR成像等多种模态。数据集包含三维和二维图像,类别数量从单类别到三类别不等,数据噪声源于多标注者变异和自动生成标签,具体表现为轮廓不一致、目标实例缺失或多余以及类别混淆等类型。数据创建过程基于多标注者标注的随机选择来模拟真实噪声环境,同时提供通过多数投票或STAPLE融合生成的干净标签作为参考标准。该数据集主要应用于联邦学习环境下医学图像分割的噪声标签学习研究,旨在系统评估和比较不同联邦噪声标签学习方法在真实临床场景中的鲁棒性和有效性,为方法选择提供决策依据。

This benchmark suite integrates six medical image segmentation datasets with real-world annotation noise, jointly developed by institutions including the German Cancer Research Center and other partners. It covers multiple modalities such as chest CT, retinal fundus photography, prostate histopathological microscopy, mouse tumor micro-CT, and multi-organ MR imaging. The datasets include both 2D and 3D images, with the number of categories ranging from single-class to three-class. The data noise stems from inter-annotator variability and automatically generated labels, manifesting as inconsistent contours, missing or superfluous target instances, category confusion, and other typical issues. The data creation process simulates real-world noise environments through random selection of multi-annotator annotations, while providing clean labels generated via majority voting or STAPLE fusion as reference standards. This dataset is mainly used for noise label learning research on medical image segmentation in federated learning scenarios, aiming to systematically evaluate and compare the robustness and effectiveness of different federated noise label learning methods in real clinical settings, and provide decision-making basis for method selection.

创建时间:
2026-06-15
原始信息汇总

数据集总结:FedSegNoiseBench — 联邦学习下含噪声标签的医学图像分割基准套件

概述

FedSegNoiseBench 是一个为联邦学习(FL)中医学图像分割任务设计的基准测试套件,专门用于评估和比较在真实标签噪声环境下的联邦噪声标签学习(FNLL)方法。该套件结合了多样化的真实噪声医学图像分割数据集、多种客户端噪声场景以及面向噪声的评估体系。

核心目标与贡献

  • 填补标准化基准资源缺失:针对跨机构(cross-silo)医学图像分割中的FNLL问题,提供统一的基准评估平台。
  • 覆盖真实噪声类型:包括轮廓不一致、目标结构缺失/额外、标签混淆等实际出现的分割标签噪声。
  • 方法比较与决策指导:通过系统比较不同FNLL方法(如噪声感知聚合、鲁棒个性化、标签纠正、样本选择等),识别出 FedSelect 为整体最优方法,FedAvg 为有竞争力的基线,并提供了基于标签噪声类型和客户端噪声场景的方法选择指南。

数据集组成

套件包含6个具有固有噪声的真实医学图像分割数据集,每个数据集均提供干净版本(共识或专家标注)噪声版本(随机标注者或自动分割)

数据集 数据类型 标注噪声来源 客户端数量
LIDC 肺部CT 多标注者(随机抽取标注者) 4
RIGA 视网膜图像 多标注者(随机标注者) 3
Gleason 前列腺病理 多标注者(随机标注者) 3
MouseTumor 小鼠肿瘤MRI 多标注者(随机标注者) 5
MMIS 医学图像分割 多标注者(逐标注者) 4
MMIA (MAMA-MIA) 乳腺MRI 自动分割 vs 专家分割 4

客户端噪声场景

基准定义了四种部署相关的客户端噪声场景:

  • Clean:所有客户端都使用干净数据训练(上界)
  • Noisy:所有客户端都使用噪声数据训练,用干净验证集评估
  • Ratio-on-all (ROA):所有客户端混合部分干净、部分噪声数据训练
  • Ratio-of-clients (ROC):部分客户端全干净、部分客户端全噪声训练

使用方法

环境配置

  • 需要Python环境,通过 pip install -r requirements.txt 安装依赖
  • 设置nnU-Net路径变量:nnUNet_rawnnUNet_preprocessednnUNet_results

数据准备

  • 从原始数据源下载各数据集
  • 运行各数据集的 prepare.py 脚本生成nnU-Net格式数据(按客户端和噪声状态划分)
  • 使用 src/data/utils/nnunet_fed_preparation.py 进行联邦适配的规划和预处理

运行实验

通过 src/fed/main.py 运行联邦实验,核心参数包括数据集ID、客户端数、联邦轮数、本地epoch数、训练器以及FNLL方法。

评估与分析

  • 数据噪声分析:多标注者一致性分析、噪声量化
  • 结果评估:使用 bootstrap 方法评估,生成指标箱线图、排名表、稳定性图
  • 统计检验:与 FedAvg 进行配对 Wilcoxon 符号秩检验(Holm-Bonferroni校正)

评估指标

  • Dice:分割重叠度
  • HD95:95%豪斯多夫距离(边界精度)
  • FgBgInstanceF1:前景-背景实例级F1分数
  • ClassConfusion:类别混淆度量

引用说明

待论文 "Federated Medical Image Segmentation under Real-World Label Noise: A Benchmark Suite for Noisy Label Learning Method Selection" 接收后更新引用信息。

代码与资源

  • 代码仓库:https://github.com/MIC-DKFZ/FedSegNoiseBench
  • 所有数据集的原始来源链接均可从README中获取
搜集汇总
数据集介绍
LIDC-IDRI; RIGA; GleasonXAI Harvard Dataverse; MouseTumor; MMIS; MAMA-MIA 数据集图片
构建方式
在医学影像分割领域,真实世界的标签噪声普遍存在,而联邦学习虽能实现多中心协作训练,却面临跨站点标注不一致的挑战。为填补该领域缺乏标准化基准的空白,本研究整合了六个固有真实标签噪声的医学影像分割数据集,包括LIDC-IDRI、RIGA、GleasonXAI Harvard Dataverse、MouseTumor、MMIS和MAMA-MIA。这些数据集覆盖CT、眼底摄影、组织病理学显微镜、micro-CT及MR等多种模态,其噪声来源均为多位标注者之间的标注差异或自动生成标签的缺陷。每个数据集的噪声训练标签通过随机选取单个标注者的标注获得,而干净标签则基于多数投票、STAPLE融合或专家标注生成。数据集被按照临床或技术因素划分为3至5个联邦学习客户端,并设计了四种客户端噪声场景:全部干净、全部噪声、部分客户端完全噪声(roc)以及每个客户端内含部分噪声样本(roa),以模拟现实联邦学习中的异构噪声分布。
使用方法
该套件基于联邦化的nnU-Net框架构建,提供了即插即用的基准测试工具。使用者首先需根据数据集特性配置客户端划分策略,并可从预设的四种客户端噪声场景中选择以模拟不同的联邦噪声分布。随后,可集成本套件已实现的代表性联邦噪声标签学习方法,包括噪声感知聚合(FedA³I)、鲁棒个性化(IOP-FL)、标签纠正(FedCorr)和样本选择(FedSelect),并可与强基线FedAvg进行比较。评价过程采用Dice分数及噪声类型特异性指标,并执行1000次Bootstrap重采样以计算置信区间。此外,套件提供基于统计检验的决策指南,帮助研究者根据观测到的标签噪声类型和客户端噪声场景,选择最合适的联邦噪声标签学习方法。所有代码已开源,并支持便捷地扩展至新数据集与新方法。
背景与挑战
背景概述
在联邦学习框架下,医学图像分割面临着跨站点标签噪声的严峻挑战,而现有研究多依赖合成噪声与简化场景,缺乏对真实世界噪声的系统性评估。为此,Markus Bujotzek等德国癌症研究中心的科研人员于2026年提出了一个包含六个真实标签噪声数据集(LIDC-IDRI、RIGA、GleasonXAI Harvard Dataverse、MouseTumor、MMIS、MAMA-MIA)的基准套件,旨在填补联邦噪声标签学习领域的方法选择空白。该套件整合了来自CT、眼底摄影、组织病理学、微CT及MR等多种模态的数据,覆盖轮廓不一致、目标结构缺失或额外、类别混淆等多样噪声类型,通过构建涵盖干净、噪声、部分噪声等客户端场景的联邦分割框架,为系统性评估联邦噪声标签学习方法提供了标准化平台,对推动联邦学习在医学图像分割中的实际部署具有重要影响力。
当前挑战
该数据集面临的核心挑战在于真实医学图像分割中标签噪声的复杂性与多样性,具体表现为:1)轮廓不一致、目标结构缺失或额外、类别混淆等噪声类型常混合出现,导致模型性能显著下降,且噪声特性因数据集而异,如GleasonHD数据集呈现最严重的异质性噪声,而RIGA以轮廓噪声为主;2)联邦学习环境下,数据分布与标注异质性自然增加,加之隐私保护限制集中式数据审查,使得噪声检测与缓解极为困难,噪声客户端可能通过模型聚合污染全局模型;3)构建过程中需解决多来源数据的一致化预处理、跨模态的nnU-Net自配置、客户端分区合理性(如按制造商或中心划分)以及有效噪声水平的准确估计等问题,确保基准测试的公平性与可复现性。
常用场景
经典使用场景
在医学影像分割领域,LIDC-IDRI、RIGA、GleasonXAI Harvard Dataverse、MouseTumor、MMIS和MAMA-MIA这六大数据集常被联合用作联邦学习环境下真实标签噪声的研究基准。这些数据集涵盖了CT、眼底照相、组织病理学显微镜、微型CT以及多器官MRI等多种模态,其固有的标注差异——包括轮廓不一致、目标遗漏或多余、以及类别混淆——为模拟分布式医疗场景下复杂的标签噪声模式提供了极具代表性的测试床,是评估联邦分割模型鲁棒性的经典材料。
解决学术问题
这些数据集共同解决了现有联邦噪声标签学习研究长期依赖合成噪声、简化场景及单一模态的学术困境。通过提供真实世界多源异构的标签噪声分布,它们使得研究者能够系统性地评估不同联邦学习策略——如噪声感知聚合、鲁棒个性化、标签修正及样本选择——在跨站点的医学图像分割中的表现。这填补了该领域缺乏标准化、可复现且面向真实噪声的评测基准的空白,推动了对实际部署中标签缺陷的深入理解与针对性方法的设计。
实际应用
这些数据集的实际应用紧密围绕临床辅助诊疗系统的部署可靠性展开。在分布式医疗网络中,例如多家医院协作训练肺结节分割(LIDC-IDRI)或视网膜结构分割(RIGA)模型时,数据集提供的真实噪声标签可用来验证联邦学习算法能否抵御不同机构间标注质量的波动。通过基准测试筛选出的鲁棒方法,有助于提升后续治疗规划、定量生物标志物提取等下游任务的精确度,从而在真实医院信息系统中实现安全的、隐私保护下的协作学习。
数据集最近研究
最新研究方向
近年来,随着联邦学习在医学图像分割领域的深入应用,真实世界标签噪声问题成为研究前沿。该基准套件整合了LIDC-IDRI、RIGA、GleasonXAI Harvard Dataverse、MouseTumor、MMIS和MAMA-MIA等六个具有内在真实标签噪声的医学图像分割数据集,旨在系统评估联邦噪声标签学习方法。研究揭示了真实标注噪声常以轮廓不一致、目标遗漏或多余以及类别混淆等形态单独或组合出现。通过引入多样化的客户端噪声场景和噪声定向评估指标,该工作不仅识别出FedSelect作为表现最优的联邦噪声标签学习策略,还提供了依据噪声类型和场景选择合适方法的实用决策指南,为联邦医学图像分割在真实部署中的稳健性研究奠定了可复用的基准基础。
相关研究论文
  • 1
    Federated Medical Image Segmentation under Real-World Label Noise: A Benchmark Suite for Noisy Label Learning Method Selection德国癌症研究中心·医学图像计算部门; 海德堡大学医学院; 海德堡大学·模式分析与学习小组; 海德堡大学·数学与计算机科学学院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务