LIDC-IDRI; RIGA; GleasonXAI Harvard Dataverse; MouseTumor; MMIS; MAMA-MIA
收藏资源简介:
该基准套件整合了六个具有真实世界标注噪声的医学图像分割数据集,由德国癌症研究中心等机构联合构建,涵盖胸部CT、视网膜眼底摄影、前列腺组织病理学显微镜、小鼠肿瘤微CT及多器官MR成像等多种模态。数据集包含三维和二维图像,类别数量从单类别到三类别不等,数据噪声源于多标注者变异和自动生成标签,具体表现为轮廓不一致、目标实例缺失或多余以及类别混淆等类型。数据创建过程基于多标注者标注的随机选择来模拟真实噪声环境,同时提供通过多数投票或STAPLE融合生成的干净标签作为参考标准。该数据集主要应用于联邦学习环境下医学图像分割的噪声标签学习研究,旨在系统评估和比较不同联邦噪声标签学习方法在真实临床场景中的鲁棒性和有效性,为方法选择提供决策依据。
This benchmark suite integrates six medical image segmentation datasets with real-world annotation noise, jointly developed by institutions including the German Cancer Research Center and other partners. It covers multiple modalities such as chest CT, retinal fundus photography, prostate histopathological microscopy, mouse tumor micro-CT, and multi-organ MR imaging. The datasets include both 2D and 3D images, with the number of categories ranging from single-class to three-class. The data noise stems from inter-annotator variability and automatically generated labels, manifesting as inconsistent contours, missing or superfluous target instances, category confusion, and other typical issues. The data creation process simulates real-world noise environments through random selection of multi-annotator annotations, while providing clean labels generated via majority voting or STAPLE fusion as reference standards. This dataset is mainly used for noise label learning research on medical image segmentation in federated learning scenarios, aiming to systematically evaluate and compare the robustness and effectiveness of different federated noise label learning methods in real clinical settings, and provide decision-making basis for method selection.
数据集总结:FedSegNoiseBench — 联邦学习下含噪声标签的医学图像分割基准套件
概述
FedSegNoiseBench 是一个为联邦学习(FL)中医学图像分割任务设计的基准测试套件,专门用于评估和比较在真实标签噪声环境下的联邦噪声标签学习(FNLL)方法。该套件结合了多样化的真实噪声医学图像分割数据集、多种客户端噪声场景以及面向噪声的评估体系。
核心目标与贡献
- 填补标准化基准资源缺失:针对跨机构(cross-silo)医学图像分割中的FNLL问题,提供统一的基准评估平台。
- 覆盖真实噪声类型:包括轮廓不一致、目标结构缺失/额外、标签混淆等实际出现的分割标签噪声。
- 方法比较与决策指导:通过系统比较不同FNLL方法(如噪声感知聚合、鲁棒个性化、标签纠正、样本选择等),识别出 FedSelect 为整体最优方法,FedAvg 为有竞争力的基线,并提供了基于标签噪声类型和客户端噪声场景的方法选择指南。
数据集组成
套件包含6个具有固有噪声的真实医学图像分割数据集,每个数据集均提供干净版本(共识或专家标注)和噪声版本(随机标注者或自动分割):
| 数据集 | 数据类型 | 标注噪声来源 | 客户端数量 |
|---|---|---|---|
| LIDC | 肺部CT | 多标注者(随机抽取标注者) | 4 |
| RIGA | 视网膜图像 | 多标注者(随机标注者) | 3 |
| Gleason | 前列腺病理 | 多标注者(随机标注者) | 3 |
| MouseTumor | 小鼠肿瘤MRI | 多标注者(随机标注者) | 5 |
| MMIS | 医学图像分割 | 多标注者(逐标注者) | 4 |
| MMIA (MAMA-MIA) | 乳腺MRI | 自动分割 vs 专家分割 | 4 |
客户端噪声场景
基准定义了四种部署相关的客户端噪声场景:
- Clean:所有客户端都使用干净数据训练(上界)
- Noisy:所有客户端都使用噪声数据训练,用干净验证集评估
- Ratio-on-all (ROA):所有客户端混合部分干净、部分噪声数据训练
- Ratio-of-clients (ROC):部分客户端全干净、部分客户端全噪声训练
使用方法
环境配置
- 需要Python环境,通过
pip install -r requirements.txt安装依赖 - 设置nnU-Net路径变量:
nnUNet_raw、nnUNet_preprocessed、nnUNet_results
数据准备
- 从原始数据源下载各数据集
- 运行各数据集的
prepare.py脚本生成nnU-Net格式数据(按客户端和噪声状态划分) - 使用
src/data/utils/nnunet_fed_preparation.py进行联邦适配的规划和预处理
运行实验
通过 src/fed/main.py 运行联邦实验,核心参数包括数据集ID、客户端数、联邦轮数、本地epoch数、训练器以及FNLL方法。
评估与分析
- 数据噪声分析:多标注者一致性分析、噪声量化
- 结果评估:使用 bootstrap 方法评估,生成指标箱线图、排名表、稳定性图
- 统计检验:与 FedAvg 进行配对 Wilcoxon 符号秩检验(Holm-Bonferroni校正)
评估指标
- Dice:分割重叠度
- HD95:95%豪斯多夫距离(边界精度)
- FgBgInstanceF1:前景-背景实例级F1分数
- ClassConfusion:类别混淆度量
引用说明
待论文 "Federated Medical Image Segmentation under Real-World Label Noise: A Benchmark Suite for Noisy Label Learning Method Selection" 接收后更新引用信息。
代码与资源
- 代码仓库:https://github.com/MIC-DKFZ/FedSegNoiseBench
- 所有数据集的原始来源链接均可从README中获取

- 1Federated Medical Image Segmentation under Real-World Label Noise: A Benchmark Suite for Noisy Label Learning Method Selection德国癌症研究中心·医学图像计算部门; 海德堡大学医学院; 海德堡大学·模式分析与学习小组; 海德堡大学·数学与计算机科学学院 · 2026年



