遇见数据集

CAMELYON17

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

CAMELYON17数据集是第二届CAMELYON病理学挑战赛的核心数据,旨在评估和推动乳腺癌淋巴结转移的自动检测与分类算法。该任务具有高度临床相关性,传统上依赖病理学家对全切片图像进行显微镜评估,而自动化方案有望减轻病理学家工作负担并降低诊断主观性。数据集包含来自荷兰5个医疗中心(Radboud大学医学中心、Canisius-Wilhelmina医院、乌得勒支大学医学中心、Rijnstate医院、Oost-Nederland病理实验室)的1000张全切片图像(WSI),格式为TIFF。数据分为训练集和测试集,每个中心在两个集合中各包含20个患者。患者pN分期和切片级标签存储在stages.csv文件中。此外,从每个中心选取10张切片进行详尽标注,标注以XML格式提供,兼容ASAP软件,包含“Tumor”(肿瘤区域)和“Exclusion”(非肿瘤区域,从肿瘤标注中切割出的区域)两组标注。掩膜文件覆盖50张标注WSI和50张随机阴性WSI,掩膜中像素值1表示正常组织,2表示肿瘤区域(正常组织自动检测自参考方法,可能存在误差;肿瘤区域由标注多边形转换而来)。数据中有一张图像(patient_103_node_1.tif)因文件损坏被替换为来自同一淋巴结且转移类别相同的新图像。所有文件均提供MD5校验和以确保完整性,并附带许可文件。

The CAMELYON17 dataset is the core data of the second CAMELYON pathology challenge, aiming to evaluate and promote automatic detection and classification algorithms for breast cancer lymph node metastasis. This task is highly clinically relevant, as it traditionally relies on pathologists microscopic evaluation of whole-slide images, while automated solutions are expected to reduce pathologists workload and diagnostic subjectivity. The dataset consists of 1,000 whole-slide images (WSIs) in TIFF format from five medical centers in the Netherlands (Radboud University Medical Center, Canisius-Wilhelmina Hospital, University Medical Center Utrecht, Rijnstate Hospital, and Pathologisch Laboratorium Oost-Nederland). The data is divided into a training set and a test set, with each center contributing 20 patients to each set. Patient pN stage and slide-level labels are stored in the stages.csv file. Additionally, 10 slides from each center are exhaustively annotated, with annotations provided in XML format compatible with ASAP software, containing two groups: Tumor (tumor regions) and Exclusion (non-tumor regions cut out from tumor annotations). Mask files cover 50 annotated WSIs and 50 random negative WSIs, with pixel values of 1 indicating normal tissue and 2 indicating tumor regions (normal tissue is automatically detected from a reference method, which may have errors; tumor regions are converted from annotated polygons). One image (patient_103_node_1.tif) was replaced due to file corruption with a new image from the same lymph node and the same metastasis category. All files are provided with MD5 checksums to ensure integrity, along with a license file.

创建时间:
2026-09-02
原始信息汇总

CAMELYON17 数据集概述

1. 总体概览

CAMELYON17 是一个医学图像相关的数据集,包含 1156 条记录/幻灯片(slide)。该数据集主要用于淋巴结转移检测相关任务,包含图像、掩膜、注释等多种类型的数据文件。

2. 存储结构

数据集存储于 okbro1234/CAMELYON17 仓库中,主要包含以下内容:

  • README.md:说明文件
  • annotations/:XML 格式的注释文件(如 patient_004_node_4.xml 等),共 50 个文件

数据结构中还包括 imagesmasks 子文件夹以及 evaluation 相关文件,完整文件清单见 manifest 文件。

3. 数据清单(Manifest)及字段

数据清单包含 5 个字段,均无缺失值:

字段 数据类型 缺失值数量
key 对象 0
rel_path 对象 0
subfolder 对象 0
file_size 整数 0
last_modified 对象 0

4. 分类标签

根据 subfolder 字段的数据分布如下:

类别 记录数 占比
images 1000 86.51%
masks 100 8.65%
annotations 50 4.33%
(root) 4 0.35%
evaluation 2 0.17%

5. 局限性与注意事项

  • 数据类别分布存在严重不平衡:images 类占比高达 86.51%,而其他类别占比很低,可能影响模型训练效果或数据分析的公正性。
搜集汇总
数据集介绍
CAMELYON17 数据集图片
构建方式
CAMELYON17数据集源自CAMELYON17挑战赛,旨在推动淋巴结转移自动检测技术的发展。该数据集通过收集多个医疗中心的全切片图像(WSI)及其对应的像素级标注,构建了一个多中心、多病例的病理图像资源库。数据集中包含1156个记录,涵盖images、masks、annotations及evaluation等子文件夹,其中images切片占主导地位。所有切片均经过标准化存储,并附有详细的元数据清单,确保数据的可追溯性和可复现性。该数据集的构建过程严格遵循医学研究伦理和隐私保护规范,为病理图像分析算法的训练与验证提供了坚实的数据基础。
特点
CAMELYON17数据集的一大特点是其多中心来源和丰富的数据类型。从存储结构看,数据被划分为若干类别,其中images类记录有1000个,占比高达86.51%,而masks和annotations分别包含100个和50个,此外还有额外的evaluation文件,这种分布体现了数据集的不平衡性,但同时也为研究域适应和类别不平衡问题提供了独特的研究素材。数据集中包含的注释(annotations)文件格式为XML,为每个病例提供节点级的详细标注,支持细粒度的模型评估。该数据集的另一个显著特征是规模适中且包含多样化的组织切片,能够模拟真实临床场景中的分布偏移,是检验算法泛化能力的理想平台。
使用方法
使用CAMELYON17数据集时,研究者可通过HuggingFace平台直接下载资源库。推荐使用`snapshot_download`方法克隆整个仓库,或采用`load_dataset`接口加载数据集,以便快速接入现有的数据管道。在模型开发中,用户应根据任务需求选择合适的数据子集:分类任务可优先使用images文件夹下的全切片图像,像素级分割任务则需结合masks和annotations使用。由于数据存在轻度不平衡,建议在训练时采用加权采样或数据增强等策略进行应对。数据集的详细文件索引和存储结构可在README或manifest.csv中查询,方便用户灵活构建训练集和测试集,确保实验结果的可靠性和公平性。
背景与挑战
背景概述
CAMELYON17数据集诞生于2017年,由荷兰内梅亨大学医学中心等机构的研究人员构建,旨在推动癌症转移检测的自动化进程。该数据集基于前版CAMELYON16扩展而来,聚焦于全切片图像(WSI)中淋巴结微转移的检测与分类,为病理图像分析领域提供了标准化的评估基准。其核心研究问题在于探索如何利用深度学习模型实现高精度的肿瘤区域识别与患者级别诊断,从而辅助临床病理决策。自发布以来,CAMELYON17已成为计算病理学领域的重要参考数据集,广泛用于算法开发与性能评测,对推动人工智能在医学影像中的应用具有深远影响力。
当前挑战
该领域面临的首要挑战在于全切片图像分辨率极高、组织形态复杂,致使肿瘤与正常组织的视觉特征高度相似,尤其微转移灶的识别极具困难,且数据集存在显著的类别不平衡。构建过程中,团队需处理来自多个医疗中心的大规模数字化切片,协调不同扫描仪的色彩与分辨率差异,并确保病理学家的标注具有一致性。同时,数据存储与传输开销庞大,对计算资源要求严苛,加之部分珍贵切片需克服法律与伦理审查,构建工作颇具挑战。此外,评估还需兼顾像素级别与患者级别的性能,进一步增加了任务复杂度。
常用场景
经典使用场景
CAMELYON17数据集是计算病理学领域用于淋巴结转移检测的权威基准,其核心任务为基于全切片图像(WSI)进行有无转移的分类。在经典使用场景中,研究者利用该数据集训练和评估弱监督学习模型,因WSI尺寸庞大且仅有切片级标签,模型需通过多实例学习(MIL)或伪标签生成等策略,实现对像素级或区域级病变的定位与判别。该数据集覆盖多家医疗中心的数据,支持跨域泛化性能的评测,是验证算法鲁棒性的标准测试平台,也是推动病理图像分析技术从传统特征工程向端到端深度学习范式转变的关键数据支撑。
解决学术问题
该数据集针对癌症诊断中淋巴结转移筛查这一重要临床问题,解决了传统人工阅片耗时费力且主观性强等痛点,为自动化检测算法的研发提供了大规模、带标注的WSI资源。学术研究上,它推动了弱监督深度学习在医学影像领域的理论发展,例如如何有效利用切片级标签训练高精度模型、处理类别极度不平衡问题、以及应对多中心数据分布漂移等,显著促进了领域泛化(domain generalization)和域适应(domain adaptation)相关研究方向,为构建可信赖的辅助诊断系统提供了严谨的评测标准和可复现的实验环境,其提出的评估协议已成为后续众多研究引用的基线。
衍生相关工作
CAMELYON17衍生出一系列重要研究:其伴随的CAMELYON16挑战赛相关技术如基于注意力机制的MIL框架(如ABMIL)被广泛沿用至该数据集变体;后续经典工作包括利用知识蒸馏与自蒸馏方法压缩模型规模、以OOD检测应对未知医院数据,以及采用对比学习增强特征表示等。挑战赛官方结果分析和多篇论文(如EinscNet、CLAM等后起之秀)都常以CAMELYON17作为域迁移场景下的实验场,催生了诸如BreaKHis与CAMELYON17之间的跨数据测试,以及联邦学习隐私保护训练等新研究方向,为领域内算法演进提供了不竭动力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务