遇见数据集

tcga-brca-titan-idc-ilc

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

该数据集是TCGA-BRCA(乳腺浸润癌)全切片图像(.svs格式)的子集,源自TITAN论文(Mahmood Lab)的TCGA-OT数据集。通过筛选project_id == TCGA-BRCA从TITAN原始的三份分割文件(tcga-ot_train.csv、tcga-ot_val.csv、tcga-ot_test.csv)中提取,保留了OncoTreeCode列(包含IDC——浸润性导管癌和ILC——浸润性小叶癌两类),用于BRCA亚型分类(IDC vs ILC)的基准测试。数据来自NIH的基因组数据共享平台(GDC),图像为诊断性切片,访问权限为开放。总共包含1049个slide,其中1046个(99.7%)已成功下载并上传,3个slide因GDC不再提供而无法获取。标签分布:IDC 838个(79.9%),ILC 211个(20.1%)。仓库结构包括labels/(存放已过滤的BRCA标签和分割CSV文件)和svs/(存放.svs文件)。该数据集仅用于非商业学术研究,遵循CC-BY-NC-ND 4.0许可证,使用TITAN的分割和标签时需注明来源,且不得创建衍生作品进行再分发。

This dataset is a subset of TCGA-BRCA (Breast Invasive Carcinoma) whole slide images in .svs format, derived from the TCGA-OT dataset of the TITAN paper (Mahmood Lab). It was extracted by filtering project_id == TCGA-BRCA from the original three split files of TITAN (tcga-ot_train.csv, tcga-ot_val.csv, tcga-ot_test.csv), retaining the OncoTreeCode column (including IDC—Invasive Ductal Carcinoma and ILC—Invasive Lobular Carcinoma) for benchmarking BRCA subtype classification (IDC vs ILC). The data comes from NIHs Genomic Data Commons (GDC) platform, with diagnostic slides and open access. It contains a total of 1049 slides, of which 1046 (99.7%) have been successfully downloaded and uploaded; 3 slides were unavailable due to GDC no longer providing them. Label distribution: IDC 838 (79.9%), ILC 211 (20.1%). The repository structure includes labels/ (containing filtered BRCA labels and split CSV files) and svs/ (containing .svs files). This dataset is intended for non-commercial academic research only, under the CC-BY-NC-ND 4.0 license. When using TITANs splits and labels, proper attribution is required, and no derivative works may be created for redistribution.

创建时间:
2026-08-15
原始信息汇总

数据集概述:tcga-brca-titan-idc-ilc

基本信息

  • 数据集名称:tcga-brca-titan-idc-ilc
  • 来源:TCGA-BRCA(乳腺浸润癌)全切片图像(.svs),从TITAN论文(Mahmood Lab)的TCGA-OT数据集中提取
  • 用途:用于BRCA亚型分类(IDC vs ILC)的基准测试,适用于TITAN、PRISM、GigaPath等slide foundation model

数据筛选与标注

  • 筛选条件:根据project_id == "TCGA-BRCA",从原始数据集的三个分割(tcga-ot_train.csv、tcga-ot_val.csv、tcga-ot_test.csv)中筛选
  • 分类标签:保留OncoTreeCode列,包含两类:IDC(浸润性导管癌)和ILC(浸润性小叶癌)

重要说明

  • 本数据集是从TCGA-OT中提取的BRCA子集(TITAN的46类泛癌分类任务),并非GDC Data Portal中全部TCGA-BRCA队列
  • 幻灯片数量和类别分布与TITAN的splits一致,不代表完整的TCGA-BRCA数据

数据状态

  • 总幻灯片数:1049
  • 成功上传:1046(99.7%)
  • 上传失败:3(0.3%)
  • 待处理:0
  • 管线状态:已完成

类别分布

全部分类标签

  • IDC:838(79.9%)
  • ILC:211(20.1%)

已成功上传部分

  • IDC:835(79.8%)
  • ILC:211(20.2%)

未下载的幻灯片(3张)

slide_id OncoTreeCode split
TCGA-PL-A8LX-01A-01-DX1.9646D69F-A764-4246-9243-67A63006DE96 IDC train
TCGA-PL-A8LV-01A-02-DX2.346FF42B-2363-4B37-8884-12D5F841842C IDC train
TCGA-PL-A8LY-01A-01-DX1.32047D5E-8A42-480A-B2B8-A56B47B949FD IDC val

原因:尝试了所有GDC API查找策略(按UUID、完整barcode、简化barcode、不限制access),均无结果。这些文件可能已被GDC撤销或移除,属数据源限制。

数据来源

  • 图像(.svs):NIH Genomic Data Commons (GDC)——https://portal.gdc.cancer.gov/
    • 筛选条件:project_id=TCGA-BRCA、data_format=SVS、experimental_strategy=Diagnostic Slide、access=open
  • 标签/分割:mahmoodlab/TITAN——https://github.com/mahmoodlab/TITAN(datasets/tcga-ot_{train,val,test}.csv)

许可协议

  • TITAN的splits和标签:CC-BY-NC-ND 4.0(Mahmood Lab),仅限非商业学术研究,需注明来源,禁止分发衍生品
  • TCGA/GDC原始WSI图像:遵循NIH/NCI数据访问政策——https://gdc.cancer.gov/access-data/data-access-processes-and-tools

文件结构

labels/ # 已筛选的BRCA标签/分割CSV(project_id, OncoTreeCode, split) svs/ # .svs文件,命名格式为 <slide_id>.svs progress.json # 可恢复的检查点 README.md

搜集汇总
数据集介绍
tcga-brca-titan-idc-ilc 数据集图片
构建方式
该数据集源自TCGA-BRCA(乳腺浸润癌)项目,从TITAN论文(Mahmood实验室)的TCGA-OT数据集中,依据project_id为TCGA-BRCA进行筛选,并保留原始划分(训练、验证、测试集)及OncoTreeCode双分类标签(IDC与ILC),旨在为全切片基础模型(如TITAN、PRISM、GigaPath)提供乳腺癌亚型分类基准。数据构建过程中,从NIH GDC数据门户下载全切片图像(.svs),遵循公开访问策略,并通过自动化管线完成质量检查与上传,最终成功获取1046张切片,占比99.7%,另有3张因GDC源文件已撤销而缺失,但已穷尽所有检索策略确认非管道逻辑错误。
特点
该数据集的核心特点在于其高度聚焦的亚型分类任务,即浸润性导管癌与浸润性小叶癌的二分类,这一任务对临床预后和治疗决策至关重要。数据集规模为1049张全切片图像,类别分布呈现自然的临床不均衡性(IDC占79.9%,ILC占20.1%),能够真实反映实际病理切片中肿瘤亚型的代表性比例。此外,数据划分源自TITAN框架,保证了与已有基准结果的可比性,且所有图像均来自公开访问的TCGA队列,具有高度的可复现性和研究参考价值。但需注意,该子集并非TCGA-BRCA全量数据,仅涵盖TITAN划分内的样本,这既保证了数据特异性,也限定了其适用范围。
使用方法
使用该数据集时,研究者可直接将`.svs`格式的全切片图像作为输入,配合TITAN、PRISM或GigaPath等基础模型进行特征提取,并根据提供的标签文件(包含OncoTreeCode和数据集划分)进行监督训练或评估。由于类别分布不均衡,建议在训练中采用加权损失函数或数据增强策略以优化模型对ILC类别的识别性能。数据划分明确,便于与TITAN原始结果进行直接对比,亦可用于迁移学习或跨中心验证。需注意,所有图像源自TCGA,其使用需遵循NIH数据使用协议,而标签和划分源自TITAN,其许可证为CC-BY-NC-ND 4.0,仅限于非商业学术研究,且禁止分发衍生作品,使用时应明确标注来源。
背景与挑战
背景概述
TCGA-BRCA-TITAN-IDC-ILC数据集是源自癌症基因组图谱(TCGA)中乳腺浸润癌(BRCA)项目的一个子集,由Mahmood Lab的研究团队基于其TITAN框架构建,于近年发布。该数据集旨在为全切片病理图像(WSI)的基础模型(如TITAN、PRISM、GigaPath)提供针对乳腺癌亚型分类(浸润性导管癌IDC与浸润性小叶癌ILC)的基准测试数据。从TITAN原始多癌种数据集(TCGA-OT)中筛选出TCGA-BRCA项目下的1049张WSI,并保留了其原始分割标签,确保了与TITAN原始实验设置的一致性。该数据集的发布填补了乳腺癌亚型专用基准的空缺,促进了计算病理学领域对乳腺癌亚型识别模型性能的标准化评估,对精准医学和人工智能辅助病理诊断的研究具有重要推动作用。
当前挑战
该数据集所解决的领域问题主要聚焦于乳腺癌亚型的精准分类,尤其是IDC与ILC的区分,这两种亚型在组织学形态上相似但预后和治疗策略不同,对病理诊断和临床决策至关重要。然而,构建过程中面临了诸多挑战:首先,原始TCGA-BRCA数据规模庞大,但TITAN原始分割仅包含其中一部分,如何确保所选子集能代表整体数据且类别分布均衡(当前IDC占79.9%,ILC占20.1%)成为难题;其次,数据获取涉及GDC API的复杂查询和大量文件的下载,尽管绝大多数(99.7%)成功,但仍有3张由于原始访问权限变更而无法获取,凸显了依赖公共数据库的动态性风险;此外,必须严格遵循TITAN的许可协议(CC-BY-NC-ND 4.0)和NIH的数据访问政策,增加了合规性管理的难度。这些挑战为后续类似医学图像数据集的构建提供了宝贵经验。
常用场景
经典使用场景
该数据集聚焦于乳腺浸润性癌的分子病理分型,特别针对导管癌(IDC)与小叶癌(ILC)的二元判别任务。在计算病理学研究中,此类亚型区分对于治疗策略选择及预后评估至关重要。依托TCGA-BRCA队列的全切片图像(WSI),数据集为开发与验证基于弱监督学习的病理切片基础模型(如TITAN、PRISM、GigaPath)提供了标准化的基准测试平台。研究者可借此评估模型在真实临床样本上的特征提取能力与泛化性能,推动全切片图像分析技术在肿瘤亚型精准识别中的落地应用。
实际应用
在实际临床场景中,该数据集可用于辅助病理医生进行乳腺癌亚型的快速初步筛查,尤其在资源有限、缺乏资深病理专家的地区,通过自动化WSI分析模型实现高效且一致的IDC/ILC分类,提升诊断效率与一致性。此外,它支持药物研发中生物标志物探索与预后模型构建,例如关联亚型特异性基因表达与形态学特征,为个体化治疗提供决策依据。此类工具亦可融入数字化病理工作流,作为第二代阅片系统的重要组件,实时提示可疑区域并减少漏诊风险,从而优化医疗资源配置。
衍生相关工作
该数据集的发布推动了多个经典工作的衍生与深化。基于TITAN模型,研究者进一步探索了自监督预训练策略在病理图像领域的应用,如对比学习与掩码自编码器,显著提升了特征表示的质量。后续工作如PRISM集成了多模态数据(基因组与病理图像)以增强亚型分类性能,而GigaPath则聚焦于超大规模WSI的高效处理与推理。这些衍生研究不仅在乳腺癌亚型分类上取得进展,还拓展至其他癌症类型,验证了该数据集作为基准的广泛适应性与促进新算法发展的催化作用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务