遇见数据集

TCGA_OncoTree_pt2

收藏
Hugging Face2026-08-14 更新2026-08-15 收录
官方服务:

资源简介:

TCGA-OncoTree (TCGA-OT) 是一个用于组织病理学图像分类的数据集,包含来自 TCGA(癌症基因组图谱)的 11,186 张全切片图像(WSI)。这些图像以 SVS 格式从 NCI GDC 开放访问获取,均为诊断切片。数据集的标签和训练/验证/测试分割源自 mahmoodlab/TITAN 论文(Ding et al., Nature Medicine, 2025),该论文提出了多模态全切片基础模型。由于单次上传限制,数据集被分为两个 HuggingFace 仓库,本仓库为第二部分(Part 2)。仓库中的 progress.json 文件记录了所有 11,186 张幻灯片的唯一标识符(UUID)及其所在仓库位置,用于合并两部分数据。该数据集适用于组织病理学图像分类、癌症类型识别等任务,也可用于开发全切片图像的基础模型。许可证方面,WSI 图像遵循 GDC 数据使用政策(开放访问,非商业用途),标签和分割遵循 TITAN 原始仓库的 CC-BY-NC-ND 许可。

TCGA-OncoTree (TCGA-OT) is a dataset for histopathological image classification, containing 11,186 whole slide images (WSI) from TCGA (The Cancer Genome Atlas). These images are obtained in SVS format from NCI GDC open access, all of which are diagnostic slides. The labels and training/validation/test splits of the dataset originate from the mahmoodlab/TITAN paper (Ding et al., Nature Medicine, 2025), which proposed a multimodal whole-slide foundation model. Due to single upload limits, the dataset is split into two HuggingFace repositories, with this repository being Part 2. The progress.json file in the repository records the unique identifiers (UUIDs) of all 11,186 slides and their repository locations, used to merge the two parts. This dataset is suitable for tasks such as histopathological image classification and cancer type recognition, as well as for developing foundation models for whole-slide images. Regarding licenses, the WSI images follow the GDC Data Use Policy (open access, non-commercial use), while the labels and splits follow the CC-BY-NC-ND license of the original TITAN repository.

创建时间:
2026-08-14
原始信息汇总

TCGA-OncoTree (TCGA-OT) — Part 2 数据集概述

基本信息

  • 数据集名称:TCGA-OncoTree (TCGA-OT) — Part 2
  • 许可证:other(自定义许可证)
  • 任务类型:图像分类
  • 标签:组织病理学、全切片成像、病理学、TCGA、OncoTree
  • 数据集托管方:ento3686(HuggingFace 账号)

数据集简介

该数据集是 TCGA-OT 数据集的第二部分(共两部分),属于跨账号拆分存储方案。由于第一部分存储于 Account 1(tuna2004/TCGA_OncoTree),在存储容量不足后,剩余部分被拆分并上传至当前 Account 2 账号中。

关键管理文件

progress.json(核心元数据)

  • 该文件是整个 TCGA-OT 数据集(全部 11,186 张切片)的唯一真值来源,不仅限于当前账号上传的部分。
  • 文件格式为 JSON,包含两个字段:
    • uploaded:记录已上传切片的 slide_id 及其对应的仓库 ID
    • missing_uuid:记录未在 GDC 中找到 UUID 的切片

合并说明

合并两部分的正确操作方式是:同时克隆两个仓库,将 svs/ 目录通过符号链接(symlink)合并,并依据 progress.json 中的 repo_id 字段确定每个 .svs 文件的来源仓库。

数据统计

数据统计以下列指标为主体:

指标 说明
总切片数 原始分割中的全部切片数量
上传成功总数 已成功下载并上传的切片总数
Account 1 贡献数 属于 tuna2004/TCGA_OncoTree 的切片数
Account 2 贡献数 属于当前账号的切片数
缺失 UUID 数 无法在 GDC 上找到的切片数
未处理数 剩余尚未处理的切片数

数据来源

切片图像

  • 来源于 TCGA(The Cancer Genome Atlas)项目
  • 通过 NCI GDC 开放访问获取
  • 文件格式为 SVS
  • 实验策略为诊断切片(Diagnostic Slide)

标签与分割

  • 来源于 mahmoodlab/TITAN 仓库
  • 参考文献:Ding, T., Wagner, S.J., Song, A.H., Chen, R.J., et al. "Multimodal Whole Slide Foundation Model for Pathology", Nature Medicine, 2025
  • DOI:10.1038/s41591-025-03982-3

许可证信息

  • 标签/分割数据:遵循 TITAN 原始仓库的许可证(CC-BY-NC-ND)
  • WSI 图像:遵循 GDC 数据使用政策(开放访问,非商业用途)
搜集汇总
数据集介绍
TCGA_OncoTree_pt2 数据集图片
构建方式
TCGA_OncoTree_pt2 数据集是基于 TCGA 计划中全切片图像(WSI)构建的病理学图像分类数据集,其构建依据 OncoTree 肿瘤分类体系进行标签划分。原始 WSI 图像源自 NCI GDC 数据库的开放访问数据,格式为 SVS,仅纳入诊断切片。数据集的划分和标签遵循 mahmoodlab 团队在 TITAN 项目中提出的标准,其成果发表于 Nature Medicine。该数据集作为 TCGA-OncoTree 的第二部分,存储于独立的 HuggingFace 仓库中,与第一部分共同构成完整的 11,186 张切片集合。构建过程包含从 GDC 下载、基于 UUID 匹配以及分账户上传的流程,并维护一份中央 progress.json 文件以记录所有切片的存储位置与状态,确保数据可追溯和可整合。
特点
该数据集的核心特点在于其高度组织化与完整性。它包含了 11,186 张全切片图像,每张图像均配备基于 OncoTree 的精确肿瘤类型标签,适用于多分类任务。数据集分两部分存储,通过 progress.json 中央清单文件统一管理,该文件记录了每个切片所属的仓库 ID,使得跨账户的数据合并和符号链接操作变得可行。此外,数据集严格遵循 TCGA 和 TITAN 的规范,确保图像质量与标签准确性。其开放访问特性与详细的统计信息(如上传成功数、缺失 UUID 数)为研究者提供了透明的数据状态,便于评估数据覆盖面并规划下游实验。
使用方法
使用者可通过 HuggingFace 平台获取该数据集,并结合第一部分(tuna2004/TCGA_OncoTree)实现完整的数据集访问。推荐的方法是利用仓库中的 progress.json 文件作为权威参考,通过编写脚本读取该 JSON,依据记录中的 repo_id 字段,采用符号链接(symlink)方式将分布于两个账户的 SVS 文件整合至统一目录。随后,可基于 TITAN 提供的原始划分进行模型训练、验证和测试。对于图像分类任务,应使用 WSI 处理工具(如 CLAM、HIPT)提取特征,或直接利用 TITAN 预训练模型进行微调。需注意遵守许可协议,标签部分受 CC-BY-NC-ND 限制,WSI 图像遵循 GDC 政策,均禁止商业用途。
背景与挑战
背景概述
TCGA_OncoTree_pt2数据集是TCGA-OncoTree(TCGA-OT)项目的一部分,由研究人员于2025年基于《Nature Medicine》中TITAN模型的研究成果创建。该数据集整合了来自癌症基因组图谱(TCGA)的11,186张全切片图像(WSI),并依据OncoTree分类体系进行标注,旨在推动多模态病理学基础模型的发展。其核心研究问题在于利用大规模、标准化的病理图像数据,提升深度学习模型在癌症诊断与预后预测中的泛化能力。作为TCGA-OT的第二部分,该数据集填补了先前存储容量的缺口,为计算病理学领域提供了宝贵的开放式资源,对后续研究具有重要的支撑作用。
当前挑战
该数据集面临的挑战涵盖领域问题与构建过程两个维度。在领域层面,全切片图像的高分辨率与复杂性对模型的特征提取和计算效率提出了严苛要求,同时不同癌症类型间的形态学相似性增加了分类的难度,亟需多模态融合策略以提升诊断准确性。在构建过程中,数据收集需克服TCGA与GDC平台间的UUID匹配问题,部分切片缺失或上传失败导致数据不完整;跨账号存储与合并需依赖精细的进度追踪机制,确保11,186张切片的完整性与可追溯性。此外,非商业使用许可和伦理合规性也限制了数据的广泛传播与应用。
常用场景
经典使用场景
TCGA_OncoTree_pt2数据集作为TCGA-OncoTree(TCGA-OT)整体资源的一部分,专为计算病理学与全切片图像(WSI)分析而构建,其核心用途在于支撑基于弱监督学习的癌症亚型分类与生存预测任务。该数据集汇集了来自TCGA项目的大量诊断级SVS格式切片,并依据OncoTree标准赋予精细的肿瘤类型标签,使研究者得以在真实临床样本上训练和评估多实例学习(MIL)模型。典型应用涵盖跨癌种的泛化性验证、形态学特征与分子亚型的关联分析,以及预训练病理基础模型的微调与基准测试,为组织病理图像的自动化解读提供了标准化的大规模数据基础。
衍生相关工作
围绕TCGA-OncoTree数据集衍生了一系列在病理基础模型与多模态学习领域具有重要影响的工作。其中最引人注目的是Mahmood实验室TITAN模型的提出,该模型利用此类大规模WSI数据进行自监督预训练,开创了跨癌种、多模态融合的新范式。随后,诸多研究以其为基准,比较不同特征提取器(如基于ResNet或Vision Transformer的编码器)在弱监督任务中的表现,并催生了若干用于高效处理超大规模切片的采样与聚合技术。此外,该数据集还支撑了可解释性分析研究,旨在揭示模型决策依据的形态学特征,并推动了将病理图像与基因组、转录组数据整合的联合建模框架的演进,为精准病理学的持续发展注入了动力。
数据集最近研究
最新研究方向
当前,数字病理学与计算病理学正迈向多模态融合与基础模型驱动的新纪元,TCGA-OncoTree(TCGA-OT)数据集的第二部分应运而生,其基于TCGA全切片图像(WSI)与OncoTree分类体系,为跨癌种的组织病理学图像分类提供了大规模、标准化基准。该数据集与Mahmood实验室TITAN模型紧密关联,后者作为多模态WSI基础模型,在Nature Medicine上的发表标志着病理学人工智能从任务特定模型向通用型预训练范式的转变。TCGA-OT的发布不仅补全了TCGA资源在开源可及性上的缺口,更推动了WSI级别的弱监督学习、自监督表示学习以及多癌种泛化能力的研究浪潮,其影响延伸至临床诊断辅助、生物标志物发现和精准医学决策,成为连接病理图像与基因组学、临床结局的桥梁性资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务