TITAN
收藏资源简介:
TITAN是一个多模态全切片基础模型,预训练使用了335,645个全切片图像(WSIs)和423,122个合成字幕,这些数据集来自内部收集的多种病例,包括肿瘤、感染和炎症病例。此外,TITAN还利用了超过182,000个病理报告和由PathChat生成的合成字幕。
TITAN is a multimodal whole-slide foundation model, which was pre-trained with 335,645 whole-slide images (WSIs) and 423,122 synthetic captions sourced from internally collected diverse clinical cases including tumors, infections and inflammatory conditions. Additionally, TITAN also leverages over 182,000 pathological reports and synthetic captions generated by PathChat.
TITAN-preview
数据集概述
数据集名称
TITAN
数据集类型
多模态全切片病理基础模型
数据集描述
TITAN是一个多模态全切片病理基础模型,通过视觉自监督学习和视觉-语言对齐进行预训练。它利用了335,645张全切片图像(WSIs)和182,000份病理报告,以及由PathChat生成的423,122条合成字幕。TITAN的切片嵌入在多种下游任务中表现出色,包括线性探测、少样本和零样本分类、罕见癌症检索、跨模态检索和病理报告生成。
数据集来源
- 全切片图像(WSIs):来自Mass General Brigham的内部收集的肿瘤、感染和炎症病例。
- 病理报告:182,000份。
- 合成字幕:由PathChat生成,共423,122条。
数据集用途
TITAN旨在提取通用切片表示并生成病理报告,适用于资源有限的临床场景,如罕见疾病检索和癌症预后。
数据集更新
- 12/02/2024: TITAN预印本和模型权重(TITAN-preview和CONCHv1.5)已发布。TCGA-OT数据集的拆分可在
./datasets中获取。
数据集下载
模型权重和数据集特征可通过Hugging Face模型页面获取。
数据集示例
提供了多个演示笔记本,展示了TITAN的能力,包括:
- 从补丁嵌入中提取切片嵌入。
- 单切片和TCGA-OT数据集上的零样本分类。
- TCGA-OT数据集的切片嵌入的线性探测评估。
数据集比较
TITAN在多种任务中表现优于其他模型,具体结果参见论文。
数据集许可证
该模型和相关代码根据CC-BY-NC-ND 4.0许可证发布,仅可用于非商业学术研究目的。




