WSI_Embedding
收藏资源简介:
WSI_Embedding 是一个用于全切片图像(Whole-Slide Images, WSI)特征提取的数据集,包含经过预训练的patch和slide级别嵌入向量,以及生成这些嵌入的完整运行记录。该数据集不包含原始WSI图像文件,仅提供从多个公开数据集(如DHMC-LUAD、TCGA-LUAD)中提取的嵌入结果,涵盖多种主流病理学基础模型(如TITAN、CONCH v1.5/v1、Virchow、PRISM、KEEP、MUSK、WSI-LLaVA等)。数据集规模在1,000到10,000个样本之间,每个子数据集包含不同模型在特定放大倍数(如20×)和patch尺寸(如512×512、224×224等)下的嵌入张量(.h5/.pt格式)以及WSI-LLaVA的caption文件。此外,还包括运行信息(如作业日志、验证指标、SLURM记录、质量控制数据、轮廓和缩略图等),便于追溯嵌入生成过程。该数据集适用于病理图像的特征提取、表示学习、模型评估等任务,研究人员可根据需要选择性下载特定子集或模型嵌入。
WSI_Embedding is a dataset for feature extraction from Whole-Slide Images (WSI), containing pre-trained patch-level and slide-level embedding vectors, along with complete run records for generating these embeddings. The dataset does not include original WSI image files, but only provides embedding results extracted from multiple public datasets (such as DHMC-LUAD, TCGA-LUAD), covering a variety of mainstream pathology foundation models (e.g., TITAN, CONCH v1.5/v1, Virchow, PRISM, KEEP, MUSK, WSI-LLaVA, etc.). The dataset size ranges from 1,000 to 10,000 samples, with each subset containing embedding tensors (.h5/.pt format) under specific magnifications (e.g., 20×) and patch sizes (e.g., 512×512, 224×224) from different models, as well as caption files from WSI-LLaVA. Additionally, it includes run information (such as job logs, validation metrics, SLURM records, quality control data, contours and thumbnails, etc.) to facilitate tracing of the embedding generation process. This dataset is suitable for tasks such as pathological image feature extraction, representation learning, and model evaluation. Researchers can selectively download specific subsets or model embeddings as needed.
数据集概述
WSI_Embedding 是一个用于全切片图像(Whole-Slide Images, WSI)的补丁和切片嵌入(embedding)数据集,同时包含生成这些嵌入时使用的运行记录。原始WSI文件不包含在本数据集中。
数据集目录结构
数据集采用分层目录组织,主要包含以下四个部分:
| 路径 | 内容 | 适用场景 |
|---|---|---|
embeddings/<dataset>/<model>/<mag>x_<patch>px_<overlap>px_overlap/ |
编码器张量(.h5 / .pt / WSI-LLaVA json)及TRIDENT配置和日志 |
需要特征数据时 |
Run-Information/runs-report/<dataset>/ |
作业日志、验证信息、SLURM、性能数据、TRIDENT运行记录、队列CSV | 需要数据溯源时 |
Run-Information/prep/<dataset>/ |
轮廓、geojson、缩略图、切片状态、补丁坐标h5、叠加jpg | 需要质量控制或失败掩码证据时 |
Run-Information/parked/<dataset>/ |
被排除在官方队列之外的切片编码文件 | 需要查看被搁置病例时 |
支持选择性下载,例如仅拉取 embeddings/DHMC-LUAD/titan/... 或 Run-Information/prep/TCGA-LUAD。
子数据集详情
1. DHMC-LUAD(编码队列143例)
该数据集包含两个HPC作业目录,并非重复运行:
DHMC-LUAD:规范的共享坐标及后续编码器(Virchow、PRISM、KEEP、MUSK、WSI-LLaVA、PRISM2等)DHMC-LUAD-TITAN-CONCH:最初的编码器包,包含TITAN和CONCH v1.5 / v1(20×/512分辨率)
包含的编码器有:TITAN 768、CONCH v1.5 768、CONCH v1 512、Virchow 2560、PRISM 1280、Virchow2 2560、Virchow2 CLS 1280、PRISM2、KEEP 768、MUSK 1024维视觉CLS、WSI-LLaVA描述及病例库。
2. TCGA-LUAD(编码队列531例)
包含531张诊断切片,排除了10个TCGA-05 DX1病例(因GDC画布过小和组织掩码失败)。被排除的10个病例不在embeddings/张量中,但其切片状态、缩略图、轮廓和坐标保留在Run-Information/prep/TCGA-LUAD/中以便检查失败原因。
3. TCGA-LUSC
尚未包含在当前的Run-Information快照中,预处理仍在进行,编码器张量尚未发布。
标准放大倍数和补丁尺寸
| 模型 | 设置 |
|---|---|
| TITAN, CONCH v1.5, CONCH v1, WSI-LLaVA | 20× / 512 |
| PRISM, Virchow, Virchow2, Virchow2 CLS, PRISM2 | 20× / 224 |
| KEEP | 20× / 256 |
| MUSK | 20× / 384 |
下载方式
可使用Hugging Face CLI进行选择性下载,例如仅下载单个模型的张量,或仅下载QC/日志文件。
明确不包含的内容
- 原始全切片图像(
.svs/.tif) - HPC上的
runs-information/full-int-*/features_*目录(相关张量已在embeddings/下,避免重复上传) - TCGA-LUSC的运行快照(分割和坐标生成尚未完成)




