遇见数据集

WSI_Embedding

收藏
Hugging Face2026-08-24 更新2026-08-25 收录
官方服务:

资源简介:

WSI_Embedding 是一个用于全切片图像(Whole-Slide Images, WSI)特征提取的数据集,包含经过预训练的patch和slide级别嵌入向量,以及生成这些嵌入的完整运行记录。该数据集不包含原始WSI图像文件,仅提供从多个公开数据集(如DHMC-LUAD、TCGA-LUAD)中提取的嵌入结果,涵盖多种主流病理学基础模型(如TITAN、CONCH v1.5/v1、Virchow、PRISM、KEEP、MUSK、WSI-LLaVA等)。数据集规模在1,000到10,000个样本之间,每个子数据集包含不同模型在特定放大倍数(如20×)和patch尺寸(如512×512、224×224等)下的嵌入张量(.h5/.pt格式)以及WSI-LLaVA的caption文件。此外,还包括运行信息(如作业日志、验证指标、SLURM记录、质量控制数据、轮廓和缩略图等),便于追溯嵌入生成过程。该数据集适用于病理图像的特征提取、表示学习、模型评估等任务,研究人员可根据需要选择性下载特定子集或模型嵌入。

WSI_Embedding is a dataset for feature extraction from Whole-Slide Images (WSI), containing pre-trained patch-level and slide-level embedding vectors, along with complete run records for generating these embeddings. The dataset does not include original WSI image files, but only provides embedding results extracted from multiple public datasets (such as DHMC-LUAD, TCGA-LUAD), covering a variety of mainstream pathology foundation models (e.g., TITAN, CONCH v1.5/v1, Virchow, PRISM, KEEP, MUSK, WSI-LLaVA, etc.). The dataset size ranges from 1,000 to 10,000 samples, with each subset containing embedding tensors (.h5/.pt format) under specific magnifications (e.g., 20×) and patch sizes (e.g., 512×512, 224×224) from different models, as well as caption files from WSI-LLaVA. Additionally, it includes run information (such as job logs, validation metrics, SLURM records, quality control data, contours and thumbnails, etc.) to facilitate tracing of the embedding generation process. This dataset is suitable for tasks such as pathological image feature extraction, representation learning, and model evaluation. Researchers can selectively download specific subsets or model embeddings as needed.

创建时间:
2026-08-23
原始信息汇总

数据集概述

WSI_Embedding 是一个用于全切片图像(Whole-Slide Images, WSI)的补丁和切片嵌入(embedding)数据集,同时包含生成这些嵌入时使用的运行记录。原始WSI文件不包含在本数据集中。

数据集目录结构

数据集采用分层目录组织,主要包含以下四个部分:

路径 内容 适用场景
embeddings/<dataset>/<model>/<mag>x_<patch>px_<overlap>px_overlap/ 编码器张量(.h5 / .pt / WSI-LLaVA json)及TRIDENT配置和日志 需要特征数据时
Run-Information/runs-report/<dataset>/ 作业日志、验证信息、SLURM、性能数据、TRIDENT运行记录、队列CSV 需要数据溯源时
Run-Information/prep/<dataset>/ 轮廓、geojson、缩略图、切片状态、补丁坐标h5、叠加jpg 需要质量控制或失败掩码证据时
Run-Information/parked/<dataset>/ 被排除在官方队列之外的切片编码文件 需要查看被搁置病例时

支持选择性下载,例如仅拉取 embeddings/DHMC-LUAD/titan/...Run-Information/prep/TCGA-LUAD

子数据集详情

1. DHMC-LUAD(编码队列143例)

该数据集包含两个HPC作业目录,并非重复运行:

  • DHMC-LUAD:规范的共享坐标及后续编码器(Virchow、PRISM、KEEP、MUSK、WSI-LLaVA、PRISM2等)
  • DHMC-LUAD-TITAN-CONCH:最初的编码器包,包含TITAN和CONCH v1.5 / v1(20×/512分辨率)

包含的编码器有:TITAN 768、CONCH v1.5 768、CONCH v1 512、Virchow 2560、PRISM 1280、Virchow2 2560、Virchow2 CLS 1280、PRISM2、KEEP 768、MUSK 1024维视觉CLS、WSI-LLaVA描述及病例库。

2. TCGA-LUAD(编码队列531例)

包含531张诊断切片,排除了10个TCGA-05 DX1病例(因GDC画布过小和组织掩码失败)。被排除的10个病例不在embeddings/张量中,但其切片状态、缩略图、轮廓和坐标保留在Run-Information/prep/TCGA-LUAD/中以便检查失败原因。

3. TCGA-LUSC

尚未包含在当前的Run-Information快照中,预处理仍在进行,编码器张量尚未发布。

标准放大倍数和补丁尺寸

模型 设置
TITAN, CONCH v1.5, CONCH v1, WSI-LLaVA 20× / 512
PRISM, Virchow, Virchow2, Virchow2 CLS, PRISM2 20× / 224
KEEP 20× / 256
MUSK 20× / 384

下载方式

可使用Hugging Face CLI进行选择性下载,例如仅下载单个模型的张量,或仅下载QC/日志文件。

明确不包含的内容

  • 原始全切片图像(.svs / .tif
  • HPC上的runs-information/full-int-*/features_*目录(相关张量已在embeddings/下,避免重复上传)
  • TCGA-LUSC的运行快照(分割和坐标生成尚未完成)
搜集汇总
数据集介绍
WSI_Embedding 数据集图片
构建方式
WSI_Embedding数据集专门面向全切片图像(WSI)的嵌入表示构建,其构建过程严格遵循可复现的流水线,为每一个切片生成补丁级与切片级嵌入向量,并伴随完整的运行记录。数据集的顶层结构清晰地区分了嵌入张量、运行信息与预处理产物,每个条目均标注了生成所采用的模型、放大倍数(如20×)、补丁像素尺寸(如512像素)及重叠设置。对于DHMC-LUAD与TCGA-LUAD两个队列,构建过程不仅收录了正式队列的嵌入文件,还妥善保存了被排除样本的中间状态,便于溯源与质量控制。预处理阶段产生的轮廓、坐标、缩略图等文件也被完整归档,确保每个嵌入向量都可以追溯至原始切片的处理细节。
特点
该数据集的核心特色在于其丰富多样的嵌入模型集合,涵盖了TITAN、CONCH、Virchow、PRISM、KEEP、MUSK以及WSI-LLaVA等多种前沿编码器,每种模型按照其标准设置生成不同维度的特征向量,如2560维的Virchow或768维的KEEP。尤其值得关注的是,数据集提供了MUSK模型的1024维视觉CLS嵌入以及WSI-LLaVA的文本描述与案例库,为多模态分析提供了可能。此外,数据集将运行日志、SLURM作业记录、验证结果等元数据一并纳入,并完整保留了10例被排除的TCGA-05 DX1切片的相关文件,使临床队列中的失败案例也能被透明审视。这种对流程溯源和异常样本的细致保留,成为该数据集区别于普通特征库的重要特点。
使用方法
使用者可通过HuggingFace CLI进行选择性下载,以精准获取所需资源。例如,仅需获取某一模型(如titan)的嵌入张量时,可通过指定--include参数仅拉取对应路径,而无需下载整套数据。对于需要质量检查或审计的工作流,可以单独获取Run-Information目录下的运行报告、预处理文件与队列信息。数据集明确不包含原始切片图像,因此使用时应依赖已有WSI数据,将嵌入向量作为模型输入或进行下游任务如生存分析、病理分类的预计算特征。同时,元数据中记录的模型配置与训练设置有助于用户复现实验或进行公平的算法比较。
背景与挑战
背景概述
WSI_Embedding数据集由thanminh01等研究者于近期构建,旨在为全切片图像(WSI)提供标准化的patch与slide级嵌入表示,并附带完整的运行记录以确保可复现性。该数据集整合了DHMC-LUAD与TCGA-LUAD两大肺癌队列,涵盖TITAN、CONCH、Virchow、PRISM、KEEP、MUSK及WSI-LLaVA等多种前沿病理基础模型的特征,为计算病理学中的弱监督学习、多模态融合及大规模临床预后建模提供了高质量的数据基础。其发布填补了病理基础模型嵌入缺乏统一存储与元数据管理的空白,促进了跨模型比较与算法验证,对精准医学研究具有显著的推动作用。
当前挑战
该数据集面临的核心挑战在于临床病理图像的复杂性与大规模特征提取的工程难度。原始WSI具有超高分辨率(如40倍扫描可达数十亿像素)及染色差异,需通过分块(tiling)策略保留形态学信息,同时处理组织折叠、背景干扰及微小切片等异常样本;为确保跨模型可比性,需统一放大倍数与patch尺寸,并严格记录坐标与掩膜信息。构建过程中还需协调HPC资源调度、长时间运行稳定性及海量张量存储管理,且面临原始数据不可公开及部分队列(如TCGA-LUSC)仍在处理中导致的不完整性,这对数据溯源性、质量控制及后续再分析提出了严峻考验。
常用场景
经典使用场景
WSI_Embedding数据集为计算病理学领域提供了一套标准化、可复现的全切片图像(WSI)嵌入特征库,其经典使用场景聚焦于多模态医学图像分析中的特征提取与迁移学习。研究人员可直接利用该数据集中的patch级与slide级嵌入张量(如TITAN、CONCH、Virchow等模型的输出),无需处理原始WSI的存储与计算负担,即可开展组织病理学图像的分类、生存分析及分子亚型预测等任务。该数据集通过提供统一的坐标系统、掩膜及质量控制记录,确保了特征提取流程的透明性与一致性,成为下游模型训练与评估的可靠基准。
解决学术问题
该数据集系统性地解决了计算病理学研究中长期存在的特征提取流程不透明、计算资源需求高及结果难以复现等问题。通过公开来自DHMC-LUAD与TCGA-LUAD两大队列的嵌入向量及详尽的运行日志,研究者得以绕过繁琐的切片预处理与模型推理环节,聚焦于高阶算法设计。其严谨的质控机制(如排除失败掩膜、记录异常切片状态)提升了数据可靠性,推动了基于弱监督学习的全切片分类、跨中心泛化研究及病理基础模型对比等学术课题的进步,为构建大规模、多中心的病理学基准提供了关键资源。
衍生相关工作
WSI_Embedding数据集的发布催生了多项衍生研究,涵盖病理基础模型的微调与评估、多模态学习(如WSI-LLaVA视觉语言模型的提示工程)以及特征融合策略的探索。基于其公开的嵌入,研究者得以复现并扩展诸如Virchow、PRISM等前沿模型在病理诊断中的应用,并发展出针对稀疏注释场景的半监督学习框架。该数据集的运行记录与预处理产物(如轮廓、坐标)为自动化质量控制工具的开发提供了基准,进而推动了可解释性病理分析系统及切片级Transformer架构的优化。此外,跨数据集的嵌入迁移研究也依赖于该资源,以验证特征在独立队列上的鲁棒性,促进泛化性能的提升。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务