遇见数据集

NSCLC-THESIS-WSI-DATASET-EMBEDDING

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

该数据集名为 NSCLC-THESIS-WSI-DATASET-EMBEDDING,是一个用于计算病理学论文研究的公开镜像数据集。它包含非小细胞肺癌(NSCLC)的全切片图像(WSI)和预计算嵌入特征。数据来源包括:TCGA(LUAD 和 LUSC 亚型)以及 CPTAC(LUAD 和 LSCC 亚型)。目前,TCGA 部分已上传,包含 541 张 TCGA-LUAD 诊断切片(约 415 GB)和 512 张 TCGA-LUSC 诊断切片(约 409 GB),均为 .svs 格式及附属文件。CPTAC 部分和嵌入特征(TITAN、Prov-GigaPath、WSI-LLaVA)将在后续阶段上传。此外,还提供了 GDC 清单文件和 MD5 校验文件用于完整性验证。该数据集仅供研究和教育用途,不可用于临床诊断或患者护理。使用前需同意不尝试重新识别参与者,并按要求引用 TCGA/GDC 和 CPTAC/TCIA 来源,同时遵守相应的数据使用政策(TCGA 的 NIH GDS 无限制访问条款,CPTAC 的 CC BY 4.0 许可和 TCIA 数据使用政策)。

The dataset is named NSCLC-THESIS-WSI-DATASET-EMBEDDING, a public mirror dataset for computational pathology thesis research. It contains whole slide images (WSI) and precomputed embeddings of non-small cell lung cancer (NSCLC). Data sources include: TCGA (LUAD and LUSC subtypes) and CPTAC (LUAD and LSCC subtypes). Currently, the TCGA part has been uploaded, including 541 TCGA-LUAD diagnostic slides (approximately 415 GB) and 512 TCGA-LUSC diagnostic slides (approximately 409 GB), all in .svs format with accompanying files. The CPTAC part and embeddings (TITAN, Prov-GigaPath, WSI-LLaVA) will be uploaded in subsequent phases. Additionally, GDC manifest files and MD5 checksum files are provided for integrity verification. This dataset is intended for research and educational purposes only and cannot be used for clinical diagnosis or patient care. Users must agree not to attempt to re-identify participants, cite the TCGA/GDC and CPTAC/TCIA sources as required, and comply with the corresponding data use policies (NIH GDS unrestricted access terms for TCGA, CC BY 4.0 license for CPTAC, and TCIA data use policy).

创建时间:
2026-08-08
原始信息汇总

NSCLC 论文数据集 — 全切片图像与嵌入特征(暂存镜像)

该数据集是用于论文研究流程的公开暂存镜像,下载前需通过门控确认。数据集内包含原始全切片图像(WSI)与预计算特征(embeddings),用户可根据需求选择性下载所需文件夹。

数据集结构与内容

text README.md manifests/ # GDC清单及MD5校验列表 wsi/ TCGA-LUAD/ # 541张诊断性切片(.svs),约415 GB TCGA-LUSC/ # 512张诊断性切片(.svs),约409 GB CPTAC-LUAD/ # 计划后续添加 CPTAC-LSCC/ # 计划后续添加 embeddings/ # 预计算特征(暂未填充) titan/ # TITAN检索嵌入(后续添加) gigapath/ # Prov-GigaPath特征(后续添加) wsi_llava/ # WSI-LLaVA缓存描述(后续添加)

数据来源与许可

该数据集整合了两种来源的病理图像,且明确声明不拥有底层档案的所有权:

  • TCGA路径wsi/TCGA-*):来自NCI GDC,遵循NIH GDS非限制访问条款,禁止重新识别参与者。
  • CPTAC路径wsi/CPTAC-*):来自TCIA,组织切片图像采用CC BY 4.0许可,需遵守TCIA数据使用政策。

下载即表示同意:不尝试重新识别研究参与者、引用相应数据源(TCGA/GDC或CPTAC/TCIA及其DOI)、遵守TCIA数据使用政策、不将数据用于临床诊断或患者护理。

预期用途与限制

该数据集仅供研究和教育用途,不得用于临床诊疗。使用时需注意:

  • wsi/目录下文件较大,完整下载前需规划存储空间。
  • 未包含临床数据表。
  • 该仓库为论文暂存版本,并非TCGA/TCIA官方发布。
搜集汇总
数据集介绍
NSCLC-THESIS-WSI-DATASET-EMBEDDING 数据集图片
构建方式
本数据集面向非小细胞肺癌(NSCLC)计算病理学研究,整合了来自TCGA与CPTAC项目的诊断级全切片图像(WSI)及其衍生的预计算特征嵌入。数据源经由NCI GDC与TCIA获取,其中TCGA-LUAD与TCGA-LUSC共包含1053张诊断切片,CPTAC队列将陆续补充。构建流程严格遵循源数据使用协议,并保留了GDC清单与MD5校验文件以确保数据完整性。嵌入部分由论文流水线第二阶段通过TITAN、Prov-GigaPath及WSI-LLaVA等模型预计算生成,与原始切片共同构成结构化的病例库,支持按需选择性下载。
特点
该数据集的核心特色在于其双层次架构:原始WSI与预计算嵌入并行存储,既便于开展传统形态学分析,又可作为特征提取后即用的案例库。数据规模庞大,单张切片达数百GB量级,覆盖肺腺癌与鳞状细胞癌两大亚型。所有源自TCGA与CPTAC的切片均附带明确的来源归属与合规声明,尤其强调禁止再识别受试者且不得用于临床诊断。嵌入文件继承原始数据源的引用义务,保障了学术使用的可追溯性与伦理合规性。
使用方法
数据集使用便捷,支持通过Hugging Face Hub工具进行选择性下载。用户可仅拉取特定队列、嵌入子目录或清单文件,从而优化存储与带宽消耗。推荐启用hf_transfer加速下载,并通过--include参数精确指定路径。嵌入数据可直接输入下游分析流程,适用于检索、分类或表征学习等任务。需严格遵循许可证要求:TCGA数据须引用NIH GDS条款,CPTAC数据遵循CC BY 4.0及TCIA使用政策,再分发时须附加相同限制,并禁止任何临床诊断用途。
背景与挑战
背景概述
该数据集由研究者thanminh01创建,作为其毕业论文计算病理学工作流程的公共暂存镜像,整合了来自TCGA(LUAD与LUSC)和CPTAC(LUAD与LSCC)的非小细胞肺癌(NSCLC)全切片图像(WSI),并计划提供预计算的特征嵌入(如TITAN、Prov-GigaPath和WSI-LLaVA),以促进可复现的肿瘤微环境研究。其核心研究问题在于利用自监督病理基础模型提取高维表征,以支持NSCLC亚型的精确分类和预后预测。该数据集通过统一的数据访问接口,降低了大规模WSI数据获取的门槛,为计算病理学领域提供了标准化的基准资源,对推动AI辅助肺癌诊断研究具有重要影响。
当前挑战
数据集面临的挑战包括:1)领域挑战:WSI数据具有超高分辨率(GB级)、染色差异和形态异质性,使得特征提取和模型泛化面临艰巨任务;2)构建挑战:数据规模庞大(TCGA部分约824 GB),需处理不完整注释(如CPTAC队列待补充)和版本管理;3)伦理合规挑战:涉及患者隐私,需严格遵循TCGA和CPTAC的数据使用协议,禁止重新识别个体,且衍生嵌入需保持相同的来源归属义务;4)实用性挑战:数据下载需选择性拉取以应对存储限制,且临床数据未捆绑,限制了多模态整合的便捷性。
常用场景
经典使用场景
该数据集聚焦于非小细胞肺癌(NSCLC)的组织病理学全切片图像(WSI)及其预计算嵌入特征,为计算病理学研究提供了标准化的数据基础。其经典使用场景在于训练和评估基于深度学习的组织病理学图像分析模型,涵盖肿瘤区域分割、组织亚型分类(如肺腺癌与肺鳞癌的区分)以及生存预后预测等核心任务。通过整合TCGA和CPTAC两大权威队列的数字化切片,研究者能够在大规模、多中心的真实世界数据上验证算法的泛化性能,推动精准医学指导下的病理学智能诊断工具研发。
解决学术问题
该数据集直面计算病理学中数据孤岛和标注稀缺的难题,通过提供原始全切片图像与预计算嵌入特征的统一访问接口,显著降低了多中心异质性数据的获取门槛。它解决了WSI数据存储规模庞大、传输困难、模型预处理流程冗余等学术研究中的瓶颈问题,使研究者得以专注于算法创新而非数据工程。此外,该数据集明确的数据使用规范和来源归属要求,促进了学术研究的可重复性和合规性,为发展可解释性、鲁棒性强的病理学AI模型奠定了数据基石。
衍生相关工作
该数据集的构建和发布衍生出一系列具有代表性的相关工作,例如基于对比学习或自监督预训练范式(如TITAN、Prov-GigaPath)的大规模病理图像表示学习,这些工作探索了如何从未标注的WSI中提取泛化能力强的特征表示。此外,多模态大语言模型(如WSI-LLaVA)的引入推动了病理图像与自然语言之间的语义对齐,开启了交互式病理报告生成和智能问答的新方向。该数据集亦被广泛应用于模型微调、跨数据中心性能评估以及图谱构建等研究,进一步丰富了计算病理学中关于迁移学习和联邦学习的知识体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务