遇见数据集

precancer-omics-data

收藏
Hugging Face2026-06-16 更新2026-06-17 收录
官方服务:

资源简介:

Precancer-to-Tumor Progression Multi-omics 是一个精心策划、持续收集的公开可用人类多组学数据集集合,专注于研究从癌前病变到早期癌变,再到晚期/转移性肿瘤的完整进展轨迹。该数据集优先收录单细胞转录组测序(scRNA-seq)和空间转录组学数据,同时也包含其他多种组学模态。数据集规模庞大,包含3502个独立数据集,总数据量达672.1 GB,其中包含569个单细胞数据集、160个空间数据集以及1119个属于进展系列的数据集。数据来源广泛,主要来自NCBI GEO、cBioPortal、CELLxGENE Discover、ArrayExpress、figshare等公共开放存储库。数据模态多样,涵盖bulk RNA-seq、scRNA-seq、DNA甲基化、微阵列、DNA突变、空间转录组学、质谱蛋白质组学、bulk ATAC-seq、snRNA-seq、空间蛋白质组学和scATAC-seq等。数据集以分析就绪的格式存储(如.h5ad、matrix.mtx等),并配有详细的元数据清单,记录每个数据集的来源、登录号、模态、进展阶段、大小、原始URL和出版物信息。该资源旨在为癌症研究,特别是肿瘤进展机制研究,提供一个集中的、便于访问的多组学数据平台,用户需遵循每个数据集原始来源的许可证要求。

Precancer-to-Tumor Progression Multi-omics is a meticulously curated, continuously updated collection of publicly accessible human multi-omics datasets, focusing on the complete progression trajectory from precancerous lesions to early-stage cancer and further to advanced/metastatic tumors. The dataset prioritizes the inclusion of single-cell transcriptome sequencing (scRNA-seq) and spatial transcriptomics data, while also encompassing a variety of other omics modalities. It is large-scale, comprising 3502 independent datasets with a total data volume of 672.1 GB, including 569 single-cell datasets, 160 spatial datasets, and 1119 datasets belonging to progression series. The data sources are extensive, primarily from public open repositories such as NCBI GEO, cBioPortal, CELLxGENE Discover, ArrayExpress, and figshare. The data modalities are diverse, covering bulk RNA-seq, scRNA-seq, DNA methylation, microarray, DNA mutation, spatial transcriptomics, mass spectrometry proteomics, bulk ATAC-seq, snRNA-seq, spatial proteomics, and scATAC-seq, among others. The datasets are stored in analysis-ready formats (e.g., .h5ad, matrix.mtx) and are accompanied by detailed metadata inventories that record each datasets source, accession number, modality, progression stage, size, original URL, and publication information. This resource aims to provide a centralized, easily accessible multi-omics data platform for cancer research, particularly for the study of tumor progression mechanisms. Users must comply with the license requirements of each datasets original source.

创建时间:
2026-06-14
原始信息汇总

数据集概述:Precancer-to-Tumor Progression Multi-omics (single-cell & spatial)

该数据集是一个持续更新的、精选的人类多组学公开数据集集合,覆盖从癌前病变 → 早期癌 → 晚期/转移的完整肿瘤演进轨迹,优先收录单细胞和空间转录组学数据。

数据集基本信息

  • 数据集名称:Precancer-to-Tumor Progression Multi-omics (single-cell & spatial)
  • 许可证:非标准许可(每个子数据集保留其原始来源的许可证)
  • 语言:英语
  • 标签:生物学、医学、癌症、肿瘤学、单细胞、scRNA-seq、空间转录组学、肿瘤进展、癌前、多组学、基因组学
  • 数据规模:>1TB
  • 数据集总数:3506个
  • 总大小:678.3 GB

数据组成

按数据类型

类型 数量
单细胞数据 570
空间数据 160
进展系列数据 1119

按数据来源

来源 数量
GEO 3393
cBioPortal 95
CELLxGENE 93
ArrayExpress 54
figshare 53
SCEA 4
UCSC-CellBrowser 1

按模态划分

  • other/unspecified: 1306
  • bulk-RNA-seq: 659
  • scRNA-seq: 519
  • methylation: 420
  • microarray: 219
  • DNA-mutation: 188
  • spatial-transcriptomics: 143
  • proteomics-MS: 102
  • bulk-ATAC: 69
  • snRNA-seq: 43
  • spatial-proteomics: 17
  • scATAC: 8

数据来源

数据集来源于以下公共仓库:NCBI GEO、CZ CELLxGENE Discover、EBI Single Cell Expression Atlas、UCSC Cell Browser、HCA、figshare、Zenodo、cBioPortal、PRIDE、ArrayExpress/BioStudies。每个数据集遵循其原始仓库/原始出版物的许可证。

仓库结构

  • data/<SOURCE>/<ACCESSION>/ — 每个数据集的处理就绪文件(如 .h5admatrix.mtx+barcodes/features、Visium空间矩阵、计数表)
  • _catalog/precancer_catalog.csv / .xlsx / .parquet — 完整清单(每个数据集一行:来源、登录号、模态、进展阶段、大小、源URL、PMID/DOI、摘要)
  • _catalog/README.md — 可读的运行摘要

使用方式

可通过 huggingface_hubsnapshot_download 下载指定数据文件,例如:

python from huggingface_hub import snapshot_download p = snapshot_download("wei82/precancer-omics-data", repo_type="dataset", allow_patterns=["_catalog/", "data/CELLxGENE/"])

加载 .h5ad 文件可使用 scanpy / anndata,加载 matrix.mtx 可使用 scanpy.read_10x_mtx

重要说明

  • 所有数据均来自公共开放访问仓库,不包含受控访问或可识别患者的数据
  • 使用任何数据集时,必须引用原始研究并遵循其许可证
  • 数据集自动化收集,不与原始数据提供者关联,仅供研究便利使用
  • 在重用或重新分发前,请验证每个数据集的原始许可证
搜集汇总
数据集介绍
precancer-omics-data 数据集图片
构建方式
该数据集通过系统性地从NCBI GEO、CZ CELLxGENE Discover、EBI Single Cell Expression Atlas、cBioPortal、ArrayExpress等公共开放获取数据库中自动化收集并持续更新,构建了一个涵盖癌前病变至早期癌变、晚期及转移性肿瘤全阶段的多组学数据资源库。数据集优先收录单细胞及空间转录组学数据,并按照来源、访问号、模态、疾病进展阶段等信息进行组织,形成统一的元数据索引清单。
使用方法
用户可通过Hugging Face Hub的`snapshot_download`函数便捷下载数据,指定`_catalog`目录获取完整元数据清单,或按机构分类下载特定数据集。数据以`.h5ad`、`matrix.mtx`、Visium空间矩阵等格式存储,可使用Scanpy、AnnData等标准生物信息学工具进行分析。使用前需查阅原始数据许可证并引用相应原始研究。
背景与挑战
背景概述
癌症的发生与发展是一个多阶段、多步骤的复杂过程,从癌前病变逐步演进至早期癌变,最终发展为晚期或转移性肿瘤,这一连续谱系中蕴含着揭示肿瘤生物学本质的关键信息。为系统解析这一进程中的分子动态变化,由研究人员构建的precancer-omics-data数据集应运而生,它整合了来自GEO、CELLxGENE、cBioPortal等公共数据库的3506个多组学数据集,涵盖单细胞转录组、空间转录组、DNA突变、甲基化等多种模态,总计超过678GB。该数据集聚焦于肿瘤演进的全轨迹,优先收录单细胞与空间转录组数据,为深入理解癌前病变向肿瘤转化的分子机制提供了前所未有的资源。自2024年创建以来,该数据集已成为肿瘤演化研究领域的重要基础,推动了跨模态、跨阶段的比较分析和生物标志物发现。
当前挑战
该数据集面对的核心领域难题在于,肿瘤进展研究长期受困于关键阶段的样本稀缺,尤其是癌前病变至早期癌变的过渡状态鲜有大规模、高质量的公开数据。此外,多组学数据类型(如scRNA-seq、空间转录组与bulk测序)在整合分析时面临批次效应、数据异构性及尺度差异等挑战,为统一建模带来巨大阻力。在构建过程中,数据集的维护者挑战重重,包括从异质性极强的公共仓库中自动采集与标准化元数据、确保每个数据集保留原始许可及引用信息、对超过3500个数据集进行质量控制与格式统一。同时,大规模数据的存储与版本更新需要持续投入计算资源,而数据许可的合规性管理也增加了治理的复杂性,最终的目标是构建一个兼顾可重复性与开放性的研究镜像。
常用场景
经典使用场景
在肿瘤演化研究领域,precancer-omics-data数据集被广泛用于解析癌前病变向侵袭性肿瘤转变的分子机制。该数据集整合了覆盖癌前病灶、早期癌变及晚期转移全病程的多组学数据,尤其聚焦于单细胞转录组与空间转录组图谱,使研究者能够追溯肿瘤异质性的起源与克隆演化路径。通过分析同一患者或跨队列的癌前-肿瘤配对样本,经典研究利用其构建了从基因突变、表观遗传重塑到微环境重塑的级联事件模型,为揭示肿瘤早期发生的关键驱动事件提供了前所未有的数据支撑。
解决学术问题
该数据集系统性地解决了肿瘤学中一个长期存在的难题:由于缺乏覆盖全病程的多组学公共资源,研究者难以在跨样本整合中区分肿瘤进展的早期信号与晚期积累的乘客突变。precancer-omics-data通过汇集超过3500个公开数据集,构建了标准化元数据索引,首次实现了大规模癌前-肿瘤-转移样本的联合分析。这使学术界能够开展基于真实世界数据的荟萃分析,识别跨癌种的早期诊断标志物,并验证肿瘤免疫逃逸的关键时间窗口,对推动精准肿瘤学从晚期治疗向早期干预的策略转型具有里程碑意义。
实际应用
在实际应用中,该数据集已成为药物靶点发现与生物标志物验证的核心资源库。制药企业与研究机构利用其空间转录组与蛋白质组学数据,筛选在癌前阶段特异性激活的分子通路,进而设计针对超早期干预的治疗策略。此外,临床诊断公司基于该数据集的甲基化与突变谱训练预后预测模型,用于识别高风险癌前病变患者。该数据集的标准化目录结构也降低了多来源数据整合的技术门槛,加速了临床转化研究从实验室发现到诊断产品开发的进程。
数据集最近研究
最新研究方向
当前,精准肿瘤学的前沿聚焦于揭示癌前病变向恶性肿瘤转变的早期分子事件,而precancer-omics-data数据集恰好为此提供了前所未有的多组学资源宝库。该数据集整合了超过3500个公开数据集,涵盖从癌前病变、早期癌到晚期转移的完整肿瘤演进轨迹,并以单细胞转录组和空间转录组学为核心,融合了基因组、表观组和蛋白质组等多维信息。其最新研究热点在于利用这些跨模态数据,结合人工智能方法解析肿瘤微环境中的异质性与克隆演化动力学,从而识别高危癌前病变的分子标志物。这一资源推动了肿瘤早期干预策略的开发,并为理解癌症转移的细胞起源和微环境重塑提供了全新视角,对实现肿瘤的早诊早治和个性化治疗具有深远的科学意义与临床转化潜力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务