遇见数据集

GHIST-Plus-bundle

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

GHIST+ Data and Model Bundle 是一个用于空间转录组学和计算病理学的综合数据集,由 GHIST+ 论文发布。该数据集包含模型工件、预测结果、评估输入、比较方法输出以及可直接用于绘图的表格,总大小约 38 GB。数据集结构包括四个主要子目录:GHIST_plus/(存放四个模型检查点和预测结果)、evaluation_data/(评估数据)、figure_data/(绘图数据)和 other_models/(其他比较模型的输出)。四个模型检查点分别针对乳腺癌多任务、乳腺癌单任务、基因插补和泛癌任务。该数据集可用于复现 GHIST+ 论文中的 Figure 2 至 Figure 5,用户需配合 GitHub 仓库中的笔记本使用。数据集不包含 UNI2-H 编码器权重,用户需自行从 MahmoodLab 获取并按照说明重建完整检查点。许可证类型为 other,具体使用条款需参考附带的第三方通知文件。

GHIST+ Data and Model Bundle is a comprehensive dataset for spatial transcriptomics and computational pathology, released by the GHIST+ paper. It contains model artifacts, prediction results, evaluation inputs, comparison method outputs, and tables directly usable for plotting, with a total size of approximately 38 GB. The dataset structure includes four main subdirectories: GHIST_plus/ (storing four model checkpoints and prediction results), evaluation_data/ (evaluation data), figure_data/ (figure data), and other_models/ (outputs of other comparison models). The four model checkpoints are for breast cancer multi-task, breast cancer single-task, gene imputation, and pan-cancer tasks. This dataset can be used to reproduce figures 2 to 5 in the GHIST+ paper, and users need to use it with the notebooks in the GitHub repository. The dataset does not include UNI2-H encoder weights; users must obtain them from MahmoodLab and rebuild the full checkpoint according to instructions. The license type is other, and specific usage terms are subject to the accompanying third-party notice file.

创建时间:
2026-08-24
原始信息汇总

GHIST+ 数据与模型包概述

基本信息

  • 数据集名称:GHIST+ 数据与模型包
  • 许可证:其他(无统一许可证)
  • 标签:空间转录组学、计算病理学、Xenium
  • 大小:约 38 GB

内容组成

该数据包包含与 GHIST+ 模型相关的以下内容:

  • 模型工件(模型检查点)
  • 预测结果
  • 评估输入数据
  • 对比模型的输出结果
  • 可用于绘图的数据表

目录结构

bundle/ ├── GHIST_plus/ │ ├── models/ │ └── predictions/ ├── evaluation_data/ ├── figure_data/ └── other_models/

模型检查点

包含四个 GHIST+ 检查点文件:

  1. 乳腺多组织模型GHIST_plus/models/breast_multi/ghist_plus_breast_multi_checkpoint.pth
  2. 乳腺单组织模型GHIST_plus/models/breast_single/ghist_plus_breast_single_checkpoint.pth
  3. 基因插补模型GHIST_plus/models/imputation/ghist_plus_gene_imputation_checkpoint.pth
  4. 泛癌模型GHIST_plus/models/pancancer/ghist_plus_pancancer_checkpoint.pth

注意:检查点不包含冻结的第三方 UNI2-H 编码器权重,用户需从 MahmoodLab/UNI2-h 单独获取,并按 GHIST+ 仓库的说明在本地重建完整检查点。

各图表对应数据

  • 图2figure_data/figure4/ 下的绘图数据表
  • 图3evaluation_data/GHIST_plus/predictions/other_models/ 中的评估数据、GHIST+ 预测结果及对比模型预测
  • 图4:插补输入与预测数据(含 VQ/组成消融预测)
  • 图5figure_data/figure5/ 下的配对 PCC 和覆盖率数据表

使用说明

  • 数据可与图2–图5的复现 notebooks 配合使用(不需要训练或重建检查点)
  • notebook 中需设置环境变量 GHIST_BUNDLE_ROOT 指向下载的数据包目录
  • 教程(tutorial.ipynb)不使用此数据包作为数据根目录,需单独准备的 GHIST 数据目录(含对齐的 H&E 图像、分割掩码、细胞核元数据及所选训练模式的输入)

第三方条款

由于该数据包包含作者生成的数据、经过处理的公开源数据及多种对比方法的输出,因此无统一许可证。详细的组件来源、版本、归属和条款请参考 THIRD_PARTY_NOTICES.md 文件,上游数据的使用条款依然适用。

搜集汇总
数据集介绍
GHIST-Plus-bundle 数据集图片
构建方式
GHIST-Plus-bundle数据集是伴随GHIST+模型发布的一站式资源包,其构建遵循科学复现与开放共享原则。该包整合了模型检查点、预测结果、评估输入、对比模型输出及绘图就绪表格等多元数据,并以约38 GB的体量涵盖Figure 2至Figure 5所依赖的全部核心文件。构建者刻意将冻结的第三方UNI2-H编码器权重排除在外,通过指引用户从原始来源获取并本地重建完整检查点,既维护了知识产权的合规性,又确保了推理命令与配置的兼容性。数据目录结构严谨,分为GHIST_plus、evaluation_data、figure_data与other_models四大模块,路径命名与轻量输入模式均经Figure 2–5笔记本验证,确保用户可无缝对接下游分析与可视化流程。
特点
该数据集的显著特征在于其作为论文复现媒介的完备性与模块化设计。一方面,它囊括了模型推理所需的全部预训练权重(涵盖乳腺多组织、乳腺单组织、基因插补及泛癌四种任务)以及各模型在评估数据上的预测输出,使用户无需训练即可重建论文中的关键图表。另一方面,数据集中集成了多种对比方法的预测结果与VQ/组成消融实验的插补预测,为方法学比较与机理剖析提供了直接素材。此外,数据包内附有图5所涉及的配对皮尔逊相关系数与覆盖率表格,数据粒度精细到单基因水平,兼顾了科研探索的深度与广度。须强调的是,该包无统一许可证,各组件遵循上游数据与第三方方法的原始条款,体现了对知识来源的严格追溯与合规尊重。
使用方法
使用该数据集需遵循清晰的下载与配置流程。用户首先通过HuggingFace命令行工具将数据包下载至本地目录,并设定环境变量GHIST_BUNDLE_ROOT指向包含GHIST_plus等子目录的根路径。随后,依据GitHub仓库的指引完成环境安装,激活预置的conda环境model_env,并启动JupyterLab。在Figure2至Figure5的对应笔记本中,选择GHIST+ (model_env)内核并执行“Restart Kernel and Run All”,即可自动读取数据包中的预测表与统计结果,重现论文的全部图表。注意,tutorial.ipynb的教学演示需另行准备包含对齐H&E图像、分割掩膜与细胞核元组的数据集,与本数据包解耦。该设计显著降低了复现门槛,使研究者能聚焦于分析与改进而非繁琐的数据预处理。
背景与挑战
背景概述
随着空间转录组学与计算病理学的交叉融合,从组织切片图像中解析基因表达的空间异质性成为精准医学研究的前沿方向。GHIST+ 数据集于2025年由悉尼大学SydneyBioX团队发布,旨在解决多癌种、多平台空间转录组数据的整合与建模难题。该团队基于Xenium平台,构建了涵盖乳腺癌、泛癌及基因插补等多个任务的大规模资源库,释放了模型权重、预测结果及可视化分析所需的完整工具链。其核心研究问题在于如何利用自监督视觉编码器(如UNI2-H)提取组织形态学特征,进而实现基因表达的精准映射,为空间生物学提供可复现的基线。作为配套资源,GHIST+ 不仅支撑了图表复现与技术验证,更推动了计算病理学在空间组学领域的标准化进程,对后续研究具有示范意义。
当前挑战
该数据集在构建与应用中面临多重挑战。从领域问题来看,空间转录组数据具有高维稀疏性、噪声干扰及批次效应,且不同平台间的测量偏差显著,因此模型需在有限标注下泛化至多癌种与多样本场景,同时应对基因插补任务中缺失率极高的技术瓶颈。从构建过程而言,团队需整合异构公共数据源,统一切片、分割掩膜及细胞元数据的格式规范,并协调第三方模型权重(如UNI2-H)的许可限制,确保组件可合法融合与分发。此外,38GB的超大体量对存储与传输提出苛刻要求,而跨环境复现时还需细致校验路径配置与依赖版本,以保障推理和评估流程的一致性。
常用场景
经典使用场景
GHIST-Plus-bundle作为空间转录组学与计算病理学交叉领域的综合性资源,其经典使用场景在于辅助研究者复现GHIST+模型的全部实验结果。该数据包涵盖了模型检查点、预测输出、评估输入及绘图就绪表格,使得科研人员能够在不重启训练的前提下,直接通过Jupyter notebook脚本(Figure2至Figure5)生成论文中的关键图表,从而验证模型在乳腺癌多区域、单区域、基因插补及泛癌分析等核心任务上的性能表现,为空间转录组数据解析提供标准化、可比较的基准平台。
衍生相关工作
随GHIST-Plus-bundle衍生了一系列前沿研究,推动了视觉-转录组联合建模的进展。其基于UNI2-H视觉编码器与Transformer架构的突破性设计,启发了后续利用自监督预训练参数微调空间转录组模型的系列工作。模型在基因插补与多癌种泛化上的验证,催生了跨数据集迁移学习的研究方向,并出现了以图神经网络融合病理图像与表达图谱的改进模型。此外,该数据包提供的标准化评估协议与对比基线,已成为空间组学社区评测新算法性能的重要参照,间接驱动了可解释性与鲁棒性分析工具的涌现。
数据集最近研究
最新研究方向
在空间转录组学与计算病理学交叉领域,GHIST+数据及模型捆绑包作为前沿研究的重要载体,引领着多模态数据整合与深度学习模型在肿瘤微环境解析中的创新应用。该捆绑包通过提供乳腺癌多组织、单组织、泛癌及基因插补等多种预训练模型检查点,推动了空间转录组预测的精准化与泛化能力研究。尤其值得注意的是,其冰山式地依赖第三方视觉编码器UNI2-H权重的设计,凸显了学术界在模型复用与可复现性框架上的深度探索,同时也引发了关于模型依赖性与资源共享伦理的讨论。捆绑包中完善的评估数据、对照模型输出及绘图即用表格,不仅支撑了论文图表的直接复现,更为后续研究者提供了标准化基准,预期将加速空间转录组学从技术验证向临床转化应用的跨越,助力于精确肿瘤学与数字化病理诊断的新一轮革新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务