HESCAPE
收藏资源简介:
HESCAPE是一个用于空间转录组学跨模态对比预训练的大规模基准数据集,基于一个涵盖6个不同基因面板和54个捐赠者的跨器官数据集。它提供了标准化的数据集、评估协议和基准测试工具,以促进空间转录组学中多模态学习方法的发展。
HESCAPE is a large-scale benchmark dataset for cross-modal contrastive pre-training in spatial transcriptomics. It is built upon a cross-organ dataset encompassing 6 distinct gene panels and 54 donors, and provides standardized datasets, evaluation protocols and benchmarking tools to advance the development of multimodal learning methods in spatial transcriptomics.
HESCAPE 数据集概述
数据集简介
- 名称: HESCAPE (A Large-Scale Benchmark for Cross-Modal Learning in Spatial Transcriptomics)
- 类型: 多模态数据集(组织学图像与基因表达数据)
- 领域: 空间转录组学
- 主要目标: 为跨模态对比预训练提供基准评估
数据集内容
- 数据规模: 包含54个捐赠者的数据,涵盖6种不同的基因面板
- 数据类型:
- 组织学图像
- 基因表达数据
- 数据来源: 10x Xenium基因面板
主要特点
- 多模态对齐: 提供1:1映射的组织学-转录组学数据
- 预训练框架: 支持4种基因表达编码器和5种病理学基础模型的评估
- 跨模态检索任务: 包括图像到基因(I2G)和基因到图像(G2I)检索
- 下游任务支持: 临床相关突变分类和基因表达预测
技术细节
- 数据格式: Pyarrow格式的流式数据集
- 预训练模型:
- 基因表达编码器: DRVI, Nicheformer, scFoundation, MLP
- 病理学基础模型: Gigapath, UNI, CONCH, H0-mini, CtransPath
- 评估指标: Recall@5(用于跨模态检索任务)
基准测试结果
- 最佳表现模型组合:
- DRVI-gigapath在多数任务中表现最优
- 具体性能参见完整测试结果表
使用方式
- 安装方法:
- pip/uv:
pip install git+https://github.com/peng-lab/hescape.git@main - conda: 克隆仓库后使用
pip install -e .安装
- pip/uv:
- 配置:
- 使用Hydra进行实验配置
- 主要配置文件:
/experiments/configs/default_config.yaml
- 训练:
- 通过
experiments/hescape_pretrain/train.py启动
- 通过
可用资源
- 数据集地址: https://huggingface.co/datasets/marr-peng-lab/paired_ts8_human_breast_panel
- 演示笔记本: image_model_loading.ipynb(展示如何加载预训练模型)
引用信息
bibtex @misc{gindra2025largescalebenchmarkcrossmodallearning, title={A Large-Scale Benchmark of Cross-Modal Learning for Histology and Gene Expression in Spatial Transcriptomics}, author={Rushin H. Gindra and Giovanni Palla and Mathias Nguyen and Sophia J. Wagner and Manuel Tran and Fabian J Theis and Dieter Saur and Lorin Crawford and Tingying Peng}, year={2025}, eprint={2508.01490}, archivePrefix={arXiv}, primaryClass={q-bio.GN}, url={https://arxiv.org/abs/2508.01490}, }




