遇见数据集

HumanST-46M

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

HumanST-46M 是用于空间转录组学层次基础模型 NexuST 的预训练数据集。该数据集包含 76 个 H5AD 格式的文件,其中训练集 72 个(约 94.84 GiB),验证集 4 个(约 4.79 GiB),总大小约 99.63 GiB。数据保留原始平台子目录和文件名,覆盖 Xenium、MERFISH 和 CosMx 等平台生成的样本。验证集包括肺纤维化 Xenium 数据、成人脑 MERFISH 数据以及正常和肝癌 CosMx 肝脏数据。数据集仅提供 H5AD 文件,不包含 CellWorld 内存映射表示、采样索引或下游任务数据。用户可通过 Hugging Face Hub 使用 snapshot_download 下载指定子集。该数据集适用于空间转录组学的模型预训练、表示学习及相关生物信息学研究。

HumanST-46M is a pretraining dataset for the hierarchical foundation model NexuST for spatial transcriptomics. It contains 76 H5AD files, including 72 training files (approximately 94.84 GiB) and 4 validation files (approximately 4.79 GiB), with a total size of about 99.63 GiB. The data retains original platform subdirectories and filenames, covering samples generated from platforms such as Xenium, MERFISH, and CosMx. The validation set includes Xenium data of lung fibrosis, MERFISH data of adult brain, and CosMx liver data of normal and hepatocellular carcinoma. The dataset only provides H5AD files and does not include CellWorld memory-mapped representations, sampling indices, or downstream task data. Users can download specified subsets via snapshot_download from the Hugging Face Hub. This dataset is suitable for model pretraining, representation learning, and related bioinformatics research in spatial transcriptomics.

创建时间:
2026-09-22
原始信息汇总

HumanST-46M 数据集概述

基本信息

  • 数据集名称:HumanST-46M
  • 数据页面:https://huggingface.co/datasets/Haiping-UoM/HumanST-46M
  • 语言:英语(en)
  • 标签:spatial-transcriptomics、biology、h5ad、anndata
  • 论文:NexuST: A Hierarchical Foundation Model for Spatial Transcriptomics(bioRxiv, 2026),DOI:https://doi.org/10.64898/2026.09.22.753590
  • 用途:提供 NexuST 项目所使用的预训练 H5AD 数据

数据集构成

本发布版共包含 76 个 H5AD 文件,训练数据与验证数据分别存放于不同目录。

划分 H5AD 文件数 字节数 大小(GiB)
train/ 72 101,834,973,232 94.84
val/ 4 5,138,760,318 4.79
合计 76 106,973,733,550 99.63

文件保留原有的平台子目录与文件名。本发布版仅包含 H5AD 数据;CellWorld 内存映射表示、采样索引以及单独的下游数据集均不包含在内。

验证集文件

  • val/xenium/Pulmonary_Fibrosis/pulmonary_fibrosis_xenium.h5ad
  • val/merfish/adult_umb5958.h5ad
  • val/cosmx/cosmx_liver_normal.h5ad
  • val/cosmx/cosmx_liver_cancer.h5ad

下载方式

python from huggingface_hub import snapshot_download

将 train/ 和 val/ 下载到 HumanST-46M/h5ad/,以匹配本地项目结构。

snapshot_download( repo_id="Haiping-UoM/HumanST-46M", repo_type="dataset", allow_patterns=["train//*.h5ad", "val//*.h5ad"], local_dir="HumanST-46M/h5ad", )

若仅下载验证集,可使用 allow_patterns=["val/**/*.h5ad"]。

读取单个文件

使用 AnnData 读取单个文件:

python import anndata as ad

adata = ad.read_h5ad( "HumanST-46M/h5ad/val/cosmx/cosmx_liver_normal.h5ad", backed="r", ) print(adata.shape) adata.file.close()

相关仓库

  • NexuST 模型:https://huggingface.co/Haiping-UoM/NexuST
  • NexuST 模型代码:https://github.com/UoM-HealthAI/NexuST

文档状态

  • 上述文件数量与大小均基于本发布版测量。
  • 数据集名称沿用自项目;此处尚未记录精确的细胞计数审计。
  • 来源归属、预处理、字段描述及许可条款将在核实后单独记录。

引用

bibtex @article{liu2026nexust, title = {NexuST: A Hierarchical Foundation Model for Spatial Transcriptomics}, author = {Liu, Haiping and Zhao, Qian and Lin, Lijing and Zou, Zhiyong and Cai, Wenhao and Sun, Jingyuan and Zhou, Yuxi and Alvarez, Mauricio A. and Gilmore, Andrew and Rattray, Magnus and Frangi, Alejandro F. and Zhou, Hongpeng}, journal = {bioRxiv}, year = {2026}, doi = {10.64898/2026.09.22.753590} }

搜集汇总
数据集介绍
HumanST-46M 数据集图片
构建方式
在空间转录组学领域,面向大规模预训练需求的标准化数据资源仍显匮乏,HumanST-46M的构建正是为填补这一空缺而设计。该数据集源自NexuST项目,通过系统汇集多平台空间转录组实验产生的原始H5AD文件,形成统一的预训练语料库:训练集包含72个H5AD文件,验证集包含4个,分别存放于train与val目录之下,文件均保持原有平台子目录与文件名不变。下载时可通过huggingface_hub的snapshot_download接口按allow_patterns参数批量获取所需拆分,仅纳入H5AD数据本体,未包含CellWorld内存映射表示、采样索引或下游独立数据集,从而为模型训练提供直接可用的输入格式。
特点
数据集以多平台空间转录组数据为核心特征,覆盖Xenium、MERFISH与CosMx等主流技术体系,验证集具体包括肺纤维化Xenium样本、成人脑MERFISH样本以及正常与癌变肝脏CosMx样本,体现出跨组织、跨病理状态与跨检测平台的异质性。整体规模约99.63 GiB,其中训练集94.84 GiB、验证集4.79 GiB,共76个H5AD文件,构成迄今空间转录组领域体量可观的预训练资源。所有文件保留原始平台目录结构,便于追溯数据来源;数据以AnnData兼容的H5AD格式存储,支持按需读取与内存高效访问,为大规模模型训练提供兼具广度与规范性的数据基础。
使用方法
在具体使用层面,研究者可借助Hugging Face Hub的下载工具获取数据,通过snapshot_download指定repo_id为Haiping-UoM/HumanST-46M、repo_type为dataset,并利用allow_patterns筛选train或val拆分下的全部H5AD文件,下载后自动形成与本地项目一致的HumanST-46M/h5ad目录布局。读取单个样本时,可调用anndata.read_h5ad并以backed='r'模式打开,从而在不将全部数据载入内存的前提下查看数据形状,完成分析后关闭文件句柄。该数据集与NexuST模型及其GitHub代码库配套发布,使用者可在完成预训练或下游任务时直接引用,并建议在研究成果中按bioRxiv论文格式进行规范引用。
背景与挑战
背景概述
空间转录组学通过保留组织内细胞的空间位置信息,为解析组织异质性与微环境互作提供了前所未有的视角。然而,现有模型多受限于单一平台、小规模数据,难以学习跨平台、跨组织的通用表征。HumanST-46M由曼彻斯特大学Haiping Liu等研究人员于2026年构建,作为NexuST分层基础模型的预训练语料,整合了76个H5AD文件,涵盖Xenium、MERFISH和CosMx等主流平台,总规模约百吉字节。该数据集为空间转录组学基础模型的预训练提供了大规模、多平台资源,有望推动跨平台迁移与通用表征学习的研究。
当前挑战
空间转录组学领域长期面临数据稀疏、平台异质及批次效应等固有难题,构建统一的大规模预训练资源极具挑战。HumanST-46M所应对的核心问题在于如何整合多平台、多组织来源的空间表达谱,使模型习得可迁移的通用空间表征。构建过程中需克服不同平台基因覆盖度与分辨率差异带来的对齐困难,同时保持原始文件结构以支持灵活读取。当前发布版本尚未完成精确细胞计数审计,来源归属、预处理流程、字段描述及许可条款亦有待补充,这些缺失为数据复用与结果可复现性带来了不确定性。
常用场景
经典使用场景
空间转录组学旨在以原位分辨率刻画组织内基因表达的空间格局,其数据的高维稀疏与平台异质性使得大规模预训练成为迫切需求。HumanST-46M 汇聚了来自 Xenium、MERFISH 与 CosMx 等多个主流平台的 76 个 H5AD 文件,涵盖肺纤维化、肝脏癌与正常组织等多种生物学情境,并以独立验证集划分训练与评估数据。该数据集最经典的使用场景即作为 NexuST 层级基础模型的预训练语料,通过自监督学习捕捉跨平台、跨组织的通用空间表达表征,进而支撑下游细胞类型注释、空间域识别与基因表达插补等任务。
衍生相关工作
以 HumanST-46M 为预训练基石,NexuST 层级基础模型及其开源代码构成了最直接的衍生工作,推动了空间转录组基础模型架构的探索。该数据集亦为后续跨平台对齐方法、空间域聚类算法与多模态整合研究提供了评测土壤,激励研究者围绕平台不变性与层级表征发展新的自监督目标,并促进了社区在 H5AD 标准化与验证集划分规范上的共识形成。
数据集最近研究
最新研究方向
空间转录组学正从单一切片分析迈向跨平台、跨组织的通用表征学习,其核心瓶颈在于大规模异质数据的稀缺与整合困难。HumanST-46M的发布恰逢这一转折点,它汇聚了Xenium、MERFISH与CosMx三大主流平台产出的76个H5AD文件,以近百GiB的容量为NexuST分层基础模型提供了预训练语料。当前研究前沿聚焦于利用此类多平台数据学习可迁移的基因表达与空间邻域联合嵌入,以支撑肺纤维化、肝脏肿瘤微环境等复杂疾病的下游解析。该数据集的出现有望缓解领域内长期存在的基准碎片化问题,推动空间转录组基础模型从概念验证走向跨模态泛化,其影响将辐射至精准医学与组织病理学的计算范式革新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务