遇见数据集

mims-harvard/SPATIA_MIST

收藏
Hugging Face2026-07-04 更新2026-07-22 收录
官方服务:

资源简介:

MIST(多模态成像和空间转录组学)是一个预训练数据集,用于SPATIA(ICML 2026)。它将细胞级别的基因表达与来自Xenium空间转录组数据的形态学图像裁剪相结合。数据集的构建包括三个阶段:A阶段:从Xenium形态学TIFF图像中裁剪以细胞为中心的图像块,并存储到LMDB数据库中;B阶段:使用本体论元数据注释每个数据集,并将其添加到lamindb集合中;C阶段:将多个每个数据集的LMDB合并为一个文件(可选)。在训练时,数据加载器从lamindb集合读取基因表达,并从LMDB文件读取细胞图像(支持多尺度)。图像在加载时进行预处理:256x256灰度图像转换为RGB堆叠,再通过AutoImageProcessor(ViT-MAE)处理为(3, 224, 224)的浮点张量。

MIST (Multimodal Imaging and Spatial Transcriptomics) is a pre-trained dataset for SPATIA (ICML 2026). It combines cell-level gene expression with morphological image crops derived from Xenium spatial transcriptomics data. The dataset construction consists of three stages: Stage A: Crop cell-centered image patches from Xenium morphological TIFF images and store them in an LMDB database; Stage B: Annotate each dataset with ontological metadata and add it to the lamindb collection; Stage C: Merge multiple LMDB files from individual datasets into a single file (optional). During training, the data loader reads gene expression data from the lamindb collection and cellular images from the LMDB files, which support multi-scale loading. Images are preprocessed at load time: 256×256 grayscale images are converted into RGB stacks, then processed into a (3, 224, 224) floating-point tensor via AutoImageProcessor (ViT-MAE).

提供机构:
mims-harvard
搜集汇总
数据集介绍
mims-harvard/SPATIA_MIST 数据集图片
构建方式
MIST数据集的构建过程遵循一套严谨的三阶段流水线设计。第一阶段,从Xenium空间转录组学数据的形态学TIFF图像中,以细胞质心为中心裁剪出局部图像块,经最大强度投影、归一化至uint8范围及自适应尺寸调整后,统一缩放至256×256像素,并以LMDB数据库格式存储,键值结构为'{dataset_name}/{cell_id}'。第二阶段,利用本体注释信息对每个数据集进行标注,生成包含细胞类型、组织、疾病等元数据的h5ad文件,并注册至lamindb集合中。第三阶段支持将多个独立LMDB文件合并为单一文件,以便于大规模数据管理。
特点
SPATIA_MIST数据集的核心特点在于其多模态融合特性,将细胞级的基因表达谱与高分辨率形态学图像紧密结合。每个细胞均拥有唯一的标识符,确保转录组与图像数据之间的精确对应。数据集支持多尺度图像加载,在训练时可同时提供细胞级、微环境级乃至组织级的图像信息,极大地丰富了空间生物学特征的表达层次。此外,采用LMDB数据库格式存储图像,支持高效的随机访问与批量读取,为大规模预训练提供了坚实的数据基础设施。
使用方法
在训练过程中,数据加载器通过lamindb集合读取基因表达数据,同时从LMDB文件中并行加载对应细胞的图像数据。LMDB路径按次序映射至不同尺度的图像键:第一个路径对应细胞级图像(image),可选的第二个和第三个路径分别对应微环境级(region_image)和组织级(tissue_image)图像。加载后的图像在运行时被预处理为256×256灰度图,堆叠为RGB三通道后,经由ViT-MAE的AutoImageProcessor处理,最终输出为(3, 224, 224)的浮点张量,直接供模型训练使用。
背景与挑战
背景概述
空间转录组学与形态学影像的融合分析是精准医学与计算病理学交叉领域的前沿方向,旨在揭示基因表达在组织微环境中的空间异质性。SPATIA_MIST数据集由研究团队于ICML 2026提出,专注于构建多模态预训练数据集,整合来自Xenium平台的空间转录组学数据与细胞形态学影像。其核心研究问题在于如何通过大规模、标准化的多模态对齐数据,提升模型对细胞级基因表达与组织形态的联合表征能力。该数据集通过精细的细胞裁剪、本体注释与高效存储架构,为空间生物学与人工智能的交叉研究提供了基础资源,有望推动肿瘤微环境解析、疾病分型及药物响应预测等领域的发展。
当前挑战
该数据集面临的核心领域挑战在于多模态数据异构性的统一表征与海量数据的可扩展性。具体而言,需解决Xenium平台中空间坐标与形态影像像素坐标的非线性映射问题,以及基因表达稀疏性与图像高维特征之间的对齐难题。构建过程中,挑战涵盖TIFF影像的多通道最大强度投影与归一化处理、基于细胞边界的自适应裁剪尺寸选择、大规模LMDB数据库的高效读写,以及跨数据集的本体元数据一致性标注。此外,多尺度影像(细胞级、邻域级、组织级)的分层存储与训练时的动态加载机制,进一步增加了系统复杂性,要求兼顾数据吞吐量与模型训练效率。
常用场景
经典使用场景
SPATIA_MIST作为多模态成像与空间转录组学的预训练数据集,其经典应用场景在于整合细胞级基因表达与形态学图像数据,为空间生物学研究奠定基础。通过Xenium空间转录组学技术,该数据集将细胞中心的形态学图像裁剪为256×256像素的标准化补丁,并与单细胞基因表达谱一一对应,从而构建起跨模态的关联纽带。研究者可利用该数据集训练视觉-转录组联合编码器,在无需额外标注的条件下,从组织切片图像中预测细胞类型、空间微环境状态或基因表达模式,极大地推动了空间分辨率下细胞功能与组织结构映射的深度学习研究。
衍生相关工作
SPATIA_MIST的提出催生了多项衍生研究方向。在其构建框架下,研究者可借助多尺度图像LMDB缓存机制,开发从细胞级到组织级的层次化空间编码器,例如利用视觉Transformer捕捉不同尺度下的空间邻域拓扑结构。同时,该数据集的预处理流水线启发了面向SPATCH格式(如结直肠癌、肝癌、卵巢癌数据集)的定制化适配工具,推动异构空间组学数据的统一处理范式。此外,将SPATIA_MIST与自监督学习策略(如掩码自编码器)结合,衍生出更高效的跨模态预训练模型,能够从海量无标注数据中挖掘组织微环境的潜在模式,为后续空间转录组学的弱监督或零样本分析提供了坚实的实验基石与基准数据集。
数据集最近研究
最新研究方向
SPATIA_MIST数据集聚焦于多模态空间组学预训练,通过整合Xenium空间转录组学的细胞级基因表达与形态学图像,构建了首个面向细胞-组织多尺度联合建模的标准化数据集。该数据集采用三阶段构建流程:基于细胞质心的图像裁剪与LMDB存储、本体注释的h5ad文件生成与lamindb注册、以及多数据集LMDB合并策略。这一创新设计突破了传统空间转录组学数据在图像-基因跨模态表征学习中的瓶颈,为自监督预训练模型(如ViT-MAE)提供了高质量的多尺度训练数据,在细胞微环境解析、组织病理学空间异质性研究以及疾病生物标志物发现等前沿方向展现出重要应用价值,推动了空间组学与计算机视觉的深度融合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务