遇见数据集

CortexJEPAData

收藏
Hugging Face2026-09-09 更新2026-09-10 收录
官方服务:

资源简介:

CortexJEPAData 是一个为 CortexJEPA 项目准备的皮层空间转录组数据集,包含来自小鼠、猕猴和狨猴三个物种的 410 个 H5AD 格式文件。总观测数达 59,663,533 个斑点/细胞,总文件大小约 202,936,215,273 字节。每个 H5AD 文件包含表达矩阵(X)、观测名称(obs_names)、基因名称(var_names)、空间坐标(obsm["spatial"])。部分训练集还包含层(layer)和 PrAl 标签。数据集按物种组织为子目录(a.mouse、c.macaque、d.marmoset),每个物种下分为 pretrain 和 test 子集,其中 marmoset 测试集包含 development 子集(含三个发育阶段文件)。提供了 manifest.csv 文件记录每个文件的路径、物种、划分、样本、观测数、基因数、空间形状和文件大小。数据集可用于空间转录组学研究、脑皮层细胞类型分析、发育研究等任务。

CortexJEPAData is a cortical spatial transcriptomics dataset prepared for the CortexJEPA project, containing 410 H5AD format files from three species: mouse, macaque, and marmoset. The total number of observations is 59,663,533 spots/cells, and the total file size is approximately 202,936,215,273 bytes. Each H5AD file includes an expression matrix (X), observation names (obs_names), gene names (var_names), and spatial coordinates (obsm["spatial"]). Some training sets also contain layer and PrAl labels. The dataset is organized into subdirectories by species (a.mouse, c.macaque, d.marmoset), with each species divided into pretrain and test subsets. The marmoset test set includes a development subset (containing three developmental stage files). A manifest.csv file is provided, recording each files path, species, split, sample, number of observations, number of genes, spatial shape, and file size. The dataset can be used for tasks such as spatial transcriptomics research, brain cortical cell-type analysis, and developmental studies.

创建时间:
2026-09-04
原始信息汇总

CortexJEPAData 数据集详情

基本信息

  • 数据集名称:CortexJEPAData
  • 语言:英语、中文
  • 许可证:其他(other)
  • 标签:空间转录组学、单细胞、神经科学、大脑、皮层、AnnData、H5AD、表格数据
  • 数据规模:10M < n < 100M
  • 配置:包含 manifest 配置,数据文件为 manifest.csv

数据内容

每个 .h5ad 文件包含:

  • X:表达矩阵
  • obs_names:斑点/细胞标识符
  • var_names:基因标识符
  • obsm["spatial"]:空间坐标
  • 仅部分预训练数据包含微调标签:
    • c.macaque/pretrainobs["layer"]
    • d.marmoset/pretrainobs["layer"]obs["PrAl"]
  • d.marmoset/test/development 发育阶段分组:仅包含 obs["segment"]

注意:四个绒猴预训练切片(T429T430T431T432)缺少原始的 PrAl 列,其 obs["PrAl"] 值以 NaN 存储以保持模式一致性。

其他逐细胞注释、基因注释列、层、非结构化元数据、图像、报告和 memmap 文件已从上传副本中排除。

目录结构

text CortexJEPAData/ a.mouse/ pretrain/ test/ c.macaque/ pretrain/ test/ d.marmoset/ pretrain/ test/ development/ manifest.csv README.md README.zh-CN.md

数据集统计

  • 文件总数:410 个 H5AD 文件
  • 总观测数:59,663,533 个斑点/细胞
  • H5AD 总大小:202,936,215,273 字节
  • 小鼠:75 个预训练文件,43 个测试文件
  • 猕猴:118 个预训练文件,20 个测试文件
  • 绒猴:124 个预训练文件,30 个测试文件(含 3 个发育阶段文件)

绒猴发育子集

文件 来源切片 发育阶段
P32.h5ad T1073 出生后第 32 天
P3M.h5ad T1075 出生后第 3 个月
Adult.h5ad T454 成年

这三个文件仅包含该来源的 obs["segment"],空间坐标保留在 obsm["spatial"] 中。

Manifest 文件

manifest.csv 每行对应一个 .h5ad 文件,包含字段:

  • path:数据集内相对路径
  • species:物种文件夹
  • split:预训练或测试
  • subset:嵌套子集名称;发育阶段文件为 development,其余为空
  • sample:样本 ID
  • n_obs:斑点/细胞数
  • n_vars:基因数
  • spatial_shapeobsm["spatial"] 形状
  • size_bytes:文件大小

加载示例

python import anndata as ad

adata = ad.read_h5ad("a.mouse/pretrain/T264.h5ad") X = adata.X coords = adata.obsm["spatial"] labels = adata.obs # empty except selected pretrain labels and development segment IDs

数据来源

  • 小鼠:Han et al., 2025
  • 猕猴源数据集页面:https://www.braindatacenter.cn/datacenter/web/#/dataSet/details?id=1663381185152036865
  • 绒猴源数据集页面:https://db.cngb.org/stomics/mccsta/download/

引用文献

使用该数据集时请引用原始数据来源:

  • Han L, Liu Z, Jing Z, et al. Single-cell spatial transcriptomic atlas of the whole mouse brain. Neuron. 2025;113(13):2141-2160.e9. doi:10.1016/j.neuron.2025.02.015
  • Chen A, Sun Y, Lei Y, et al. Single-cell spatial transcriptome reveals cell-type organization in the macaque cortex. Cell. 2023;186(17):3726-3743.e24. doi:10.1016/j.cell.2023.06.009
  • Huang Z, Yang Q, Li S, et al. An opposing molecular gradient axis underlies primate cortical organization. Science. 2026;392(6795):eaea2673. doi:10.1126/science.aea2673
搜集汇总
数据集介绍
CortexJEPAData 数据集图片
构建方式
CortexJEPAData数据集是针对大脑皮层空间转录组学分析而精心构建的预处理资源,旨在服务于CortexJEPA模型的训练与评估。数据构建过程严格遵循科学规范,从公开的权威来源(如小鼠全脑图谱、猕猴及狨猴皮层数据集)中提取原始数据,并经过标准化清洗,最终以H5AD格式存储。每一文件均保留表达矩阵(X)、位点/细胞与基因标识符,以及空间坐标(obsm["spatial"])等核心信息。为满足预训练与下游任务需求,特定样本的观察元数据(如皮层分层标签、发育阶段分组)被选择性保留,同时剔除冗余注释与图像等,确保数据精简且格式一致。对于缺失的原始标签,采用NaN填充以维持模式完整,避免臆造信息。该数据集共包含410个H5AD文件,涵盖59,663,533个观测值,总量达202,936,215,273字节,并辅以明细清单(manifest.csv)记录各文件的路径、物种、分区及观测数量等元数据。
特点
CortexJEPAData数据集的特色在于其多物种覆盖与精细的皮层空间分辨率,整合了小鼠、猕猴与狨猴三大物种的皮层数据,为跨物种比较和进化研究提供基础。其格式遵循AnnData规范,高效承载大规模稀疏矩阵,同时简化至核心要素,滤除次要信息,便于直接用于自监督学习模型。预训练与测试分区的明确划分,以及狨猴发育阶段子集的独特设计,使数据集适配多种实验范式。部分样本包含精细的层状标签(如layer)与其他标注(如PrAl),支持监督微调;而发育样本仅提供分段标识(segment),适配时间序列分析。此外,缺失值以标准化方式处理,确保了结构的一致性。数据文件总量虽庞大,但组织紧凑,配合manifest清单,极大便利了数据的索引与加载流程。
使用方法
用户在利用CortexJEPAData时,可通过Manifest清单或目录结构定位所需的H5AD文件。推荐的加载方式是采用Python的AnnData库(如`ad.read_h5ad()`),直接读取文件并访问表达矩阵、基因/细胞标识和空间坐标。针对预训练任务,可将`obs`中的标签(如皮层分层)用于监督对比学习;对于狨猴测试子集,随附的`segment`列允许研究者探究不同发育阶段的表达变化。数据文件可按物种与分区(pretrain/test)批量读取,以构建训练集与验证集。需注意,部分狨猴样本缺乏`PrAl`标签,处理时应对缺失值予以考虑。此外,建议用户引用原始文献以尊重数据来源,并依据其研究对象与计算资源的规模,灵活组合不同物种的数据进行模型训练与验证。
背景与挑战
背景概述
随着空间转录组学技术的迅猛发展,解析大脑皮层的细胞类型及其空间组织成为神经科学的核心议题。CortexJEPAData数据集诞生于这一背景下,由国内多家研究机构于2025年前后联合构建,旨在为皮层空间转录组数据的自监督预训练模型(如CortexJEPA)提供标准化的数据资源。该数据集整合了小鼠全脑、猕猴皮层和狨猴皮层的410个H5AD文件,涵盖约5966万个空间点或细胞,跨越多个物种和发育阶段,为跨物种比较和发育神经生物学研究提供了前所未有的分子分辨率视角。其在领域内的影响力体现在推动了空间转录组学与人工智能的交叉融合,为揭示皮层细胞类型沿空间梯度的组织规律及发育动态奠定了数据基础。
当前挑战
该数据集在解决领域核心问题的同时面临多重挑战。首先,跨物种、跨平台整合数据时,基因注释和空间坐标体系的异质性要求严格的数据格式统一,构建中实现了过滤非必要元数据以保持一致性,但保留了关键的层标签和空间信息,体现了权衡复杂性。其次,原始数据在采集过程中存在标签缺失,如四例狨猴样本缺乏PrAl列,为不虚构标签而存储为NaN,这可能导致模型训练时监督信息不完整,对处理缺失标签的算法设计提出了挑战。此外,数据集体量庞大,压缩后仍有约203 GB,在存储、传输和高效读取方面对计算资源构成压力,需依赖Anndata等专用库进行优化。这些挑战凸显了在推动空间转录组预训练模型发展中,数据质量与实用性的精妙平衡。
常用场景
经典使用场景
在神经科学和计算生物学交汇的前沿领域,空间转录组学数据日益成为解析大脑复杂结构的关键资源。CortexJEPAData数据集恰如其分地提供了跨越小鼠、猕猴和狨猴三个物种的皮层空间转录组H5AD文件,其设计初衷即服务于CortexJEPA自监督模型的预训练与下游任务微调。经典使用场景涵盖:利用预训练划分中的基因表达矩阵与空间坐标,训练模型以学习细胞类型和空间组织的内在表征;在含有层注释的狨猴与猕猴数据上微调,实现皮层层的精准预测;以及基于狨猴发育阶段样本,探究出生后皮层发育的动态变化。该数据集以统一格式整理410个文件,包含近6000万观测点,为构建跨物种通用的大脑表征模型提供了坚实的数据基础。
实际应用
在实际科学研究中,CortexJEPAData可助力于构建高精度的皮层细胞类型图谱和基因调控网络,辅助神经科学家识别疾病相关的细胞状态和分子标记。它支持的模型可被应用于脑疾病的空间病理学分析,例如对阿尔茨海默病、精神分裂症等患者样本进行自动化的层别鉴定与异常区域检测。此外,基于该数据集训练的代表性模型能推断新测序切片的空间结构,指导实验设计中样本的选择与验证,降低成本提高效率。该数据集的格式兼容AnnData生态,便于直接集成到现有生物信息学工作流中,从而加速从基础发现到临床转化的进程,促进精准神经医学的发展。
衍生相关工作
此数据集的发布催生了多类衍生工作,特别是在以CortexJEPA为代表的自监督学习框架下,促进了一系列关于空间转录组表征学习的后续研究。后续工作常引用此基准来对比不同预训练策略的有效性,或扩展其架构以融合多模态数据(如染色质可及性)。此外,衍生出的跨物种迁移模型为比较转录组学提供了新工具,引发了对皮层进化保守性基因模块的重新审视。在方法论上,基于此数据集中发育阶段子集而设计的时序分析模型,推动了细胞命运决定与区域形成机制的计算建模。总之,CortexJEPAData不仅作为直接基准,也已成为激发新算法与新技术创新的关键基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务