遇见数据集

scTranslation

收藏
arXiv2026-06-03 更新2026-06-04 收录
官方服务:

资源简介:

scTranslation是一个专为单细胞多组学模态转换任务设计的综合性基准数据集,由西湖大学等机构联合构建,旨在系统评估跨模态预测模型的性能。该基准整合了八项高质量数据集,涵盖SNARE-seq、10x Multiome、CITE-seq等多种技术,涉及人类与小鼠的多个器官及发育阶段,数据规模从数百至数万细胞不等,特征维度高达数十万。数据集的创建过程严格遵循6M标准(多技术、多物种、多器官、多组学、多规模、多阶段),通过公开数据库收集并预处理了匹配的RNA、ATAC及蛋白质表达矩阵。该数据集主要应用于计算生物学领域,致力于解决单细胞多组学实验成本高昂、数据稀疏及模态缺失等问题,为跨模态预测模型提供标准化评估框架,推动精准医学与发育生物学研究。

scTranslation is a comprehensive benchmark dataset specifically developed for single-cell multi-omics modal translation tasks, jointly constructed by Westlake University and other research institutions, with the goal of systematically evaluating the performance of cross-modal prediction models. This benchmark integrates eight high-quality datasets, covering multiple technologies including SNARE-seq, 10x Multiome, and CITE-seq, and involves multiple organs and developmental stages of humans and mice. The dataset comprises samples ranging from hundreds to tens of thousands of cells, with feature dimensions reaching up to hundreds of thousands. The construction of this dataset strictly adheres to the 6M criteria (multiple technologies, multiple species, multiple organs, multi-omics, multiple scales, multiple stages), where matched RNA, ATAC and protein expression matrices were collected and preprocessed from public databases. This dataset is primarily applied in the field of computational biology, aiming to address challenges such as high experimental costs, data sparsity and modality deficiency in single-cell multi-omics experiments, providing a standardized evaluation framework for cross-modal prediction models, and advancing research in precision medicine and developmental biology.

创建时间:
2026-06-03
原始信息汇总

ScTranslation 单细胞跨模态翻译基准

项目概述
ScTranslation 是一个用于单细胞数据跨模态翻译的基准测试平台,支持 RNA、ATAC 和 ADT/Protein 三种模态之间的相互转换(RNA ⇄ ATAC 和 RNA ⇄ ADT),集成了六种代表性方法,并通过统一的 Runner 接口封装。

集成方法与模态支持

模型 实现路径 支持模态
BABEL sctranslation/models/babel RNA, ATAC, ADT
scButterfly sctranslation/models/scbutterfly RNA, ATAC, ADT
JAMIE sctranslation/models/jamie RNA, ATAC, ADT
multiDGD sctranslation/models/multidgd RNA, ATAC, ADT
scPair sctranslation/models/scpair RNA, ATAC, ADT
scDiffusionX sctranslation/models/scdiffusionx RNA, ATAC, ADT

每种方法通过统一的 Runner 接口(train, test, preprocessing_pipeline_{r,a,p})驱动,共享相同的预处理、数据集和评估代码。

安装要求

  • 推荐使用 Python 3.10 的 conda 环境
  • 需安装 PyTorch(CUDA 版本匹配)
  • 通过 pip install -r requirements.txt 安装依赖
  • 部分方法需额外安装 episcanpyscibblobfile 等原生依赖

数据集布局
数据集存储在统一根目录下,每个数据集一个子目录,每种模态对应一个 AnnData(.h5ad)文件:

$SCT_ROOT/ └── <dataset_name>/ ├── RNA_data.h5ad # 必需:RNA-seq 计数 ├── ATAC_data.h5ad # 可选:ATAC 峰矩阵 ├── ADT_data.h5ad # 可选:ADT 计数 └── split_<seed>.pkl # 首次运行自动生成

所有 AnnData 文件须共享相同的细胞索引(obs_names),且 obs 中包含 cell_type 列用于聚类评估。数据集根目录可通过环境变量 SCT_ROOT 或命令行参数 --root_path 设置,默认值为 ./datasets

运行单个模型
每个方法提供独立的 CLI 入口(位于 tests/ 目录),支持训练和测试两种模式。常用参数包括:

参数 说明 默认值
--mode 训练或测试模式 各模型不同
--data_name 数据集子文件夹名称 示例数据集名
--root_path 数据集根目录 $SCT_ROOT./datasets
--config_path YAML 配置文件路径 configs/default.yaml
--random_seed 数据划分和初始化种子 0
--modal1/--modal2 模态标识(r/a/p) r / a
--model_file 模型检查点读写路径 ./output/<模型名>/
--saved_path 预测结果和评估指标输出路径 ./output/statistics/<模型名>
--data_path 预处理后输入数据缓存路径 ./data/<模型名>

以 BABEL 为例,RNA→ATAC 翻译的训练命令: bash python tests/BABEL.py --mode train --data_name Chen_2019 --modal2 a --random_seed 0

scDiffusionX 训练需使用 torchrun 多 GPU 启动。

批量运行
scripts/ 目录下的 shell 脚本可复现论文实验:

  • run_baselines.sh:训练并测试除 scDiffusionX 外的所有模型
  • run_scdiffusionx.sh:单独运行 scDiffusionX

支持通过环境变量 CUDA_VISIBLE_DEVICESSCT_ROOTCONFIG 等控制运行配置。

评估指标
模型测试阶段生成 test_<任务>_pred.h5adtest_<任务>_truth.h5ad 文件(任务包括 a2rr2ar2p),使用 tests/evaluation.py 计算以下指标:

  • 聚类评估(Leiden 聚类 vs 真实 cell_type):ARI, AMI, NMI, HOM
  • 表达水平评估:PCC, Spearman, MSE, MAE
  • 生成质量评估:MMD, iLISI
  • 分类评估:AUROC, 特征级相关性

每个输出 AnnData 的 var 中还存储了单细胞的 PCC 值。

可重复性说明

  • 数据集划分完全由 --random_seed 参数决定,并缓存为 split_<seed>.pkl 文件
  • 每次运行前调用 seed_everything 确保随机性可复现
  • 在相同输入条件下,所有评估输出具有确定性
搜集汇总
数据集介绍
scTranslation 数据集图片
构建方式
单细胞多组学模态翻译研究近年来备受关注,但缺乏系统性的基准评估。为此,我们构建了scTranslation基准数据集,涵盖8个来自不同技术与生物学背景的子数据集,包括SNARE-seq、sci-CAR、10x Multiome和CITE-seq等协议,覆盖小鼠与人类、脑与外周血等器官,涉及转录组、染色质可及性和蛋白质组等多种模态,规模从数百至十万细胞不等,并包含成体与胚胎等多种发育阶段。该基准严格遵循6M标准,确保评估的全面性与公平性。
特点
scTranslation数据集具备显著的多样性与系统性。从技术层面看,它整合了多种测序平台,突破了单一协议的限制;从生物学层面看,它覆盖了不同物种、器官和发育阶段,能够评估模型在复杂生物学背景下的泛化能力。数据集规模跨度极大,从数百个细胞的人类胚胎样本到近十万个细胞的骨髓样本,充分检验模型的可扩展性。此外,其包含RNA到ATAC和RNA到蛋白质两种翻译任务,为不同应用场景提供了全面的测试基础。
使用方法
使用scTranslation数据集时,研究者应首先根据目标翻译任务(RNA到ATAC或RNA到蛋白质)选择相应的子集。数据预处理需保留高度可变基因、过滤低质量ATAC峰并包含所有蛋白质通道。建议采用分层5折交叉验证来评估模型性能,以获取稳健的统计结果。基准提供了包括聚类一致性、回归准确性和分布匹配在内的多维度评估指标。研究者可进一步利用特征选择、特征质量和少样本学习等设置来测试模型的鲁棒性。
背景与挑战
背景概述
单细胞多组学技术在过去十年间取得了长足发展,从测量单一分子模态逐步演进至同时捕获转录组、染色质可及性、表面蛋白及DNA甲基化等多维特征。然而,受限于高昂的实验成本、显著的技术噪声以及不完全的模态覆盖,多组学联合检测在组织图谱构建、大规模扰动筛选及临床样本分析等常规场景中的应用仍面临瓶颈。为此,西湖大学与上海交通大学、浙江大学等机构的科研人员——包括程佳贝、周靖波、夏军、李昌凯、雷震、余畅和李泽中——于2026年共同发布了scTranslation基准数据集。该基准旨在系统评估单细胞跨模态翻译方法,整合了涵盖多种技术平台(SNARE-seq、sci-CAR、10x Multiome、scCAT-seq、CITE-seq)、多个物种(人、小鼠)、多个器官(脑皮层、肾脏、骨髓、外周血)、多种组学(RNA、ATAC、蛋白质)、多种数据规模及多个发育阶段(胚胎、新生、成年)的八套数据集。scTranslation通过提供标准化的评估框架,显著推动了单细胞多组学领域的方法学发展,为生物信息学社区建立了重要的比较基准。
当前挑战
scTranslation基准所应对的核心挑战源于单细胞跨模态翻译任务的复杂性。首先,领域层面,现有方法在不同类型的数据集和具体任务上表现极不稳定,缺乏统一的评价标准——八套数据集涵盖多种技术、物种、器官及发育阶段,该多样性使得公平比较成为难题;模型性能高度依赖数据来源,难以区分算法本身的优劣。其次,构建过程中面临三大关键难题:一是多组学数据来源的多样性导致研究间缺乏一致性,现有方法通常仅在小范围数据集上验证,未全面覆盖不同协议、物种与器官;二是迫切需要多维评价体系,单一指标无法反映模型效果的全貌,需从聚类一致性(NMI、ARI、AMI、HOM)、回归准确性(PCC、MSE)及分布对齐(MMD、LISI)三个层次进行综合评估;三是模型必须对特征选择、特征质量及少样本学习等影响因素具备鲁棒性——高维稀疏数据中的噪声与丢失值、不同高变基因数量下性能的波动,以及生物医学研究中稀少的训练样本,均对翻译模型的实际部署构成了严峻考验。
常用场景
经典使用场景
在单细胞多组学研究的浪潮中,scTranslation作为一个综合性基准,其最经典的使用场景是系统评估跨模态翻译模型的性能。它聚焦于将一种单细胞组学数据(如ATAC-seq、RNA-seq或蛋白质组学)转化为另一种模态的分子谱,从而填补因实验成本高昂或技术限制导致的多组学数据缺失。通过整合来自多种技术平台、物种、器官、发育阶段和尺度的大规模配对数据集,scTranslation为研究人员提供了一个标准化的平台,以公平比较不同深度学习模型的翻译能力,包括自动编码器、变分自编码器和基于分布的方法。
解决学术问题
这项基准解决了单细胞多组学翻译领域长期存在的关键困境:缺乏统一的数据集、评价指标和影响因素分析框架。在scTranslation之前,研究者常依赖有限且不标准的数据源,导致方法间的比较失真且结论难以泛化。通过提出基于6M标准(多技术、多物种、多器官、多组学、多尺度、多发育阶段)的八大精选数据集,以及涵盖聚类一致性、回归准确性和分布保真度的三维评价体系,scTranslation系统性地揭示了数据稀疏性、特征选择和少样本学习等因素对模型鲁棒性的影响,为领域内方法开发提供了可靠的经验基线,并推动了更严谨实验设计的形成。
衍生相关工作
基于scTranslation基准的评价框架和发现,一批衍生性经典工作得以蓬勃发展。其系统性比较结果直接启发了后续针对特定影响因素优化的新模型设计,例如在特征高度稀疏或样本量极度受限的条件下提升翻译精度的正则化策略与扩散先验。该基准中提供的统一评价指标也成为后续方法论文中与前沿模型(如scButterfly、JAMIE和scDiffusion-X)进行公平对比的标准。同时,scTranslation公开的代码库和标准化数据集促使多组学整合领域朝着更加可重复、可比较的方向演进,催生了更多关于跨细胞类型、跨组织和跨物种翻译泛化能力的研究课题。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务