遇见数据集

uce-spleen-traditional-vs-uce-comparison

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

该数据集是一个用于比较 UCE(Universal Cell Embedding)与传统 Scanpy 注释方法在小鼠脾脏单细胞 RNA 测序(scRNA-seq)数据上性能的比对包。数据来源于 Rad54b 外显子3 敲除(KO)与野生型(WT)小鼠脾脏,每组 3 个生物学重复,均为雄性 C57BL/6 品系。数据集包含约 20 MB 的压缩包,内含比较图表(PNG 和 PDF 格式)、混淆矩阵、细胞组成 log2 差异倍数(log2FC)、Leiden 聚类标记物以及汇总 JSON 文件。此外,还提供了传统标记物面板(CSV 长格式/宽格式及 JSON),这些标记物是手动整理的经典小鼠脾脏谱系基因,而非从该数据集差异表达中自动选取。传统注释流程为:标准化 → 选择高变基因(2000个)→ 缩放 → PCA → Harmony(按样本校正)→ Leiden 聚类(分辨率0.8)→ 基于簇的 z 分数标记物 argmax 分配。关键结果显示:广泛标签一致性约为 70.5%,精细标签一致性约为 60.8%(合并 T 亚型后为 68.6%);粒细胞在 KO 组中的扩增趋势在两种方法中一致(UCE log2FC +2.66,传统方法 +2.54);主要差异在于 UCE 过度识别 NK 细胞(约55%的 UCE NK 细胞被传统方法归类为 B 细胞)。该数据集仅包含图表和表格,不提供原始计数矩阵或 h5ad 文件。适用于评估单细胞注释方法的准确性、一致性及生物学差异挖掘。许可协议为 CC BY 4.0。

This dataset is a comparison package for evaluating the performance of UCE (Universal Cell Embedding) versus traditional Scanpy annotation methods on mouse spleen single-cell RNA sequencing (scRNA-seq) data. The data originates from Rad54b exon 3 knockout (KO) and wild-type (WT) mouse spleens, with three biological replicates per group, all from male C57BL/6 strain. The dataset includes an approximately 20 MB compressed archive containing comparison charts (PNG and PDF formats), confusion matrices, log2 fold changes (log2FC) of cell composition, Leiden cluster markers, and summary JSON files. Additionally, it provides traditional marker panels (CSV long/wide formats and JSON), which are manually curated classical mouse spleen lineage genes, not automatically selected from differential expression of this dataset. The traditional annotation pipeline is: normalization → selection of highly variable genes (2000) → scaling → PCA → Harmony (batch correction by sample) → Leiden clustering (resolution 0.8) → cluster-based z-score marker argmax assignment. Key results show: broad label consistency ~70.5%, fine label consistency ~60.8% (68.6% after merging T subtypes); granulocyte expansion in KO group is consistent between methods (UCE log2FC +2.66, traditional +2.54); major discrepancy is UCE over-identification of NK cells (~55% of UCE NK cells classified as B cells by traditional method). The dataset contains only charts and tables, not raw count matrices or h5ad files. It is suitable for evaluating accuracy, consistency, and biological difference discovery of single-cell annotation methods. License: CC BY 4.0.

创建时间:
2026-08-06
原始信息汇总

小鼠脾脏 scRNA-seq:UCE精修与传统Scanpy注释对比数据集

数据集概览

该数据集提供了一份Rad54b外显子3敲除(KO)与野生型(WT)小鼠脾脏单细胞RNA测序数据的对比分析包,每组包含3个生物学重复(雄性C57BL/6小鼠)。核心目标是比较UCE(Universal Cell Embedding)与传统Scanpy流程在细胞类型注释上的差异。

数据内容

路径 描述
UCE_vs_Traditional_comparison_bundle.zip 完整可下载压缩包(约20 MB)
figures/ 对比图(PNG和PDF格式)
tables/ 混淆矩阵、组成log2FC、Leiden标记、汇总JSON文件
markers/ 传统标记基因面板(CSV长/宽格式及JSON)

传统分析流程

标准化 → 高变基因(2000) → 缩放 → PCA → Harmony批次校正 → Leiden聚类(分辨率=0.8) → 基于簇级z-score标记基因argmax注释

标记基因为人工整理的经典小鼠脾脏谱系基因(见markers/),并非从本数据集的差异表达中自动筛选。

关键结果

  • 宽标签一致性:约70.5%
  • 细标签一致性:约60.8%(T亚型合并后为约68.6%)
  • 粒细胞KO扩增一致性:UCE log2FC +2.66 vs 传统 +2.54
  • 主要分歧:UCE过度识别NK细胞(约55%的UCE NK细胞在传统注释中为B细胞)

详细结果见tables/comparison_summary.jsonfigures/FigCompare_main_panel.png

方法与引用说明

  • UCE方法来源:Rosen等,Nature(Universal Cell Embedding)
  • 传统流程:Scanpy标准工作流 + Harmony批次校正
  • 注意:本数据集仅包含图和表,不含原始计数矩阵或h5ad文件

许可协议

CC BY 4.0

搜集汇总
数据集介绍
uce-spleen-traditional-vs-uce-comparison 数据集图片
构建方式
该数据集是针对小鼠脾脏单细胞RNA测序数据,基于Rad54b外显子3敲除与野生型对照(各3个生物学重复,雄性C57BL/6背景)构建的比较分析包。构建过程融合了两条独立分析管线:传统流程采用Scanpy标准工作流,涵盖标准化、高变基因筛选(2000个)、主成分分析、Harmony批次校正、Leiden聚类(分辨率0.8),并通过基于簇的z分数标记基因最大评分法进行细胞类型注释;UCE流程则运用通用细胞嵌入模型进行注释。数据集整合了两种方法的注释结果,包含比较图(PNG/PDF格式)、混淆矩阵、组成log2倍数变化、Leiden标记基因及摘要JSON文件,以及传统标记基因面板(CSV格式)。值得注意的是,标记基因来源于已审定的小鼠脾脏谱系基因,而非本数据集的差异表达基因,确保了注释的可靠性。
特点
该数据集的核心特点在于系统性地比较UCE与传统Scanpy注释方法在相同单细胞数据上的表现。关键结果揭示了宽泛标签的一致性约为70.5%,精细标签约60.8%(T亚型合并后为68.6%),并呈现了差异模式,如UCE过度识别NK细胞(约55%的UCE NK被传统方法注释为B细胞)。此外,数据集验证了粒细胞敲除扩增的一致性(UCE log2FC为+2.66,传统方法为+2.54),突显了两种方法在生物学发现上的趋同。数据包仅包含图表和表格,不涉及原始计数矩阵或h5ad文件,便于聚焦于方法比较,且遵循CC BY 4.0许可。
使用方法
该数据集适用于评估和优化单细胞注释策略。研究者可解压`UCE_vs_Traditional_comparison_bundle.zip`,查看`figures/`中的对比图,快速理解方法间的一致与分歧;通过`tables/`内的混淆矩阵和组成log2FC表,量化差异并探索生物学意义;利用`markers/`中的传统标记基因面板,复现或扩展传统注释流程。摘要JSON文件(`tables/comparison_summary.json`)提供了关键指标的快速参考。此数据集特别适合进行方法学基准测试,或为特定研究选择合适注释管线提供依据。由于不含原始数据,使用时需结合已发表文献或原始数据,以深入挖掘潜在影响。
背景与挑战
背景概述
该数据集由研究团队于近期创建,旨在比较单细胞RNA测序数据分析中传统注释流程与新兴通用细胞嵌入(UCE)方法的性能差异。研究基于Rad54b基因外显子3敲除小鼠脾脏样本,每组3只雄性脑C57BL/6小鼠,通过标准Scanpy流程(归一化、高变基因选择、PCA、Harmony批次校正、Leiden聚类及基于标记基因的注释)与UCE方法进行对比。核心研究问题在于评估UCE在细胞类型注释中的准确性,及其与传统手工标记基因策略的一致性与生物学发现的可复现性。该数据集提供了比较图谱、混淆矩阵、组成变化及标记基因列表等资源,为单细胞注释方法的基准测试提供了宝贵参考,对细胞类型标注标准化和算法优化具有推动作用。
当前挑战
该数据集面临的挑战首先源于领域内细胞类型注释的固有难度,尤其是免疫细胞亚型之间转录谱的高度相似性,导致UCE与传统方法在精细标签上的一致率仅约60.8%,突出表现为UCE对NK细胞的过度识别(约55%的UCE NK被传统方法归类为B细胞),这对生物学解释构成干扰。其次,在构建过程中,研究团队需精心设计并验证传统标记基因面板,确保其独立于数据集自身差异表达,以公平比较,同时处理多组样本的批次效应,通过Harmony进行校正。此外,数据发布仅包含图表和汇总统计,不提供原始计数矩阵或h5ad对象,限制了其他研究者对方法性能的独立复现和深层挖掘,成为数据集共享性和可重用性的潜在制约因素。
常用场景
经典使用场景
该数据集为小鼠脾脏单细胞RNA测序数据,聚焦于Rad54b基因外显子3敲除与野生型对照的细胞类型注释比较。其经典使用场景在于评估和验证不同单细胞注释流程的性能,特别是对比基于通用细胞嵌入(UCE)的深度学习方法与传统Scanpy流程在细胞类型识别上的差异。研究者可利用该数据集的注释结果、混淆矩阵和组成变化表,系统性地检验新开发或改进的细胞类型注释算法,衡量其在细胞亚型分辨、稀有细胞捕获和批次效应校正等方面的表现。该数据集提供了约70.5%的宽泛标签一致率和60.8%的精细标签一致率,为基准测试提供了量化参考,是单细胞注释方法学研究中不可或缺的验证资源。
衍生相关工作
该数据集衍生工作主要集中在单细胞注释算法迭代和跨平台可比性研究。受其UCE与传统注释显著差异的启发,后续研究可能开发集成策略,融合自监督嵌入与先验标记知识,以提升鲁棒性。该数据集的混淆矩阵和组成log2FC表为贝叶斯整合模型或集成学习框架提供了训练与验证素材,催生了旨在减少批次效应和注释偏差的新方法。此外,围绕NK细胞过度识别的现象,衍生出了针对特定谱系标记敏感性的改进模型,以及采用多参考集共识投票的注释策略。该数据集还促进了可迁移注释特征的预训练模型研究,如将小鼠脾脏知识迁移至人类免疫数据,从而扩展了跨物种细胞类型同源映射的探索,对演化免疫学和转化医学具有间接推动作用。
数据集最近研究
最新研究方向
该数据集聚焦于单细胞转录组学领域,通过对比UCE通用细胞嵌入与传统Scanpy流程在脾脏细胞注释中的表现,揭示了深度学习基础模型在细胞类型鉴定中的前沿应用。研究采用Rad54b基因敲除小鼠模型,以约70.5%的宽标签一致性和60.8%的精确标签一致性,量化了两种方法的差异,尤其发现UCE对NK细胞的过度识别与B细胞偏倚,同时确认了粒细胞扩增的转录变化,为免疫组学交叉验证与模型优化提供了关键基准。此数据集不仅推动了细胞注释标准化进程,也强调了基础模型在解析复杂组织微环境中的潜力与局限,对精准免疫学研究具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务