遇见数据集

cellbench-embeddings

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

CellBench-LS冷冻嵌入数据集是一个用于单细胞分析的大规模预计算嵌入集合,源自CellBench-LS研究论文。该数据集包含了13个不同单细胞数据集的细胞嵌入表示,这些嵌入由10种不同的计算模型生成。具体数据集包括Zheng68k、hPancreas、immune、cortex、pbmc12k、Covid、Liver、UC-EPI、UC-IMM、Adamson、Norman等。使用的模型涵盖PCA_model、UMAP、scVI、scGPT、CellPLM、Geneformer、LangCell、scMulan、scFoundation和Nicheformer。数据以tar归档文件形式存储,总大小约为159GB,包含按数据集和模型组织的pkl文件树结构。该数据集主要适用于单细胞分析、基础模型评估、细胞嵌入比较等研究任务,采用CC-BY-4.0许可协议。

The CellBench-LS Frozen Embedding Dataset is a large-scale collection of pre-computed cell embeddings for single-cell analysis, originating from the CellBench-LS research paper. This dataset includes cell embedding representations from 13 distinct single-cell datasets, generated by 10 different computational models. The specific covered single-cell datasets are Zheng68k, hPancreas, immune, cortex, pbmc12k, Covid, Liver, UC-EPI, UC-IMM, Adamson, Norman, and others. The utilized computational models include PCA_model, UMAP, scVI, scGPT, CellPLM, Geneformer, LangCell, scMulan, scFoundation, and Nicheformer. The dataset is stored as tar archive files, with a total size of approximately 159 GB, and contains a hierarchical file tree structure of pkl files organized by dataset and model. This dataset is primarily applicable to research tasks such as single-cell analysis, foundational model evaluation, and cell embedding comparison, and is released under the CC-BY-4.0 license.

创建时间:
2026-07-15
原始信息汇总

CellBench-LS Embeddings 数据集

  • 许可协议: CC-BY-4.0
  • 数据集名称: CellBench-LS Embeddings
  • 数据集规模: 包含 13 个数据集 × 10 个模型的嵌入向量

下载与重组

该数据集提供大型的嵌入存档文件,并分割为 1 GiB 大小的多个部分,便于通过镜像进行可靠传输。

下载与重组步骤

  1. 使用 huggingface-cli 工具下载整个数据集到本地目录 ./cellbench-embeddings
  2. 进入下载目录,将 parts/ 目录下的所有分片文件(cellbench_embeddings_13x10.tar.part*)合并为一个完整的 tar 文件 cellbench_embeddings_13x10.tar
  3. 使用提供的 SHA256 校验文件 MANIFEST.sha256 验证合并后文件的完整性。

存档文件信息

  • 完整存档大小: 170,493,552,640 字节
  • 完整存档 SHA256: 3425bdd13091d782af679cf7a540859942b017ec488c902aa7a2041e6009720b
  • 分片数量: 159 个,每个最大 1 GiB(详情见 MANIFEST.json

附加文件

该数据集还包含以下文件:

  • cellbench_emb_13x10.list
  • dataset_stats_audit.md
搜集汇总
数据集介绍
cellbench-embeddings 数据集图片
构建方式
CellBench-LS Embeddings数据集整合了13个不同的单细胞RNA测序数据集与10种嵌入模型,形成了大规模的嵌入向量存档。为便于可靠传输与镜像分发,整个存档被分割为159个不超过1 GiB的数据块,并附带了SHA256校验文件MANIFEST.sha256以确保数据完整性。用户可通过HuggingFace CLI工具完成下载,随后使用cat命令将分片文件重组为完整的tar归档文件。
特点
该数据集的核心特点在于其规模与结构性:原始存档体积达170493552640字节(约159 GiB),涵盖了13个数据集与10种模型的交叉组合,为单细胞转录组嵌入的基准测试提供了丰富的资源。此外,数据集中还包含文件列表cellbench_emb_13x10.list和数据集统计审计文档dataset_stats_audit.md,便于研究者快速索引与评估不同嵌入方法的表现。
使用方法
使用者需首先通过`huggingface-cli download`命令将数据集下载至本地目录,然后依次执行文件重组与哈希验证操作。完成重组后的tar归档可直接解压,其中包含的嵌入向量可作为下游分析任务(如聚类、降维或细胞类型注释)的输入特征。配套的统计文档有助于进行质量控制与方法的横向比较。
背景与挑战
背景概述
单细胞转录组测序技术的迅猛发展催生了海量高维基因表达数据,而细胞类型注释作为下游分析的核心环节,长期以来依赖人工标记或参考数据库比对,耗时且易引入偏差。CellBench-LS Embeddings数据集于近期由研究团队构建(机构未明确),旨在为单细胞嵌入表示学习提供标准化基准。该数据集整合了13个公开单细胞数据集与10种前沿嵌入模型(如scVI、Geneformer等),涵盖超过170GB的嵌入向量,系统性地评估不同方法在细胞聚类、批次校正及稀有细胞识别等任务中的表现。其发布填补了单细胞领域缺乏大规模、多模型通用嵌入基准的空白,显著推动了无监督表示学习方法在该领域的可重复性研究与模型选型标准化。
当前挑战
该数据集的核心挑战体现在两个层面。在领域问题层面,单细胞数据固有的高稀疏性、强批次效应及技术噪声,使得嵌入模型需同时兼顾生物学信号保留与计算效率;此外,不同模型输出的嵌入空间度量不统一,难以直接比较跨数据集间的聚类一致性及生物学意义解释性。在构建过程中,研究团队需解决百GB级嵌入档案的分割与完整性校验问题(分为159个1GiB分片),设计跨数据集的元信息标准化协议以消除批次与平台差异,并确保13个来源多样的数据集在10种模型下的嵌入计算与存储流程具备可复现性,避免因版本混叠或存储错误引入系统性偏差。
常用场景
经典使用场景
CellBench-LS Embeddings 数据集汇聚了13个不同的单细胞RNA测序数据集,并通过10种前沿的嵌入模型生成高维特征表示,为单细胞转录组数据的表征学习与比较提供了标准化的基准平台。研究者可基于该数据集的嵌入向量,系统性地评估不同模型在捕捉细胞异质性、降维可视化及聚类分析中的表现,从而推动单细胞数据分析方法的优化与选型。
衍生相关工作
该数据集衍生了一系列具有影响力的研究工作,包括面向单细胞数据的新型自监督学习框架,如基于对比学习的嵌入模型优化;以及多模态整合方法,通过融合嵌入特征与基因表达或空间信息,突破单一数据源的局限性。此外,基于该基准开发的批次效应矫正算法与细胞注释工具,显著提升了跨数据集分析的泛化能力与可重复性。
数据集最近研究
最新研究方向
CellBench-LS Embeddings数据集整合了13个单细胞转录组数据集与10种前沿嵌入模型的大规模特征表示,为单细胞多模态数据融合和跨批次整合提供了标准化评估基准。当前该领域的研究聚焦于利用深度生成模型(如scVI、Geneformer)学习细胞状态的稳健低维表征,以解析复杂组织微环境中的细胞异质性与稀有亚群。该数据集的推出恰好呼应了近期单细胞图谱计划(如Human Cell Atlas)对高性能嵌入工具的迫切需求,通过系统比较不同模型的嵌入质量,推动了细胞类型注释、扰动响应预测及空间转录组学分析的算法演进。其公开的大规模嵌入档案不仅降低了计算门槛,更通过标准化流程促进了可重复性研究,为理解发育生物学与疾病机制提供了关键基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务