遇见数据集

vcc-perturb

收藏
Hugging Face2026-06-11 更新2026-06-12 收录
官方服务:

资源简介:

Virtual Cell Challenge 2025 H1 hESC训练集扰动图谱是一个单细胞基因表达数据集,专注于CRISPRi(基因敲低)技术在H1人类胚胎干细胞中的应用。该数据集于2026年6月8日生成,是三个伴生图谱(Norman、Replogle、VCC)之一,包含对数归一化计数的单细胞表达数据。数据集提供多个结构化文件,包括伪批量数据(50个对照伪批量,每个由15个细胞的对数归一化均值组成,代表细胞类型特异性基线)、基因共表达矩阵(源实验中所有细胞的皮尔逊相关性)、差异表达统计文件(含log2倍数变化、原始p值和BH校正p值)、扰动效应量文件(未经细胞水平QC过滤的平均差异效应)、标准化效应量文件(效应量除以对照伪批量标准差,实现跨图谱可比性)以及扰动元数据文件(包含细胞数量、目标基因log2倍数变化、差异表达基因计数等信息)。数据生成流程涉及基于目标基因表达变化的细胞筛选(保留表达变化≥50%的细胞)、丢弃细胞数少于15的扰动、构建扰动和对照伪批量、进行差异表达分析(使用DESeq2或Welch t检验)以及BH多重检验校正。注意事项指出:伪批量是从单一细胞池中随机抽取的子样本,而非独立生物学重复,因此p值对于严格的FDR声明可能偏小;细胞筛选会选择扰动效应强烈的亚群,可能导致更广泛的细胞状态变化,使差异表达基因数量增加;不同图谱使用不同的原生效应单位(Norman/VCC使用log2倍数变化,Replogle使用z分数差异),标准化效应量文件提供了单位无关的比较基准。该数据集来源于Arc Institute Virtual Cell Challenge 2025训练集,适用于单细胞基因表达分析、扰动效应建模、基因调控网络推断等任务。

创建时间:
2026-06-09
原始信息汇总

数据集总览

数据集名称:Virtual Cell Challenge 2025 H1 hESC training-set perturbation atlas
许可证:CC-BY-4.0
任务类型:表格回归(tabular-regression)
标签:perturb-seq, single-cell, crispri, crispra, perturbation, gene-expression
来源:Arc Institute Virtual Cell Challenge 2025 训练集,源数据地址:gs://arc-institute-virtual-cell-atlas/virtual-cell-challenge/2025/train/adata_Training.h5ad

数据集描述

该数据集包含在 H1 人胚胎干细胞中进行的 CRISPRi(基因敲低)实验,以 log 归一化计数形式提供单细胞表达数据。生成于 2026-06-08,是三个配套图谱之一(另两个为 Norman 和 Replogle)。

文件结构与说明

文件 形状 描述
pseudobulks.h5ad (50, n_genes) 50 个对照伪批量(每个 15 个细胞,log 归一化均值),提供细胞类型特异的基线。
coexpression.h5ad (n_genes, n_genes) 所有细胞(扰动+对照)的 Pearson 共表达矩阵,基因名位于两个轴上。
de_log2fc.parquet (n_perts, n_genes) 扰动 vs 对照伪批量均值的 log2 差异倍数(Replogle 为 z 差异单位)。
de_pvalue.parquet (n_perts, n_genes) 每个基因的原始 p 值(DESeq2 Wald 检验用于 log 归一化输入,Welch t 检验用于 z 分数输入)。
de_padj.parquet (n_perts, n_genes) BH 校正后的 p 值(FDR)。
perturbation_deltas.parquet (n_perts, n_genes) 未经细胞级 QC 过滤的均值差异效应,可作为不受过滤影响的基线。
perturbation_zscores.parquet (n_perts, n_genes) 标准化效应(delta / 对照伪批量标准差,带自适应下限),可在不同图谱间比较。
retained_perturbations_de.csv (n_perts, ~15) 每个扰动的元数据:总细胞数、通过目标 QC 的细胞数、目标 log2FC、目标 padj、差异表达基因数量(padj < 0.05 和 0.01)。
retained_perturbations.csv (n_perts, ~12) 基于未过滤 delta 管线的每个扰动摘要(无细胞级目标 QC),包含独特性和是否明显命中。
all_candidates_scored.csv 每个评分候选 用于阈值调整。
manifest.json, de_manifest.json 小文件 构建配置和时间戳。

生成流程

对每个扰动执行以下步骤:

  1. 细胞级目标 QC 过滤:仅保留目标基因表达朝预期方向移动至少 50% 的细胞。
    • 原始计数数据:CRISPRa 要求 cell_norm_target >= 1.5 * mean_ctrl_norm_target,CRISPRi 要求 <= 0.5 * mean_ctrl_norm_target
    • z 分数数据:要求 cell_target_z <= -1.0
    • 组合扰动要求所有目标基因均通过过滤。
  2. 丢弃通过过滤的细胞少于 15 个的扰动。
  3. 从过滤后的池中构建 50 个扰动伪批量(每个 15 个细胞),原始计数数据使用计数总和,z 分数数据使用 z 均值。
  4. 以相同方式构建 50 个对照伪批量(无目标过滤)。
  5. 对每个基因进行差异表达检验:原始计数数据使用 DESeq2(通过 pyDESeq2),z 分数数据使用 Welch t 检验。
  6. 对每个扰动的 p 值进行 BH 校正,得到 de_padj

共表达矩阵通过对源 h5ad 中所有细胞(扰动+对照合并)计算 Pearson 相关系数得到。

注意事项

  • 伪批量是随机子样本,并非独立生物学重复。p 值对于严格的 FDR 声称是反保守的。效应大小和差异表达基因排名是稳健的,建议用于下游建模,p 值仅作为排名辅助。
  • 细胞级目标 QC 过滤选择了扰动强烈作用的亚群,该亚群通常有更广泛的细胞状态变化,因此差异表达基因数量会超过未过滤的群体。可通过比较 perturbation_deltas(无过滤)和 de_log2fc(过滤后)来评估该偏差。
  • 不同图谱的效应单位不同:Norman/VCC 为 log2FC,Replogle 为 z 差异。perturbation_zscores.parquet 提供了无单位标准化,可在图谱间比较。

引用

使用该数据集时,请同时引用上述来源论文。

搜集汇总
数据集介绍
vcc-perturb 数据集图片
构建方式
该数据集源自2025年虚拟细胞挑战赛的训练集,聚焦于CRISPRi技术在H1人类胚胎干细胞中的基因敲低效应。构建过程中,首先对每个扰动实施基于单细胞的目标质量控制过滤,仅保留目标基因表达水平向预期方向偏移至少50%的细胞(CRISPRi标准为低于对照均值50%),并剔除通过过滤细胞数不足15个的扰动。随后,从过滤后的细胞池中随机抽取50组伪批量样本(每组15个细胞),同时构建等量的对照伪批量,分别计算其对数归一化表达均值。差异表达分析采用DESeq2的负二项Wald检验(针对原始计数数据)或Welch's t检验(针对z分数数据),并通过Benjamini-Hochberg方法校正多重假设检验得到调整后的p值。共表达矩阵则基于原始实验中所有细胞(包括扰动与对照)的对数归一化表达值,计算基因间的Pearson相关系数。
特点
该数据集具备多维度的独特优势。首先,其包含丰富的文件类型,不仅提供差异表达结果(如对数折叠变化、p值、调整后p值),还囊括未过滤的原始效应量(扰动增量)和跨图谱可比的标准化效应分数(扰动z分数),便于用户在不同实验间进行一致性比较。其次,质量控制流程严格:单细胞级别的靶标过滤确保了扰动效果的可靠性,而伪批量策略则模拟了生物学重复的统计特性。此外,每项扰动均附有详细的元数据,包括通过质量控制的细胞数量、目标基因的差异表达显著性状态等,为下游建模提供了全面的筛选依据。值得注意的是,作者指出伪批量样本来源于同一细胞池的随机子集,并非独立生物学重复,故p值在严格FDR控制下可能偏乐观,但效应量估计和基因排名具有较高稳健性。
使用方法
该数据集可直接作为表格回归任务的训练与评估资源,尤其适用于单细胞扰动图谱建模。用户可通过加载'de_log2fc.parquet'获取差异表达效应量,利用'perturbation_zscores.parquet'进行跨图谱的标准化比较,或使用'coexpression.h5ad'提取基因共表达网络作为先验知识。伪批量文件'pseudobulks.h5ad'可作为细胞类型特异性的基线表达参考。在模型构建中,建议优先采用效应量进行回归预测,并将p值作为排序辅助指标而非严格显著性阈值。需注意不同源数据的原生单位差异(如对数折叠变化与z分数差异),标准化后的z分数文件为此提供了统一基准。所有文件均以标准格式(H5AD、Parquet、CSV)存储,兼容Python生态中的Scanpy、Pandas等工具库。
背景与挑战
背景概述
vcc-perturb数据集由Arc研究所于2025年发布,旨在支持虚拟细胞挑战赛(Virtual Cell Challenge)中基因扰动效应的建模。该数据集聚焦于CRISPRi介导的基因敲低实验,以H1人胚胎干细胞为模型,通过单细胞RNA测序技术捕获扰动后的基因表达变化。其核心研究问题在于构建一个标准化的扰动图谱,使得研究者能够系统性地评估不同基因扰动对转录组的影响。研究人员提供了包括伪批量表达、差异表达倍数变化、共表达矩阵在内的多维数据,旨在促进扰动的定量表征与跨数据集比较。作为三个伴随图谱之一,该数据集在单细胞扰动领域具有重要参考价值,为后续开发更具泛化能力的细胞状态预测模型提供了基础资源。
当前挑战
该数据集所应对的领域挑战在于单细胞扰动实验中效应量化的复杂性与可重复性。由于单细胞数据固有的稀疏性和噪声,准确识别靶向扰动引发的特异性基因表达变化存在困难。此外,物理扰动效应与细胞状态漂移、批次效应相互混杂,使得差异表达分析面临假阳性风险。在构建过程中,面临的挑战包括通过每细胞靶点质量控制筛选强扰动亚群时引入的选择性偏差,以及伪批量样本来自同一细胞池的随机子采样而非独立生物学重复,导致统计检验的保守性不足。效应单位的差异(如对数倍数变化与z分数)进一步增加了跨数据集整合的难度,研究中采用的标准化手段虽增强了可比性,但仍无法完全消除计算偏差带来的影响。
常用场景
经典使用场景
在单细胞基因扰动功能基因组学领域,vcc-perturb 数据集为量化CRISPRi介导的基因敲降效应提供了标准化的训练资源。该数据集以H1人胚胎干细胞为模型,整合了50个对照伪批量样本与大量扰动条件下的单细胞转录组表达谱,通过log2倍数变化、p值、调整后p值及标准化效应分数等多维度指标,刻画了每个扰动基因的差异表达特征。经典使用方式包括构建扰动-基因表达响应模型、评估扰动效应强度与特异性,以及作为虚拟细胞挑战赛的基准训练集,用于开发能够预测基因扰动后细胞状态变化的深度学习算法。研究者可依据伪批量表达矩阵和共表达网络,探究单一基因敲降如何级联重塑全基因组表达模式。
衍生相关工作
vcc-perturb 作为虚拟细胞挑战赛的核心组成部分,直接催生了多项围绕单细胞扰动效应预测与因果推断的经典工作。基于该数据集,研究者开发了诸如PerturbNet、GeneDisco及CellOracle等深度生成与图神经网络模型,用于从对照状态编码器生成扰动后的细胞表达分布。其中,一些工作将扰动效应分解为靶基因直接效应与间接传播效应,借鉴了因果推断中的do-operator框架,显著提升了基因调控网络推理的准确性。另一些衍生研究则聚焦于跨扰动图谱的泛化能力,利用本数据集的标准化分数设计域适应算法,使得在H1细胞上训练的模型能够迁移预测其他细胞类型(如K562或Jurkat)中的CRISPRi扰动响应。这些工作不仅验证了本数据集在方法学验证中的基准价值,也推动了单细胞功能基因组学从描述性分析向预测性建模的范式转变。
数据集最近研究
最新研究方向
在当前单细胞功能基因组学与虚拟细胞建模的前沿交叉领域,vcc-perturb数据集作为2025年虚拟细胞挑战赛的核心训练资源,聚焦于大规模CRISPRi扰动下的H1人胚胎干细胞单细胞转录组响应谱。该数据集通过精巧的伪批量质量控制与差分表达筛选管线,系统表征了数千种基因敲低对转录状态的量化影响,为构建从扰动到细胞状态映射的生成式虚拟细胞模型提供了标准化的基准锚点。其跨图谱的标准化效应量矩阵,使得不同实验平台(如CRISPRa/i)的扰动数据得以统一比较,从而推动了建模方法从简单的差异表达分析向因果推断与细胞状态迁移学习的跃迁。尤为重要的是,该数据集的发布恰逢单细胞级扰动建模从描述性图谱向预测性数字孪生演进的转折期,它不仅为解析基因调控网络的基本拓扑结构提供了高信噪比的训练信号,还为评估虚拟细胞在未知扰动下的泛化能力设立了关键性测试基准,有望加速精准基因编辑与细胞重编程策略的计算化设计。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务