遇见数据集

norman-perturb

收藏
Hugging Face2026-06-10 更新2026-06-11 收录
官方服务:

资源简介:

该数据集是Norman 2019 CRISPRa K562扰动图谱,属于三个伴随图谱(Norman、Replogle、VCC)之一。它记录了在K562慢性髓系白血病细胞中应用CRISPRa(基因激活)技术后获得的单细胞基因表达数据,以对数归一化计数形式呈现。核心内容包括:1) 伪批量表达数据(包含50个对照伪批量,每个由15个细胞平均而成);2) 跨所有细胞(扰动+对照)的基因共表达矩阵(基于Pearson相关);3) 差异表达分析结果,包括扰动组与对照组相比的log2倍数变化、原始p值和BH校正后p值;4) 扰动效应量,包括均值差异效应和标准化z分数效应;5) 详细的扰动元数据,如细胞数量统计、目标基因效应、差异表达基因计数等。数据生成流程涉及严格的细胞水平质量控制过滤、伪批量构建,并使用DESeq2(针对计数数据)或Welchs t检验(针对z分数数据)进行差异表达测试。该数据集适用于单细胞基因扰动效应建模、基因调控网络推断、差异表达分析基准测试等任务。需要注意的是,伪批量来自同一细胞池的随机子样本而非独立生物学重复,因此p值可能较为宽松;质量控制过滤器可能引入偏差,建议结合未过滤的效应量数据进行评估。不同来源图谱(Norman/VCC与Replogle)的原始效应单位(log2FC与z-difference)不同,但提供了标准化z分数以实现跨数据集比较。

This dataset is the Norman 2019 CRISPRa K562 perturbation atlas, part of three companion atlases (Norman, Replogle, VCC). It records single-cell gene expression data obtained after applying CRISPRa (gene activation) technology in K562 chronic myeloid leukemia cells, presented as log-normalized counts. The core content includes: 1) Pseudobulk expression data (50 control pseudobulks, each averaged from 15 cells); 2) Gene co-expression matrix across all cells (perturbed + control) based on Pearson correlation; 3) Differential expression analysis results, including log2 fold changes, raw p-values, and BH-adjusted p-values for perturbations compared to controls; 4) Perturbation effect sizes, including mean difference effects and standardized z-score effects; 5) Detailed perturbation metadata, such as cell count statistics, target gene effects, and differential expression gene counts. The data generation process involves rigorous cell-level quality control filtering, pseudobulk construction, and differential expression testing using DESeq2 (for count data) or Welchs t-test (for z-score data). This dataset is suitable for tasks such as single-cell gene perturbation effect modeling, gene regulatory network inference, and differential expression analysis benchmarking. Note that pseudobulks are derived from random subsamples of the same cell pool rather than independent biological replicates, so p-values may be liberal; quality control filters may introduce bias, and it is recommended to evaluate with unfiltered effect size data. The original effect units differ across source atlases (Norman/VCC vs. Replogle, log2FC vs. z-difference), but standardized z-scores are provided for cross-dataset comparison.

创建时间:
2026-06-08
原始信息汇总

数据集概述

数据集名称: Norman 2019 CRISPRa K562 perturbation atlas
许可证: CC-BY-4.0
任务类别: 表格回归(tabular-regression)
标签: 扰动测序(perturb-seq)、单细胞(single-cell)、CRISPRa、CRISPRi、基因表达(gene-expression)
来源: Norman, T.M. 等,Science 365, 786-793 (2019)


数据集内容

本数据集基于CRISPRa(基因激活)技术在K562慢性粒细胞白血病细胞系中进行扰动实验,提供单细胞表达的对数归一化计数数据。它是三个配套图谱之一(另两个为Replogle和VCC)。

文件结构

数据集由多个文件组成,每个文件的功能和形状如下:

文件名 形状 描述
pseudobulks.h5ad (50, n_genes) 50个对照假块(每个15个细胞,取对数归一化均值)。提供细胞类型特异性基线。
coexpression.h5ad (n_genes, n_genes) 所有细胞(扰动+对照)的Pearson共表达矩阵,基因名为行列标签。
de_log2fc.parquet (n_perts, n_genes) 扰动相对于对照假块均值的log2倍数变化(对Replogle数据集,值为z差值单位)。
de_pvalue.parquet (n_perts, n_genes) 每个基因的原始p值。对于Norman和VCC使用DESeq2 Wald检验;对于Replogle使用Welch t检验。
de_padj.parquet (n_perts, n_genes) BH校正后的p值(FDR)。
perturbation_deltas.parquet (n_perts, n_genes) 未经过细胞级别QC过滤的均值差异效应,可作为未过滤效应的基线。
perturbation_zscores.parquet (n_perts, n_genes) 标准化效应(delta / 对照假块基因标准差,带自适应下限),跨图谱可比。
retained_perturbations_de.csv (n_perts, ~15列) 每个扰动的元数据:总细胞数、通过目标QC的细胞数、目标log2FC、目标padj、在padj<0.05和0.01下的差异表达基因数。
retained_perturbations.csv (n_perts, ~12列) 未过滤delta管线的扰动摘要,包含唯一性、是否属于显著命中。
all_candidates_scored.csv 所有评分候选 用于阈值调优。
manifest.json, de_manifest.json 小文件 构建配置和时间戳。

生成流程

每个扰动的处理步骤:

  1. 细胞级别目标QC过滤:仅保留目标基因表达至少向预期方向移动50%的细胞。
    • 原始计数数据集(Norman, VCC):CRISPRa要求cell_norm_target >= 1.5 * mean_ctrl_norm_target,CRISPRi要求<= 0.5 * mean_ctrl_norm_target
    • z评分数据(Replogle):cell_target_z <= -1.0
    • 组合扰动要求所有列出目标均通过。
  2. 丢弃通过过滤且细胞数少于15的扰动。
  3. 从过滤后的细胞中构建50个扰动假块,每个假块15个细胞(原始计数数据集求和,z评分数据取均值)。
  4. 以相同方式构建50个对照假块(无目标过滤)。
  5. 每个基因进行差异表达检验:
    • 对计数假块使用DESeq2(负二项Wald检验,通过pyDESeq2)。
    • 对z评分假块使用Welch t检验。
  6. BH校正每个扰动的p值得到de_padj

共表达矩阵来源于源h5ad文件中所有细胞(扰动+对照)的Pearson相关性,经对数归一化(原始计数)或直接使用z值(Replogle)计算。


注意事项

  • 假块非独立生物重复:假块从同一细胞池中随机子采样,p值在严格FDR控制下偏保守。效应量(log2FC/z差值)和差异表达基因排名较稳健,建议下游建模使用效应量,p值作为排名辅助而非校准的假阳性率。
  • 细胞QC过滤带来的偏差:目标QC过滤选择了扰动效应较强的细胞亚群,该亚群通常伴有更广泛的细胞状态偏移,因此差异表达基因数会超过未过滤群体。可通过比较perturbation_deltas(未过滤)和de_log2fc(过滤后)来评估偏差。
  • 跨图谱效应单位差异:Norman/VCC为log2FC,Replogle为z差值。perturbation_zscores.parquet提供无单位标准化效应,便于跨图谱比较。

引用

若使用本数据集,请同时引用来源论文:Norman, T.M. et al. Exploring genetic interaction manifolds constructed from rich single-cell phenotypes. Science 365, 786-793 (2019).

搜集汇总
数据集介绍
norman-perturb 数据集图片
构建方式
该数据集源自Norman等人2019年发表于《Science》的CRISPRa扰动实验,聚焦于K562慢性髓系白血病细胞中的基因激活效应。数据集的构建遵循一套严谨的流程:首先对每个扰动进行单细胞水平上的靶标基因表达QC过滤,仅保留靶标基因表达变化符合预期方向(CRISPRa要求表达量提升至少50%)的细胞;随后剔除通过过滤细胞数不足15个的扰动,并从合格细胞池中随机抽取构建50个扰动伪批量样本(每组15个细胞),同时以相同方式构建50个对照伪批量样本;最后采用DESeq2的负二项Wald检验或Welch's t检验计算差异表达基因,并通过Benjamini-Hochberg方法校正P值以控制错误发现率。此外,所有细胞(含扰动与对照)的Pearson共表达矩阵亦被集成其中。
使用方法
研究人员可直接利用HuggingFace仓库中的Parquet和HDF5文件进行下游建模与分析。对于差异表达分析,推荐使用de_log2fc.parquet(效应量)与de_padj.parquet(校正后显著性)进行基因排名和可视化;若需跨数据集比较,应优先选用perturbation_zscores.parquet以消除原生单位差异。共表达矩阵coexpression.h5ad(n_genes × n_genes)适用于构建基因调控网络或作为先验知识嵌入深度学习模型。控制伪批量文件pseudobulks.h5ad可为细胞类型特异性基线提供参考。所有数据文件均配有清晰列名与描述,可通过Pandas的read_parquet或Scanpy的read_h5ad直接加载,配合manifest.json可复现构建参数与时间戳。
背景与挑战
背景概述
单细胞CRISPR筛选技术为解析基因调控网络和遗传互作提供了前所未有的分辨率,但大规模扰动数据的系统性整合与分析仍面临重重障碍。Norman等人于2019年在Science上发表的CRISPRa K562扰动图谱(norman-perturb数据集),由Thomas M. Norman及其团队在相关研究机构创建,旨在通过激活K562慢性粒细胞白血病细胞中的基因表达,构建一个高维单细胞表型图谱,以探索遗传互作对细胞状态的塑造机制。该数据集采用CRISPRa技术并结合单细胞RNA测序,提供了从表达水平到扰动效应的多层次矩阵,如伪批量、共表达与差异表达结果。作为三大伴随图谱之一,它为基础生物学与精准医学研究提供了标准化基准,尤其在理解癌症驱动突变与非编码调控元件功能方面影响深远。
当前挑战
该数据集所解决的领域核心挑战在于单细胞扰动实验中的效应量化与统计推断的非保守性——由于伪批量样本源自单一细胞池的随机子采样而非独立生物学重复,p值在严格FDR控制下偏于反保守,因此仅宜将p值作为排序辅助工具,而应依赖效应量(log2FC或z差异)进行下游建模。构建过程中遇到的关键挑战包括:实施每个细胞的目标基因QC过滤,仅保留靶基因表达向预期方向偏移至少50%的细胞,这虽然提高了信号纯净度,却也引入了更大的细胞状态偏移,导致过滤后差异表达基因数目超出整体群体;此外,不同数据源采用的原生效应单位各异(Norman为log2FC,Replogle为z差异),需要通过标准化z分数矩阵实现跨数据集可比性,并防止系统性偏差干扰下游分析。
常用场景
经典使用场景
在单细胞功能基因组学领域,Norman2019 CRISPRa K562扰动图谱数据集最经典的使用场景是解析基因扰动对下游转录组的系统性影响。通过整合CRISPRa介导的基因激活与单细胞RNA测序技术,研究者能够以极高的分辨率量化每个扰动基因的异质性表达变化。该数据集提供了伪批量表达谱、差异表达统计量及共表达矩阵,使得研究者可以构建基因调控网络,并深入理解特定转录因子或信号通路成员被激活后引发的级联反应。这种基于扰动-表达对应关系的分析范式,为因果推断提供了宝贵资源。
解决学术问题
该数据集解决了在单细胞水平上系统评估基因过表达效应的学术难题。传统批量实验难以区分细胞状态的连续性变化,而本数据集通过精细的细胞筛选流程——仅保留目标基因表达变化超过50%的细胞——提升了扰动信号的纯度,从而更准确地识别出受调控的下游基因。它使得研究者能够以数据驱动的方式探究基因功能冗余、遗传互作以及剂量依赖效应,为理解人类慢性粒细胞白血病细胞中基因调控的复杂性提供了重要参考。这项工作的意义在于,它推动了从静态表达谱向动态扰动图谱的技术变革,并启发了后续更大规模的单细胞扰动数据库构建。
实际应用
在实际应用层面,Norman扰动数据集最突出的价值在于药物靶点发现与组合治疗策略的设计。基于该数据集的扰动效应向量,计算生物学团队可以训练机器学习模型,预测未实验过的基因组合激活后可能产生的细胞表型变化,从而加速候选靶标的优先级排序。在合成致死研究中,研究人员能够利用其中的共表达与差异表达数据,筛选出与核心癌基因协同致死或具有合成致死潜力的靶点,指导后续的CRISPR筛选验证。此外,该图谱也为解释临床测序中发现的罕见突变提供了功能参照,助力精准医学中的变异解读。
数据集最近研究
最新研究方向
该数据集聚焦于利用CRISPRa技术在人慢性粒细胞白血病K562细胞系中进行高通量基因激活扰动,结合单细胞转录组测序构建基因表达扰动图谱。当前前沿研究方向包括基于伪批量分析(pseudobulk)和差异表达(DESeq2、Welch t检验)的扰动效应量化方法,以及通过z分数标准化实现跨图谱效应可比性。该数据集的生成流程特别强调单细胞级别的目标基因质量控制(如CRISPRa靶基因表达上调≥1.5倍),从而筛选出扰动显著性高的细胞亚群,提升下游建模的可靠性。其意义在于为解析基因调控网络、挖掘遗传相互作用(如组合扰动分析)提供标准化的参考基线,同时推动单细胞扰动组学在精准医学与合成生物学中的应用。与近期单细胞CRISPR筛选热点(如Replogle、VCC图谱)互为补充,共同构建多尺度扰动效应数据库。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务