遇见数据集

crisprme-data

收藏
Hugging Face2026-08-16 更新2026-08-17 收录
官方服务:

资源简介:

CRISPRme 参考数据与预计算索引数据集旨在加速 CRISPRme 基因编辑脱靶分析工具的初始设置过程。该数据集托管了 CRISPRme 所需的参考资源(包括参考基因组、变体 VCF、注释文件、PAM 序列和样本 ID 列表),并提供了预计算的索引,使用户可以跳过原始数据下载、变异富集和索引构建的耗时步骤。数据内容按目录结构组织:`genomes/` 目录包含 hg38 参考基因组的每条染色体 FASTA 文件;`vcfs/` 目录包含 1000 Genomes Phase 3 (GRCh38)、人类基因组多样性计划 (HGDP) 以及合并队列的 VCF 文件;`annotations/` 目录包含 DHS+ENCODE+GENCODE 以及 GENCODE 蛋白编码基因的 BED 注释文件;`pams/` 目录包含 PAM 序列文件(如 20bp-NGG-spCas9.txt 和 NNN 基序);`samplesIDs/` 目录包含每个数据集的样本 ID 列表;`indexes/` 目录包含预计算的基因组文库和富集索引,例如 `NGG_1000G+HGDP+TOPMed+AllofUs/`、`NNN_1000G+HGDP/` 和 `NGG_pangenome2.0/`。该数据集主要适用于 CRISPRme 用户进行脱靶分析,通过使用预计算索引将基因组范围的设置时间从数小时缩短至几分钟。数据集遵循 AGPL-3.0 许可证,并引用 Cancellieri 等人 2023 年发表于《自然·遗传学》的论文。

The CRISPRme Reference Data and Precomputed Indexes dataset is designed to accelerate the initial setup of the CRISPRme off-target analysis tool. It hosts reference resources required by CRISPRme (including reference genome, variant VCFs, annotation files, PAM sequences, and sample ID lists) and provides precomputed indexes, allowing users to skip time-consuming steps of raw data download, variant enrichment, and index building. The data is organized in directories: `genomes/` contains FASTA files for each chromosome of the hg38 reference genome; `vcfs/` contains VCF files from the 1000 Genomes Phase 3 (GRCh38), the Human Genome Diversity Project (HGDP), and merged cohorts; `annotations/` contains BED annotation files for DHS+ENCODE+GENCODE and GENCODE protein-coding genes; `pams/` contains PAM sequence files (e.g., 20bp-NGG-spCas9.txt and NNN motifs); `samplesIDs/` contains sample ID lists for each dataset; `indexes/` contains precomputed genome libraries and enrichment indexes, such as `NGG_1000G+HGDP+TOPMed+AllofUs/`, `NNN_1000G+HGDP/`, and `NGG_pangenome2.0/`. This dataset is primarily intended for CRISPRme users performing off-target analysis, reducing genome-wide setup time from hours to minutes by using precomputed indexes. It is licensed under AGPL-3.0 and cites the paper by Cancellieri et al. 2023 in Nature Genetics.

创建时间:
2026-08-04
原始信息汇总

数据集概述

CRISPRme reference data & precomputed indexes 是一个为 CRISPRme 工具提供参考数据和预计算索引的数据集。该数据集旨在通过提供快速、可靠的镜像资源,显著加速 CRISPRme 的基因组规模运行,将原本需要数小时的下载和索引构建过程缩短至几分钟。

核心目标与动机

  • 加速数据获取:上游数据源(如 EBI 和 UCSC)下载速度慢(约 1.4 MB/s),而 Hugging Face 的 CDN 速度是其约 6.5 倍。
  • 消除计算瓶颈:变体富集(variant enrichment)阶段占整个运行时间的约 93%(约 13.5 小时中的 12.5 小时),预计算索引可直接跳过该步骤。
  • 简化用户操作:用户无需下载原始数据或构建索引,直接使用预计算索引即可完成设置。

数据集内容与布局

目标目录结构包括以下类别:

目录 内容
genomes/hg38/ GRCh38 每个染色体的 FASTA 文件(chr1.fa … chrX.fa)
vcfs/ 1000 Genomes Phase 3 (GRCh38)、HGDP 样本及合并队列的 VCF 文件
annotations/ 功能注释文件(如 dhs+encode+gencode.hg38.bed、gencode.protein_coding.bed)
pams/ PAM 序列文件(如 20bp-NGG-spCas9.txt、NNN motif)
samplesIDs/ 各数据集的样本 ID 列表
indexes/ 预计算的基因组库和富集索引

默认预计算索引

数据集包含以下三种预计算索引配置:

  1. NGG_1000G+HGDP+TOPMed+AllofUs:统一的大规模队列面板(1000G + HGDP + TOPMed + All of Us),是论文中重点提到的参考配置。
  2. NNN_1000G+HGDP:向后兼容原始 CRISPRme 的配置,使用 NNN PAM。
  3. NGG_pangenome2.0:基于 Pangenome 2.0 VCF 的索引。

此外,还提供默认的 NNNNGG 两种 PAM 配置。

使用方式

  • 自动集成:CRISPRme 的 setup 功能可直接从本仓库拉取资源,替代原始慢速上游主机。
  • 手动下载:支持直接下载整个仓库(需注意数据量较大),命令示例: bash hf download pinellolab/crisprme-data --repo-type dataset --local-dir crisprme-data

许可与引用

  • 许可协议:参考数据按其原始来源(1000 Genomes、HGDP、GENCODE/ENCODE、UCSC hg38 等)的条款进行再分发;CRISPRme 本身采用 AGPL-3.0 许可。
  • 引用信息:若使用 CRISPRme,请引用:

    Cancellieri S, et al. Human genetic diversity alters off-target outcomes of therapeutic gene editing. Nat Genet 55, 34–43 (2023). doi:10.1038/s41588-022-01257-y

  • 项目主页:https://github.com/pinellolab/CRISPRme

注意事项

  • 当前仓库状态为 🚧 建设中(work in progress),部分资源尚未完全上传,上述目录结构为目标形态。
  • 数据集不支持浏览器查看(viewer: false)。
搜集汇总
数据集介绍
crisprme-data 数据集图片
构建方式
CRISPRme-data 数据集是为 CRISPRme 脱靶分析工具量身打造的参考数据与预计算索引集合。其构建过程首先汇集了多种权威基因组学资源,包括 UCSC 提供的 hg38 参考基因组、1000 Genomes Phase 3、人类基因组多样性计划(HGDP)、TOPMed 和 All of Us 等大规模人群变异数据库,以及 GENCODE/ENCODE 的基因注释与 DNase 超敏位点信息。在此基础上,针对常用的 PAM 序列(如 NGG、NNN)进行变异富集处理,并预先构建了基因文库与富集索引,从而将原本需要数小时的数据下载和索引构建过程压缩至数分钟。这种预构建模式不仅提升了数据获取效率,还确保了不同用户之间分析结果的可复现性。
特点
该数据集的核心特点在于其高效的预计算索引方案,能够大幅缩短 CRISPRme 全基因组分析的前期准备时间。据实测,直接下载上游数据源的速度约为 1.4 MB/s,而通过 Hugging Face 平台可提速 6.5 倍,且变异富集阶段占整个流程约 93% 的时间,预计算索引则彻底消除了这一瓶颈。数据集涵盖了多种参考配置,包括统一的大队列面板(1000G+HGDP+TOPMed+AllofUs)和 Pangenome 2.0 泛基因组,并提供与原始 CRISPRme 向后兼容的 NNN+1000G+HGDP 组合。此外,所有资源均以模块化结构组织,便于用户按需下载,避免不必要的存储开销。
使用方法
使用该数据集时,用户可直接通过 Hugging Face 的下载工具获取所需模块,例如执行 `hf download pinellolab/crisprme-data --repo-type dataset --local-dir crisprme-data` 即可拉取整个仓库。更推荐的做法是按需获取,仅下载基因序列、变异文件或索引中的特定部分。CRISPRme 的 setup 功能也已对接该仓库,可自动从本数据源替代原始慢速上游主机拉取资源。用户可根据自己的分析目标选择预构建索引(如 NGG_1000G+HGDP+TOPMed+AllofUs)或默认 PAM 配置,直接启动脱靶预测,而无需经历繁琐的原始数据处理流程。
背景与挑战
背景概述
CRISPRme-data 数据集由 Pinello 实验室于 2023 年推出,旨在支撑 CRISPRme 工具的脱靶预测研究。CRISPRme 是一种基于人类遗传多样性的 CRISPR 脱靶效应评估平台,其核心研究问题在于如何整合大规模人群遗传变异数据,以提升基因编辑治疗的安全性和有效性。该数据集的构建整合了 1000 Genomes、HGDP、TOPMed 及 All of Us 等多个队列的变异信息,并提供了预计算的索引,显著加速了全基因组范围内的脱靶分析流程。该数据集在基因编辑领域具有重要影响力,为精准医疗和基因治疗提供了关键的基础资源,其相关研究成果发表在 Nature Genetics 上。
当前挑战
CRISPRme-data 面临的挑战主要源于两大方面。其一,在领域问题层面,CRISPR 脱靶预测需要处理海量基因组数据和高维度的遗传变异信息,传统方法在计算效率和精度上存在瓶颈,难以满足临床级应用的需求。其二,在构建过程中,数据集的生成遭遇了显著的技术障碍,包括从上游源下载大规模 VCF 和基因组文件时网络带宽受限,导致耗时长;以及变异富集和索引构建阶段计算开销巨大,单线程处理耗时可达数十小时。为应对这些挑战,数据集采用了预计算索引和镜像托管策略,借助 Hugging Face 的高速分发网络,将原始数据下载和索引构建时间从数小时缩短至分钟级别,从而大幅提升了实用性和可重复性。
常用场景
经典使用场景
CRISPRme-data数据集作为CRISPRme工具的核心支撑,为全基因组范围的脱靶效应预测提供了标准化的参考数据与预计算索引。研究者可借助该数据集快速构建CRISPRme运行环境,省去从原始源(如EBI、UCSC)下载大型基因组文件及进行繁琐的变异富集和索引构建过程。其典型使用场景在于精准评估CRISPR-Cas9等基因编辑工具在人类基因组中的脱靶位点,尤其适用于涉及大规模人群遗传变异的研究,如个体化医疗和基因治疗安全性评估。
实际应用
在实际应用中,CRISPRme-data被广泛用于临床前基因治疗方案的脱靶风险评估,帮助科研人员和临床医生筛选出高特异性的guide RNA,减少非预期编辑带来的安全隐患。此外,该数据集也支持群体遗传学与基因组医学研究,如比较不同种族或地域人群的脱靶差异,指导个体化治疗策略。其预计算索引的便捷性使得非专业计算生物学家也能轻松开展复杂的脱靶分析,加速了基因编辑技术的临床转化。
衍生相关工作
基于CRISPRme-data,衍生了一系列重要学术工作。其核心方法被应用于多篇高影响力论文,如Cancellieri等人在《Nature Genetics》上发表的研究,揭示了人类遗传多样性对治疗性基因编辑脱靶结果的影响。后续研究还利用该数据集优化了脱靶预测算法,开发了新的评分模型,并探索了泛基因组参考在基因编辑中的应用。此外,该数据集的构建模式也启发了其他生物信息学工具的数据分发策略,推动了基因组学数据的高效共享与复用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务