vepyr_116_GRCh38_refseq
收藏资源简介:
vepyr cache — Ensembl VEP 116, GRCh38 (RefSeq) 是一个将 Ensembl VEP 116 的 `homo_sapiens_refseq` 缓存转换为 Parquet 列式格式的数据集,专门用于 vepyr(一个基于 Rust/DataFusion 的变体注释引擎)。该数据集仅包含 NCBI RefSeq 转录本,对应于 VEP 的 `--refseq` 模式。数据集总大小约 30.7 GiB,包含 2351 个 Parquet 文件,按每条染色体和每个特征类型(如变异、转录本、外显子、调控特征、基序等)分片存储。具体目录包括:`exon/`(外显子边界、相位、转录本/基因链接)、`motif/`(转录因子结合基序和结合矩阵)、`regulatory/`(调控构建特征和表观基因组活性)、`transcript/`(完整转录本模型:序列、结构、标识符、标志)、`translation_core/`(CDS 和蛋白质序列、蛋白质特征)、`translation_sift/`(预计算的 SIFT 和 PolyPhen-2 替代矩阵)、`variation/`(已知变异、频率、临床意义)。坐标系统为 1 基,嵌入在 Parquet 元数据中。数据来源包括 Ensembl 116、GRCh38.p14、GENCODE 50、RefSeq 注释、dbSNP 156、ClinVar 2025-09、COSMIC v102、HGMD-PUBLIC 2020.4、1000 Genomes phase 3、gnomAD v4.1 等,这些版本信息也作为列嵌入在数据中。该数据集适用于基因组变异注释、频率分析和临床意义评估,但需注意商业使用限制:COSMIC v102 和 HGMD-PUBLIC 2020.4 数据需要商业许可,可通过过滤 `variation/` 中 `cosmic_ids` 非空或 `allele_string` 为 HGMD_MUTATION 的行来获得无商业限制的子集。该数据集是研究和软件工程资源,非临床产品。
vepyr cache — Ensembl VEP 116, GRCh38 (RefSeq) is a dataset that converts the `homo_sapiens_refseq` cache of Ensembl VEP 116 into Parquet columnar format, specifically designed for vepyr (a Rust/DataFusion-based variant annotation engine). It contains only NCBI RefSeq transcripts, corresponding to VEPs `--refseq` mode. The dataset is approximately 30.7 GiB in size, consisting of 2351 Parquet files sharded by chromosome and feature type (e.g., variation, transcript, exon, regulatory features, motifs). Directories include: `exon/` (exon boundaries, phase, transcript/gene links), `motif/` (transcription factor binding motifs and position weight matrices), `regulatory/` (regulatory build features and epigenomic activity), `transcript/` (full transcript models: sequence, structure, identifiers, flags), `translation_core/` (CDS and protein sequences, protein features), `translation_sift/` (precomputed SIFT and PolyPhen-2 substitution matrices), `variation/` (known variants, frequencies, clinical significance). Coordinate system is 1-based, embedded in Parquet metadata. Data sources include Ensembl 116, GRCh38.p14, GENCODE 50, RefSeq annotation, dbSNP 156, ClinVar 2025-09, COSMIC v102, HGMD-PUBLIC 2020.4, 1000 Genomes phase 3, gnomAD v4.1, etc., with version information also embedded as columns. The dataset is suitable for genomic variant annotation, frequency analysis, and clinical significance assessment, but with commercial use restrictions: COSMIC v102 and HGMD-PUBLIC 2020.4 require commercial licenses; a subset without commercial restrictions can be obtained by filtering rows in `variation/` where `cosmic_ids` is non-empty or `allele_string` is HGMD_MUTATION. This dataset is a research and software engineering resource, not a clinical product.
vepyr VEP 116 GRCh38 RefSeq 缓存数据集说明
数据集概况
这是一个将 Ensembl VEP 116 homo_sapiens_refseq 缓存(基于 GRCh38) 转换为 Parquet 列式格式的数据集,专为 vepyr 变异注释引擎设计。该引擎是 Rust/DataFusion 实现的,可复现 VEP 的结果判定,并用 Parquet 文件取代 VEP 原本的 Perl 序列化 gzip 缓存,使 DuckDB、Polars、DataFusion 或 Spark 可直接读取。
注意:该数据集仅包含 NCBI RefSeq 转录本(对应 VEP 的 --refseq 调用模式)。
数据来源与版本
所有上游来源版本均嵌入在 Parquet 文件中,可通过 source_* 列验证:
| 组件 | 版本 |
|---|---|
| Ensembl / VEP 版本 | 116 |
| 基因组组装 | GRCh38.p14 |
| 基因集 | GENCODE 50 |
| RefSeq 注释 | GCF_000001405.40-RS_2025_08 |
| Regulatory Build | 1.0(116 种细胞类型/表观基因组) |
| SIFT | 6.2.1 |
| PolyPhen-2 | 2.2.3 |
| dbSNP | 156 |
| ClinVar | 2025-09 |
| COSMIC | v102 |
| HGMD-PUBLIC | 2020.4 |
| 1000 Genomes | phase 3 |
| gnomAD 外显子组 | v4.1 |
| gnomAD 基因组 | v4.1 |
数据内容与规模
总计 2,351 个文件,约 30.4 GiB,每个重叠群/特征类型对应一个 Parquet 文件。
| 目录 | 文件数 | 大小 | 内容 |
|---|---|---|---|
exon/ |
521 | 0.03 GiB | 外显子边界、相位、转录本/基因关联 |
motif/ |
25 | 0.03 GiB | 转录因子结合基序与结合矩阵 |
regulatory/ |
25 | 0.01 GiB | Regulatory Build 特征与表观基因组活性 |
transcript/ |
521 | 0.12 GiB | 完整转录本模型(序列、结构、标识、标志) |
translation_core/ |
419 | 0.13 GiB | CDS 和蛋白质序列、蛋白质特征 |
translation_sift/ |
374 | 2.91 GiB | 预计算的 SIFT 和 PolyPhen-2 替代矩阵 |
variation/ |
464 | 27.17 GiB | 已知变异、频率、临床意义 |
说明:variation/ 目录在三个仓库(ensembl、refseq、merged)中数据完全相同;三个缓存的区别仅在于转录本/外显子/翻译部分。
数据模式
variation/ 目录包含:染色体、位置、等位基因、变异名称、体细胞状态、临床意义、表型/疾病、PubMed、次要等位基因及频率、ClinVar/COSMIC/dbSNP ID、Tier 分层、1000 Genomes 和 gnomAD 的等位基因频率数据。
transcript/ 目录包含完整转录本模型:cDNA/多肽/剪接序列、UTRs、外显子结构、CDS 起点/终点、转录本标识符与标志(如 MANE、TSL、APPRIS、CCDS、SwissProt、经典转录本标识等)。
坐标体系:1-based(坐标从 1 开始),通过 Parquet 元数据记录。
数据来源追溯
exon/、transcript/、motif/ 和 regulatory/ 的每行均携带来源版本列(source_*),便于用户自行验证;source_cache 列为空,表明所有转录本均来自 RefSeq。
使用建议
用户可通过 Hugging Face CLI 按需下载完整缓存或仅下载特定染色体的数据(如 chr21.parquet + chrom_manifest.json)。注意 vepyr 0.4.0 版本对部分下载有特殊要求,需要调整清单文件。相关文件也无需 vepyr 即可用 SQL 直接查询。
许可与合规
该数据集整体不适用于商业用途,因其包含需要商业许可的 COSMIC v102 和 HGMD-PUBLIC 2020.4 记录。商业用户需自行获取相应许可或通过 SQL 过滤掉相关记录:
- COSMIC 记录:
cosmic_ids非空 - HGMD-PUBLIC 记录:
allele_string = HGMD_MUTATION
其他来源(Ensembl、GENCODE、Regulatory Build、dbSNP、ClinVar、gnomAD、1000 Genomes)均无限制或可公开获取。
预期用途
本数据集是研究与软件工程资源,而非临床产品。注释输出不构成诊断,且结果判定取决于所选转录本集合。
引用参考
使用该数据集时请引用 Ensembl VEP 论文(McLaren et al., Genome Biology, 2016)及所依赖的底层数据源(GENCODE、dbSNP、ClinVar、gnomAD、COSMIC、HGMD、SIFT、PolyPhen-2 等)。




