vepyr_116_GRCh38_ensembl
收藏资源简介:
该数据集是Ensembl VEP 116版本、GRCh38人类参考基因组注释缓存的Parquet格式转换,专为vepyr(基于Rust/DataFusion的变异注释引擎)设计。包含7,632个文件,总大小约32.5 GiB,每个文件对应一个contig和一种特征类型。主要目录包括:exon/(外显子边界、相位、转录本/基因关联)、motif/(转录因子结合基序和结合矩阵)、regulatory/(调控构建特征和表观基因组活性)、transcript/(完整转录本模型:序列、结构、标识符、标志)、translation_core/(CDS和蛋白质序列、蛋白质特征)、translation_sift/(预计算的SIFT和PolyPhen-2替代矩阵)、variation/(已知变异、频率、临床意义)。variation/目录包含染色体、起始/结束位置、等位基因字符串、变异名称、临床意义、频率等字段,数据来源包括1000 Genomes、gnomAD、ClinVar、COSMIC、HGMD等。坐标系统为1基。该数据集主要用于变异效应预测(VEP)的缓存,支持vepyr引擎进行变异注释,也可用于其他基于Parquet的分析工具(如DuckDB、Polars、DataFusion)。注意:包含COSMIC v102和HGMD-PUBLIC 2020.4记录,商业用途需获得许可。
This dataset is a Parquet format conversion of the Ensembl VEP 116 release, GRCh38 human reference genome annotation cache, designed for vepyr (a Rust/DataFusion-based variant annotation engine). It contains 7,632 files totaling approximately 32.5 GiB, each corresponding to a contig and feature type. Main directories include: exon/ (exon boundaries, phase, transcript/gene associations), motif/ (transcription factor binding motifs and binding matrices), regulatory/ (regulatory build features and epigenomic activity), transcript/ (complete transcript models: sequence, structure, identifiers, flags), translation_core/ (CDS and protein sequences, protein features), translation_sift/ (precomputed SIFT and PolyPhen-2 substitution matrices), variation/ (known variants, frequencies, clinical significance). The variation/ directory contains fields such as chromosome, start/end positions, allele strings, variant names, clinical significance, frequencies, with data from sources including 1000 Genomes, gnomAD, ClinVar, COSMIC, HGMD. Coordinate system is 1-based. The dataset is primarily used as a cache for variant effect prediction (VEP) and supports the vepyr engine for variant annotation, as well as other Parquet-based analysis tools (e.g., DuckDB, Polars, DataFusion). Note: includes COSMIC v102 and HGMD-PUBLIC 2020.4 records, which require third-party licenses for commercial use.
数据集详情总结
基本信息
- 数据集名称:vepyr VEP 116 GRCh38 Ensembl cache
- 适用版本:Ensembl VEP 116,GRCh38(Ensembl)
- 许可协议:混合第三方协议,详见数据集卡片;需遵守Ensembl免责声明
- 数据类型:基因组学、变异注释、VEP、Ensembl、GRCh38
- 数据规模:100M < n < 1B 条记录
数据集描述
这是Ensembl VEP 116 homo_sapiens_ensembl 缓存的Parquet格式转换版本,用于vepyr(一个基于Rust/DataFusion的变异注释引擎)。该转换替代了VEP的Perl序列化gzip缓存文件,提供可直接由DuckDB、Polars、DataFusion或Spark读取的列式Parquet格式文件。数据仅包含Ensembl/GENCODE转录本,是VEP默认缓存风格。
数据来源版本
| 组件 | 版本 |
|---|---|
| Ensembl / VEP 发布 | 116 |
| 组装 | GRCh38.p14 |
| 基因集 | GENCODE 50 |
| 调控元件构建 | 1.0 (116种细胞类型/表观基因组) |
| SIFT | 6.2.1 |
| PolyPhen-2 | 2.2.3 |
| dbSNP | 156 |
| ClinVar | 2025-09 |
| COSMIC | v102 |
| HGMD-PUBLIC | 2020.4 |
| 1000 Genomes | phase 3 |
| gnomAD 外显子组 | v4.1 |
| gnomAD 基因组 | v4.1 |
数据内容与结构
-
总计:7,632个文件,约31.8 GiB,每个contig及功能类型对应一个Parquet文件(包括主组装、支架、补丁和LRG区域)。
-
目录结构:
目录 文件数 大小 内容 exon/1,851 0.12 GiB 外显子边界、相位、转录本/基因关联 motif/25 0.03 GiB 转录因子结合基序及结合矩阵 regulatory/25 0.01 GiB 调控元件构建特征和表观基因组活性 transcript/1,851 0.26 GiB 完整转录本模型 translation_core/1,722 0.20 GiB CDS及蛋白质序列、蛋白质特征 translation_sift/1,693 4.06 GiB 预计算的SIFT和PolyPhen-2替代矩阵 variation/464 27.17 GiB 已知变异、频率、临床意义 -
坐标系统:1-based(Parquet元数据记录为
bio.coordinate_system_zero_based = false),并嵌入bio.vep.cache_version = 116、bio.vep.cache_source_type = ensembl等元数据。
重要特性
- 数据溯源:
exon/、transcript/、motif/和regulatory/目录中的每行均携带上游来源版本信息列(如source_assembly、source_gencode、source_dbsnp等)。 - 数据分层:
variation/行带有tier列(0=热数据,1=冷数据),按(tier, start)排序,便于针对常见变异的查询优化。 - 版本兼容性:该缓存与任何引擎版本兼容,建议搭配v0.19.2或更高版本使用以获取伴随的引擎修复。
使用限制与合规性
- 商业使用限制:该缓存整体不适用于商业免费使用。它继承自上游VEP缓存中的COSMIC v102和HGMD-PUBLIC 2020.4记录,两者均需要商业许可证。
- 可过滤性:COSMIC记录可通过非空
cosmic_ids识别;HGMD-PUBLIC记录具有字面量allele_string = HGMD_MUTATION。可通过SQL过滤去除,例如在chr21上可移除约0.96%的此类记录。 - 免责声明:用户需自行负责合规,商业用户需获得相关许可证或排除受限记录。该数据集为研究和软件工程资源,非临床产品。
用途场景
该数据集适用于基因组变异注释研究,可直接替换VEP缓存并在vepyr或其他支持Parquet的引擎中使用,支持分染色体按需下载。




