vepyr_116_GRCh38_merged
收藏资源简介:
vepyr缓存数据集是Ensembl VEP 116版本中人类基因组(GRCh38)合并缓存(merged)的Parquet格式转换,专为vepyr(基于Rust/DataFusion的变异注释引擎)设计。该数据集以列式Parquet文件替代VEP原有的Perl序列化gzip缓存,可直接被DuckDB、Polars、DataFusion或Spark读取。数据集同时包含Ensembl/GENCODE和NCBI RefSeq两种转录本注释(对应VEP的--merged参数)。数据集包含7,697个Parquet文件,总大小约35.8 GiB,每个contig(包括主组装、scaffold、补丁和LRG区域)按特征类型分别存储。目录结构包括:exon/(外显子边界)、motif/(转录因子结合基序)、regulatory/(调控元件)、transcript/(完整转录本模型)、translation_core/(CDS和蛋白质序列)、translation_sift/(预计算的SIFT和PolyPhen-2替换矩阵)、variation/(已知变异、频率和临床意义)。variation/目录包含464个文件共27.17 GiB,记录变异名称、等位基因、临床意义、人群频率(1000 Genomes phase 3、gnomAD exomes v4.1、gnomAD genomes v4.1)等字段。所有坐标均为1-based,并在Parquet元数据中标注。数据集的溯源信息嵌入在每个文件中,包含source_assembly、source_gencode等列,可验证版本。注意:部分数据源(COSMIC v102和HGMD-PUBLIC 2020.4)受第三方许可限制,商业用途需获得相应许可或过滤掉相关记录(可通过cosmic_ids为NULL且allele_string不等于HGMD_MUTATION进行过滤)。数据集适用于研究、软件工程以及变异注释,但不应用于临床诊断。
The vepyr cache dataset is a Parquet format conversion of the merged cache for human genome (GRCh38) from Ensembl VEP release 116, designed for vepyr (a Rust/DataFusion-based variant annotation engine). It replaces VEPs original Perl-serialized gzip cache with columnar Parquet files, readable by DuckDB, Polars, DataFusion, or Spark. The dataset includes both Ensembl/GENCODE and NCBI RefSeq transcript annotations (corresponding to VEPs --merged parameter). It consists of 7,697 Parquet files totaling approximately 35.8 GiB, with each contig (including primary assembly, scaffolds, patches, and LRG regions) stored by feature type. Directory structure includes: exon/ (exon boundaries), motif/ (transcription factor binding motifs), regulatory/ (regulatory elements), transcript/ (complete transcript models), translation_core/ (CDS and protein sequences), translation_sift/ (precomputed SIFT and PolyPhen-2 substitution matrices), variation/ (known variants, frequencies, and clinical significance). The variation/ directory contains 464 files (27.17 GiB) recording variant names, alleles, clinical significance, population frequencies (1000 Genomes phase 3, gnomAD exomes v4.1, gnomAD genomes v4.1), etc. All coordinates are 1-based and annotated in Parquet metadata. Provenance information is embedded in each file, including source_assembly, source_gencode columns for version verification. Note: Some data sources (COSMIC v102 and HGMD-PUBLIC 2020.4) are under third-party license restrictions; commercial use requires obtaining appropriate licenses or filtering out relevant records (via filtering where cosmic_ids is NULL and allele_string is not HGMD_MUTATION). The dataset is suitable for research, software engineering, and variant annotation, but not for clinical diagnosis.
vepyr VEP 116 GRCh38 合并缓存数据集
数据集概述
该数据集是 Ensembl VEP 116 homo_sapiens_merged GRCh38 缓存 的 Parquet 格式转换版本,专为 vepyr 设计,vepyr 是一个基于 Rust/DataFusion 的变异注释引擎。数据集将 VEP 传统的 Perl 序列化 gzip 缓存文件替换为列式 Parquet 格式,可直接被 DuckDB、Polars、DataFusion 或 Spark 读取。
重要提示:该缓存整体不免费用于商业用途,因其继承了上游 VEP 缓存中的 COSMIC v102 和 HGMD-PUBLIC 2020.4 记录,两者均需商业许可。
数据规模
- 总文件数:7,697 个文件
- 总大小:约 34.9 GiB
- 分类:100M < n < 1B
- 每个 contig 对应一个 Parquet 文件(每个特征类型一个),contig 包括主组装、scaffolds、patches 和 LRG 区域
源数据版本
| 组件 | 版本 |
|---|---|
| Ensembl / VEP 发布版本 | 116 |
| 组装 | GRCh38.p14 |
| 基因集 | GENCODE 50 |
| RefSeq 注释 | GCF_000001405.40-RS_2025_08 |
| Regulatory Build | 1.0(116 种细胞类型/表观基因组) |
| SIFT | 6.2.1 |
| PolyPhen-2 | 2.2.3 |
| dbSNP | 156 |
| ClinVar | 2025-09 |
| COSMIC | v102 |
| HGMD-PUBLIC | 2020.4 |
| 1000 Genomes | phase 3 |
| gnomAD exomes | v4.1 |
| gnomAD genomes | v4.1 |
目录结构
| 目录 | 文件数 | 大小 | 内容 |
|---|---|---|---|
exon/ |
1,870 | 0.14 GiB | 外显子边界、相位、转录本/基因关联 |
motif/ |
25 | 0.03 GiB | 转录因子结合基序和结合矩阵 |
regulatory/ |
25 | 0.01 GiB | Regulatory Build 特征和表观基因组活性 |
transcript/ |
1,870 | 0.30 GiB | 完整转录本模型:序列、结构、标识符、标志 |
translation_core/ |
1,744 | 0.32 GiB | CDS 和蛋白质序列、蛋白质特征 |
translation_sift/ |
1,697 | 6.97 GiB | 预计算的 SIFT 和 PolyPhen-2 替换矩阵 |
variation/ |
464 | 27.17 GiB | 已知变异、频率、临床意义 |
数据模式
variation/ 目录包含:染色体、位置、等位基因字符串、变异名称、体细胞状态、临床意义、COSMIC/dbSNP/ClinVar ID、tier(0=热,1=冷),以及 1000 Genomes phase 3、gnomAD exomes v4.1 和 gnomAD genomes v4.1 的等位基因频率。
transcript/ 目录包含完整转录本模型:cDNA/肽段/剪接序列、UTR、外显子结构、翻译起始/终止位置、基因符号、HGNC ID、MANE Select、TSL、APPRIS、CCDS、SwissProt、规范转录本标志等。
溯源信息
所有源版本均嵌入在 Parquet 文件中,以 source_* 列形式记录。每个转录本行上的 source_cache 列为 Ensembl 或 RefSeq,可区分两套注释。
许可与合规
| 来源 | 版本 | 条款 |
|---|---|---|
| Ensembl/GENCODE/Regulatory Build | 116 / 50 / 1.0 | 无限制使用 |
| dbSNP | 156 | 公共领域 |
| ClinVar | 2025-09 | 公共领域 |
| gnomAD | v4.1 | CC0 公共领域 |
| 1000 Genomes | phase 3 | 开放获取 |
| SIFT | 6.2.1 | 需查看其条款 |
| PolyPhen-2 | 2.2.3 | 需查看其条款 |
| COSMIC | v102 | 仅限学术/非营利免费,商业需许可 |
| HGMD-PUBLIC | 2020.4 | 仅限注册学术/非营利用户免费,商用需 QIAGEN 许可 |
商业用户可通过过滤 cosmic_ids 非空记录(COSMIC)和 allele_string = HGMD_MUTATION 记录(HGMD-PUBLIC)来排除受限数据。在 chr21 上,这约移除 0.96% 的变异记录。
预期用途与引用
该数据集是研究和软件工程资源,非临床产品。注释输出不构成诊断。若有相关使用,请引用 McLaren 等人的 Ensembl Variant Effect Predictor 论文(Genome Biology, 2016)及所用的基础数据源。




