遇见数据集

vepyr_116_GRCh38_merged

收藏
Hugging Face2026-09-03 更新2026-09-04 收录
官方服务:

资源简介:

vepyr缓存数据集是Ensembl VEP 116版本中人类基因组(GRCh38)合并缓存(merged)的Parquet格式转换,专为vepyr(基于Rust/DataFusion的变异注释引擎)设计。该数据集以列式Parquet文件替代VEP原有的Perl序列化gzip缓存,可直接被DuckDB、Polars、DataFusion或Spark读取。数据集同时包含Ensembl/GENCODE和NCBI RefSeq两种转录本注释(对应VEP的--merged参数)。数据集包含7,697个Parquet文件,总大小约35.8 GiB,每个contig(包括主组装、scaffold、补丁和LRG区域)按特征类型分别存储。目录结构包括:exon/(外显子边界)、motif/(转录因子结合基序)、regulatory/(调控元件)、transcript/(完整转录本模型)、translation_core/(CDS和蛋白质序列)、translation_sift/(预计算的SIFT和PolyPhen-2替换矩阵)、variation/(已知变异、频率和临床意义)。variation/目录包含464个文件共27.17 GiB,记录变异名称、等位基因、临床意义、人群频率(1000 Genomes phase 3、gnomAD exomes v4.1、gnomAD genomes v4.1)等字段。所有坐标均为1-based,并在Parquet元数据中标注。数据集的溯源信息嵌入在每个文件中,包含source_assembly、source_gencode等列,可验证版本。注意:部分数据源(COSMIC v102和HGMD-PUBLIC 2020.4)受第三方许可限制,商业用途需获得相应许可或过滤掉相关记录(可通过cosmic_ids为NULL且allele_string不等于HGMD_MUTATION进行过滤)。数据集适用于研究、软件工程以及变异注释,但不应用于临床诊断。

The vepyr cache dataset is a Parquet format conversion of the merged cache for human genome (GRCh38) from Ensembl VEP release 116, designed for vepyr (a Rust/DataFusion-based variant annotation engine). It replaces VEPs original Perl-serialized gzip cache with columnar Parquet files, readable by DuckDB, Polars, DataFusion, or Spark. The dataset includes both Ensembl/GENCODE and NCBI RefSeq transcript annotations (corresponding to VEPs --merged parameter). It consists of 7,697 Parquet files totaling approximately 35.8 GiB, with each contig (including primary assembly, scaffolds, patches, and LRG regions) stored by feature type. Directory structure includes: exon/ (exon boundaries), motif/ (transcription factor binding motifs), regulatory/ (regulatory elements), transcript/ (complete transcript models), translation_core/ (CDS and protein sequences), translation_sift/ (precomputed SIFT and PolyPhen-2 substitution matrices), variation/ (known variants, frequencies, and clinical significance). The variation/ directory contains 464 files (27.17 GiB) recording variant names, alleles, clinical significance, population frequencies (1000 Genomes phase 3, gnomAD exomes v4.1, gnomAD genomes v4.1), etc. All coordinates are 1-based and annotated in Parquet metadata. Provenance information is embedded in each file, including source_assembly, source_gencode columns for version verification. Note: Some data sources (COSMIC v102 and HGMD-PUBLIC 2020.4) are under third-party license restrictions; commercial use requires obtaining appropriate licenses or filtering out relevant records (via filtering where cosmic_ids is NULL and allele_string is not HGMD_MUTATION). The dataset is suitable for research, software engineering, and variant annotation, but not for clinical diagnosis.

创建时间:
2026-08-26
原始信息汇总

vepyr VEP 116 GRCh38 合并缓存数据集

数据集概述

该数据集是 Ensembl VEP 116 homo_sapiens_merged GRCh38 缓存 的 Parquet 格式转换版本,专为 vepyr 设计,vepyr 是一个基于 Rust/DataFusion 的变异注释引擎。数据集将 VEP 传统的 Perl 序列化 gzip 缓存文件替换为列式 Parquet 格式,可直接被 DuckDB、Polars、DataFusion 或 Spark 读取。

重要提示:该缓存整体不免费用于商业用途,因其继承了上游 VEP 缓存中的 COSMIC v102 和 HGMD-PUBLIC 2020.4 记录,两者均需商业许可。

数据规模

  • 总文件数:7,697 个文件
  • 总大小:约 34.9 GiB
  • 分类:100M < n < 1B
  • 每个 contig 对应一个 Parquet 文件(每个特征类型一个),contig 包括主组装、scaffolds、patches 和 LRG 区域

源数据版本

组件 版本
Ensembl / VEP 发布版本 116
组装 GRCh38.p14
基因集 GENCODE 50
RefSeq 注释 GCF_000001405.40-RS_2025_08
Regulatory Build 1.0(116 种细胞类型/表观基因组)
SIFT 6.2.1
PolyPhen-2 2.2.3
dbSNP 156
ClinVar 2025-09
COSMIC v102
HGMD-PUBLIC 2020.4
1000 Genomes phase 3
gnomAD exomes v4.1
gnomAD genomes v4.1

目录结构

目录 文件数 大小 内容
exon/ 1,870 0.14 GiB 外显子边界、相位、转录本/基因关联
motif/ 25 0.03 GiB 转录因子结合基序和结合矩阵
regulatory/ 25 0.01 GiB Regulatory Build 特征和表观基因组活性
transcript/ 1,870 0.30 GiB 完整转录本模型:序列、结构、标识符、标志
translation_core/ 1,744 0.32 GiB CDS 和蛋白质序列、蛋白质特征
translation_sift/ 1,697 6.97 GiB 预计算的 SIFT 和 PolyPhen-2 替换矩阵
variation/ 464 27.17 GiB 已知变异、频率、临床意义

数据模式

variation/ 目录包含:染色体、位置、等位基因字符串、变异名称、体细胞状态、临床意义、COSMIC/dbSNP/ClinVar ID、tier(0=热,1=冷),以及 1000 Genomes phase 3、gnomAD exomes v4.1 和 gnomAD genomes v4.1 的等位基因频率。

transcript/ 目录包含完整转录本模型:cDNA/肽段/剪接序列、UTR、外显子结构、翻译起始/终止位置、基因符号、HGNC ID、MANE Select、TSL、APPRIS、CCDS、SwissProt、规范转录本标志等。

溯源信息

所有源版本均嵌入在 Parquet 文件中,以 source_* 列形式记录。每个转录本行上的 source_cache 列为 EnsemblRefSeq,可区分两套注释。

许可与合规

来源 版本 条款
Ensembl/GENCODE/Regulatory Build 116 / 50 / 1.0 无限制使用
dbSNP 156 公共领域
ClinVar 2025-09 公共领域
gnomAD v4.1 CC0 公共领域
1000 Genomes phase 3 开放获取
SIFT 6.2.1 需查看其条款
PolyPhen-2 2.2.3 需查看其条款
COSMIC v102 仅限学术/非营利免费,商业需许可
HGMD-PUBLIC 2020.4 仅限注册学术/非营利用户免费,商用需 QIAGEN 许可

商业用户可通过过滤 cosmic_ids 非空记录(COSMIC)和 allele_string = HGMD_MUTATION 记录(HGMD-PUBLIC)来排除受限数据。在 chr21 上,这约移除 0.96% 的变异记录。

预期用途与引用

该数据集是研究和软件工程资源,非临床产品。注释输出不构成诊断。若有相关使用,请引用 McLaren 等人的 Ensembl Variant Effect Predictor 论文(Genome Biology, 2016)及所用的基础数据源。

搜集汇总
数据集介绍
vepyr_116_GRCh38_merged 数据集图片
构建方式
该数据集是Ensembl VEP 116版本针对人类参考基因组GRCh38的合并缓存数据的Parquet格式转换版,由biodatageeks团队构建,旨在服务于vepyr——一种基于Rust和DataFusion的变异注释引擎。其构建过程将VEP原始的Perl序列化压缩文件(gzip格式)转化为列式存储的Parquet文件,使得DuckDB、Polars、DataFusion或Spark等现代数据分析工具能直接读取。数据集中整合了Ensembl/GENCODE与NCBI RefSeq两套转录本注释,并嵌入了详细的来源版本信息,如dbSNP 156、ClinVar 2025-09、gnomAD v4.1等,所有元数据均以列形式存储于每个文件中,确保了数据的可追溯性与完整性。
特点
该数据集的一大特色是全面性与可定制性。它包含约34.9 GiB的Parquet文件,涵盖变异、转录本、外显子、调控元件等六类注释数据,并囊括了临床意义、等位基因频率、蛋白质功能预测等丰富字段。尤为突出的是,数据集在变异部分提供了分层存储机制,依据等位基因频率将变异分为冷热两类,便于高效检索。此外,其源头版本信息嵌入每个数据行,用户可清晰区分Ensembl与RefSeq注释。但需注意,数据集中包含COSMIC与HGMD-PUBLIC受版权保护的记录,商业使用需进行过滤或获取授权。
使用方法
该数据集可通过Hugging Face CLI工具便捷获取,用户既可完整下载,也可按染色体和注释类型选择性下载,配合chrom_manifest.json文件使用。vepyr引擎能直接读取该Parquet缓存,实现与Ensembl VEP 116完全一致的注释结果。此外,数据集无需vepyr引擎也可用SQL直接查询,例如通过DuckDB对特定染色体进行筛选分析。对于商业用户,可通过识别cosmic_ids字段及'HGMD_MUTATION'等条件剔除受限内容,以构建无商业限制的子集。该资源主要面向研究与软件工程场景,不适用于临床直接诊断。
背景与挑战
背景概述
vepyr_116_GRCh38_merged数据集由BiodataGeeks团队于2026年创建,基于Ensembl VEP 116版本和GRCh38.p14参考基因组,整合了GENCODE 50与RefSeq注释信息,旨在为Rust/DataFusion变异注释引擎vepyr提供高效、可扩展的列式存储缓存。该数据集将传统VEP的Perl序列化压缩缓存转换为Parquet格式,使DuckDB、Polars、DataFusion及Spark等现代数据分析工具能够直接读取,从而显著提升了变异注释的计算效率与可访问性。其核心研究问题在于解决基因组变异注释领域面临的数据规模庞大、格式异构及计算瓶颈,通过嵌入数据溯源信息(如source_*列)确保版本可验证性,对精准医学和群体遗传学研究具有重要推动作用。
当前挑战
该数据集面临的核心挑战包括:领域内,变异注释需处理全基因组范围的巨型数据(约35 GiB,含7700个文件),传统串行工具难以应对现代高通量测序产生的海量变异,且整合多源注释(如Ensembl、RefSeq、COSMIC、ClinVar等)在保持版本兼容性与一致性方面存在巨大难度;构建过程中,跨1 Mb缓存区域边界的转录本在去重时可能产生拷贝差异,需确定统一的优先级规则以确保注释结果与原始VEP一致,同时满足字节级可复现构建的要求,涉及线程顺序和区域文件选择的确定性排序问题。此外,需在Parquet化过程中嵌入全面的溯源元数据,并解决部分数据源(如COSMIC和HGMD-PUBLIC)的商业授权限制,通过提供过滤方案实现合规使用。
常用场景
经典使用场景
在基因组学与生物信息学领域,变异注释是连接原始测序数据与临床或功能解读的关键环节。该数据集以列式Parquet格式重新封装了Ensembl VEP 116针对GRCh38的合并缓存,深度融合GENCODE与RefSeq双重转录本注释体系,为大规模全基因组或全外显子组测序研究提供了高效、可并行读取的变异效应预测基础。其典型应用场景涵盖罕见病家系中的致病变异筛选、肿瘤体细胞突变的功能后果评估,以及群体遗传学中基于gnomAD等频率数据的常见变异过滤,亦适用于跨物种比较基因组学中的注释一致性校验。研究者可借助DuckDB、Polars或Apache Spark等现代数据分析框架,直接对千万级变异记录执行亚秒级交互式查询,显著加速从原始VCF到临床可解释变异列表的转化流程。
解决学术问题
该数据集直面传统VEP Perl序列化缓存格式在现代大数据分析环境下的可扩展性瓶颈,有效解决了三大核心学术挑战:其一,将臃肿且格式专有的gzip压缩缓存转换为自描述的Parquet列式存储,使变异注释数据能够无缝融入标准数据湖架构,实现与临床表型、表达谱等多模态组学数据的联合分析;其二,通过统一Ensembl/GENCODE与NCBI RefSeq两套转录本注释体系,克服了单一注释来源导致的漏检与偏倚问题,为精准鉴定剪接位点破坏、移码突变及无义介导衰变等复杂效应提供了全面参考,并嵌入SIFT与PolyPhen-2等有害性预测矩阵,支持功能影响的定量评估;其三,内置完整的数据溯源列(如source_*),赋予每条记录可验证的来源版本信息,解决了跨库整合时的可重复性与版本一致性问题,为高通量变异注释建立了一个可靠且透明的基准数据集。
衍生相关工作
该数据集的发布催生了一系列衍生性前沿工作,深刻影响了变异注释生态的技术演进方向。其原始VEP缓存转换方法论直接启发了基于DataFusion与Apache Arrow生态的高性能注释引擎vepyr的发展,后者通过内存列式处理与并行化策略,将全基因组注释时间从数小时压缩至分钟级,颠覆了传统Perl实现的计算效率基准。此缓存亦成为测试与验证新一代变异效应预测工具的参照系,例如机器学习驱动的剪接效应预测器或基于蛋白质语言模型的有害性评分系统,均以此类注释输出为训练或评估的特征金标准。同时,其关于跨VEP缓存区域转录本去重与确定性构建的修正,不仅提升了自身数据质量,也为其他基因组注释数据库的工程化构建提供了宝贵经验;且其内嵌来源版本的设计模式,被后续多个生物医学数据项目采纳为记录数据谱系的标准实践。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务