遇见数据集

vepyr_116_GRCh38_ensembl

收藏
Hugging Face2026-09-03 更新2026-09-04 收录
官方服务:

资源简介:

该数据集是Ensembl VEP 116版本、GRCh38人类参考基因组注释缓存的Parquet格式转换,专为vepyr(基于Rust/DataFusion的变异注释引擎)设计。包含7,632个文件,总大小约32.5 GiB,每个文件对应一个contig和一种特征类型。主要目录包括:exon/(外显子边界、相位、转录本/基因关联)、motif/(转录因子结合基序和结合矩阵)、regulatory/(调控构建特征和表观基因组活性)、transcript/(完整转录本模型:序列、结构、标识符、标志)、translation_core/(CDS和蛋白质序列、蛋白质特征)、translation_sift/(预计算的SIFT和PolyPhen-2替代矩阵)、variation/(已知变异、频率、临床意义)。variation/目录包含染色体、起始/结束位置、等位基因字符串、变异名称、临床意义、频率等字段,数据来源包括1000 Genomes、gnomAD、ClinVar、COSMIC、HGMD等。坐标系统为1基。该数据集主要用于变异效应预测(VEP)的缓存,支持vepyr引擎进行变异注释,也可用于其他基于Parquet的分析工具(如DuckDB、Polars、DataFusion)。注意:包含COSMIC v102和HGMD-PUBLIC 2020.4记录,商业用途需获得许可。

This dataset is a Parquet format conversion of the Ensembl VEP 116 release, GRCh38 human reference genome annotation cache, designed for vepyr (a Rust/DataFusion-based variant annotation engine). It contains 7,632 files totaling approximately 32.5 GiB, each corresponding to a contig and feature type. Main directories include: exon/ (exon boundaries, phase, transcript/gene associations), motif/ (transcription factor binding motifs and binding matrices), regulatory/ (regulatory build features and epigenomic activity), transcript/ (complete transcript models: sequence, structure, identifiers, flags), translation_core/ (CDS and protein sequences, protein features), translation_sift/ (precomputed SIFT and PolyPhen-2 substitution matrices), variation/ (known variants, frequencies, clinical significance). The variation/ directory contains fields such as chromosome, start/end positions, allele strings, variant names, clinical significance, frequencies, with data from sources including 1000 Genomes, gnomAD, ClinVar, COSMIC, HGMD. Coordinate system is 1-based. The dataset is primarily used as a cache for variant effect prediction (VEP) and supports the vepyr engine for variant annotation, as well as other Parquet-based analysis tools (e.g., DuckDB, Polars, DataFusion). Note: includes COSMIC v102 and HGMD-PUBLIC 2020.4 records, which require third-party licenses for commercial use.

创建时间:
2026-08-26
原始信息汇总

数据集详情总结

基本信息

  • 数据集名称:vepyr VEP 116 GRCh38 Ensembl cache
  • 适用版本:Ensembl VEP 116,GRCh38(Ensembl)
  • 许可协议:混合第三方协议,详见数据集卡片;需遵守Ensembl免责声明
  • 数据类型:基因组学、变异注释、VEP、Ensembl、GRCh38
  • 数据规模:100M < n < 1B 条记录

数据集描述

这是Ensembl VEP 116 homo_sapiens_ensembl 缓存的Parquet格式转换版本,用于vepyr(一个基于Rust/DataFusion的变异注释引擎)。该转换替代了VEP的Perl序列化gzip缓存文件,提供可直接由DuckDB、Polars、DataFusion或Spark读取的列式Parquet格式文件。数据仅包含Ensembl/GENCODE转录本,是VEP默认缓存风格。

数据来源版本

组件 版本
Ensembl / VEP 发布 116
组装 GRCh38.p14
基因集 GENCODE 50
调控元件构建 1.0 (116种细胞类型/表观基因组)
SIFT 6.2.1
PolyPhen-2 2.2.3
dbSNP 156
ClinVar 2025-09
COSMIC v102
HGMD-PUBLIC 2020.4
1000 Genomes phase 3
gnomAD 外显子组 v4.1
gnomAD 基因组 v4.1

数据内容与结构

  • 总计:7,632个文件,约31.8 GiB,每个contig及功能类型对应一个Parquet文件(包括主组装、支架、补丁和LRG区域)。

  • 目录结构

    目录 文件数 大小 内容
    exon/ 1,851 0.12 GiB 外显子边界、相位、转录本/基因关联
    motif/ 25 0.03 GiB 转录因子结合基序及结合矩阵
    regulatory/ 25 0.01 GiB 调控元件构建特征和表观基因组活性
    transcript/ 1,851 0.26 GiB 完整转录本模型
    translation_core/ 1,722 0.20 GiB CDS及蛋白质序列、蛋白质特征
    translation_sift/ 1,693 4.06 GiB 预计算的SIFT和PolyPhen-2替代矩阵
    variation/ 464 27.17 GiB 已知变异、频率、临床意义
  • 坐标系统:1-based(Parquet元数据记录为bio.coordinate_system_zero_based = false),并嵌入bio.vep.cache_version = 116bio.vep.cache_source_type = ensembl等元数据。

重要特性

  • 数据溯源exon/transcript/motif/regulatory/目录中的每行均携带上游来源版本信息列(如source_assemblysource_gencodesource_dbsnp等)。
  • 数据分层variation/行带有tier列(0=热数据,1=冷数据),按(tier, start)排序,便于针对常见变异的查询优化。
  • 版本兼容性:该缓存与任何引擎版本兼容,建议搭配v0.19.2或更高版本使用以获取伴随的引擎修复。

使用限制与合规性

  • 商业使用限制:该缓存整体不适用于商业免费使用。它继承自上游VEP缓存中的COSMIC v102和HGMD-PUBLIC 2020.4记录,两者均需要商业许可证。
  • 可过滤性:COSMIC记录可通过非空cosmic_ids识别;HGMD-PUBLIC记录具有字面量allele_string = HGMD_MUTATION。可通过SQL过滤去除,例如在chr21上可移除约0.96%的此类记录。
  • 免责声明:用户需自行负责合规,商业用户需获得相关许可证或排除受限记录。该数据集为研究和软件工程资源,非临床产品。

用途场景

该数据集适用于基因组变异注释研究,可直接替换VEP缓存并在vepyr或其他支持Parquet的引擎中使用,支持分染色体按需下载。

搜集汇总
数据集介绍
vepyr_116_GRCh38_ensembl 数据集图片
构建方式
本数据集源自Ensembl VEP 116版本的GRCh38人源注释缓存,经vepyr引擎转换为列式Parquet格式,以替代传统的Perl序列化压缩文件。构建过程严格遵循上游缓存的info.txt信息,确保每个Parquet文件内嵌源版本元数据,实现完全的可追溯性。数据集按contig和特征类型划分,共包含7,632个文件,覆盖exon、motif、regulatory、transcript、translation_core、translation_sift及variation七大目录,其中variation目录存储已知变异、等位基因频率及临床 Significance 数据。坐标系统采用1-based,并明确记录于文件元数据中,保证数据解读的准确性。
特点
该数据集的核心特色在于其兼容性与高效性。Parquet格式使得DuckDB、Polars、DataFusion及Spark等现代数据分析工具可直接读取,无需额外转换。每个文件内嵌的source_*列详细记录了各数据源版本,如GENCODE 50、ClinVar 2025-09等,极大增强了数据的可信度。variation目录中的tier列(0为热数据,1为冷数据)及按此排序的设计,优化了针对常见变异的查询性能。此外,数据构建过程实现了字节级可重现性,确保不同批次转换结果完全一致,消除了由于线程调度或区域边界导致的微小差异。
使用方法
使用方式灵活多样。用户可通过HuggingFace CLI按需下载整个缓存或仅特定contig的文件,如chr21,并需同时获取chrom_manifest.json以维持cache元数据完整性。对于不依赖vepyr的开发者,可直接使用SQL查询Parquet文件,例如筛选特定基因的转录本信息。数据还支持通过过滤cosmic_ids为空且allele_string非'HGMD_MUTATION'的记录,来获得不包含商业受限数据源的子集,以满足非学术用途的合规要求。同时,vepyr引擎已验证该缓存可精确重现Ensembl VEP 116的注释结果,确保了在变异注释流程中的可靠性。
背景与挑战
背景概述
该数据集由biodatageeks团队于2026年创建,旨在解决基因组变异注释领域中对大规模、高效处理需求的日益增长。随着测序技术的飞速发展,产生的变异数据量呈指数级增长,传统基于Perl序列化的VEP缓存格式在处理这些数据时显得力不从心,存储效率低、查询速度慢。该数据集通过将Ensembl VEP 116版本针对GRCh38装配的缓存文件转换为列式Parquet格式,为基因组学研究者提供了一种可直接被现代数据分析框架(如DuckDB、Polars、DataFusion和Spark)高效读取的替代方案。这一创新举措不仅提升了数据处理的灵活性,还实现了与VEP工具在后果预测上的高度一致性,为大规模变异注释任务提供了坚实的数据基础,对推动基因组医学和群体遗传学研究具有重要意义。
当前挑战
该数据集面临多重挑战。首要挑战在于遗传数据的内在复杂性,包括变异注释需要整合基因组序列、转录本结构、调控元件及多源群体频率等多种维度,而Ensembl VEP过程本身需要精确协调这些异构数据。其次,数据集的构建过程极具挑战性,需将VEP的Perl序列化缓存无损地转换为列式格式,同时保证输出结果与原始VEP调用在生物学含义上的完全一致。这涉及VEP内部使用的特定数据结构的处理,例如转录本与基因映射、重叠群边界等。此外,数据来源的多样性,如COSMIC和HGMD-PUBLIC,引入了许可约束,特别是商业用途限制,增加了合规负担。最终,数据集的规模庞大(约31.8 GiB),对存储和检索效率提出了严苛要求,同时还要确保数据版本更新的精确性和构建过程的可重复性。
常用场景
经典使用场景
vepyr_116_GRCh38_ensembl数据集作为Ensembl VEP 116版本在GRCh38人类参考基因组上的预计算注释缓存,以列式Parquet格式存储,专为vepyr引擎设计。其经典使用场景在于大规模全外显子组或全基因组测序数据的变异功能注释,尤其适用于需在分布式或内存计算框架(如DuckDB、Polars、DataFusion或Spark)中直接进行SQL查询和高效数据操作的场景。研究者可通过加载该数据集,快速获取变异位点的等位基因频率、临床意义、SIFT与PolyPhen-2预测分数、转录本及蛋白质序列等丰富注释信息,实现从原始VCF到可分析注释表的无缝转换,极大提升了变异注释流程的吞吐量和灵活性。
衍生相关工作
该数据集紧密关联vepyr引擎及其背后的datafusion-bio生态,推动了基于Rust和DataFrame语义的高性能变异注解引擎的发展。其生成过程涉及对VEP缓存格式的逆向工程和转换,衍生出如变异注释输出与VEP严格比对验证的基准工作,以及缓存构建的确定性优化研究,例如确保跨区域重复转录本的一致性和构建的字节级可重现性。这些工作促进了生物信息软件工程与大数据技术、云原生计算的融合,为将来开发更高效、可扩展的基因组分析平台提供了坚实的数据基础设施和示范案例。
数据集最近研究
最新研究方向
该数据集代表了基因组变异注释领域的一项革新性进展,其核心在于将传统的Ensembl VEP Perl序列化缓存转换为列式Parquet格式,从而极大地提升了变异注释的效率和可扩展性。这一转换不仅使得DuckDB、Polars等现代数据分析工具能够直接读取,还通过嵌入数据溯源信息增强了结果的透明度和可复现性。该数据集的最新研究方向聚焦于利用大数据和分布式计算技术,推动群体规模的全基因组注释分析,尤其是在精准医学和临床基因组解读中,实现对海量变异位点的快速、准确的功能预测。此外,其可复现构建流程和严格的字节级验证机制,也为生物信息学数据基础设施的标准化和可互操作性设立了新的标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务