遇见数据集

vepyr_116_GRCh38_refseq

收藏
Hugging Face2026-09-03 更新2026-09-04 收录
官方服务:

资源简介:

vepyr cache — Ensembl VEP 116, GRCh38 (RefSeq) 是一个将 Ensembl VEP 116 的 `homo_sapiens_refseq` 缓存转换为 Parquet 列式格式的数据集,专门用于 vepyr(一个基于 Rust/DataFusion 的变体注释引擎)。该数据集仅包含 NCBI RefSeq 转录本,对应于 VEP 的 `--refseq` 模式。数据集总大小约 30.7 GiB,包含 2351 个 Parquet 文件,按每条染色体和每个特征类型(如变异、转录本、外显子、调控特征、基序等)分片存储。具体目录包括:`exon/`(外显子边界、相位、转录本/基因链接)、`motif/`(转录因子结合基序和结合矩阵)、`regulatory/`(调控构建特征和表观基因组活性)、`transcript/`(完整转录本模型:序列、结构、标识符、标志)、`translation_core/`(CDS 和蛋白质序列、蛋白质特征)、`translation_sift/`(预计算的 SIFT 和 PolyPhen-2 替代矩阵)、`variation/`(已知变异、频率、临床意义)。坐标系统为 1 基,嵌入在 Parquet 元数据中。数据来源包括 Ensembl 116、GRCh38.p14、GENCODE 50、RefSeq 注释、dbSNP 156、ClinVar 2025-09、COSMIC v102、HGMD-PUBLIC 2020.4、1000 Genomes phase 3、gnomAD v4.1 等,这些版本信息也作为列嵌入在数据中。该数据集适用于基因组变异注释、频率分析和临床意义评估,但需注意商业使用限制:COSMIC v102 和 HGMD-PUBLIC 2020.4 数据需要商业许可,可通过过滤 `variation/` 中 `cosmic_ids` 非空或 `allele_string` 为 HGMD_MUTATION 的行来获得无商业限制的子集。该数据集是研究和软件工程资源,非临床产品。

vepyr cache — Ensembl VEP 116, GRCh38 (RefSeq) is a dataset that converts the `homo_sapiens_refseq` cache of Ensembl VEP 116 into Parquet columnar format, specifically designed for vepyr (a Rust/DataFusion-based variant annotation engine). It contains only NCBI RefSeq transcripts, corresponding to VEPs `--refseq` mode. The dataset is approximately 30.7 GiB in size, consisting of 2351 Parquet files sharded by chromosome and feature type (e.g., variation, transcript, exon, regulatory features, motifs). Directories include: `exon/` (exon boundaries, phase, transcript/gene links), `motif/` (transcription factor binding motifs and position weight matrices), `regulatory/` (regulatory build features and epigenomic activity), `transcript/` (full transcript models: sequence, structure, identifiers, flags), `translation_core/` (CDS and protein sequences, protein features), `translation_sift/` (precomputed SIFT and PolyPhen-2 substitution matrices), `variation/` (known variants, frequencies, clinical significance). Coordinate system is 1-based, embedded in Parquet metadata. Data sources include Ensembl 116, GRCh38.p14, GENCODE 50, RefSeq annotation, dbSNP 156, ClinVar 2025-09, COSMIC v102, HGMD-PUBLIC 2020.4, 1000 Genomes phase 3, gnomAD v4.1, etc., with version information also embedded as columns. The dataset is suitable for genomic variant annotation, frequency analysis, and clinical significance assessment, but with commercial use restrictions: COSMIC v102 and HGMD-PUBLIC 2020.4 require commercial licenses; a subset without commercial restrictions can be obtained by filtering rows in `variation/` where `cosmic_ids` is non-empty or `allele_string` is HGMD_MUTATION. This dataset is a research and software engineering resource, not a clinical product.

创建时间:
2026-08-26
原始信息汇总

vepyr VEP 116 GRCh38 RefSeq 缓存数据集说明

数据集概况

这是一个将 Ensembl VEP 116 homo_sapiens_refseq 缓存(基于 GRCh38) 转换为 Parquet 列式格式的数据集,专为 vepyr 变异注释引擎设计。该引擎是 Rust/DataFusion 实现的,可复现 VEP 的结果判定,并用 Parquet 文件取代 VEP 原本的 Perl 序列化 gzip 缓存,使 DuckDB、Polars、DataFusion 或 Spark 可直接读取。

注意:该数据集仅包含 NCBI RefSeq 转录本(对应 VEP 的 --refseq 调用模式)。

数据来源与版本

所有上游来源版本均嵌入在 Parquet 文件中,可通过 source_* 列验证:

组件 版本
Ensembl / VEP 版本 116
基因组组装 GRCh38.p14
基因集 GENCODE 50
RefSeq 注释 GCF_000001405.40-RS_2025_08
Regulatory Build 1.0(116 种细胞类型/表观基因组)
SIFT 6.2.1
PolyPhen-2 2.2.3
dbSNP 156
ClinVar 2025-09
COSMIC v102
HGMD-PUBLIC 2020.4
1000 Genomes phase 3
gnomAD 外显子组 v4.1
gnomAD 基因组 v4.1

数据内容与规模

总计 2,351 个文件,约 30.4 GiB,每个重叠群/特征类型对应一个 Parquet 文件。

目录 文件数 大小 内容
exon/ 521 0.03 GiB 外显子边界、相位、转录本/基因关联
motif/ 25 0.03 GiB 转录因子结合基序与结合矩阵
regulatory/ 25 0.01 GiB Regulatory Build 特征与表观基因组活性
transcript/ 521 0.12 GiB 完整转录本模型(序列、结构、标识、标志)
translation_core/ 419 0.13 GiB CDS 和蛋白质序列、蛋白质特征
translation_sift/ 374 2.91 GiB 预计算的 SIFT 和 PolyPhen-2 替代矩阵
variation/ 464 27.17 GiB 已知变异、频率、临床意义

说明variation/ 目录在三个仓库(ensemblrefseqmerged)中数据完全相同;三个缓存的区别仅在于转录本/外显子/翻译部分。

数据模式

variation/ 目录包含:染色体、位置、等位基因、变异名称、体细胞状态、临床意义、表型/疾病、PubMed、次要等位基因及频率、ClinVar/COSMIC/dbSNP ID、Tier 分层、1000 Genomes 和 gnomAD 的等位基因频率数据。

transcript/ 目录包含完整转录本模型:cDNA/多肽/剪接序列、UTRs、外显子结构、CDS 起点/终点、转录本标识符与标志(如 MANE、TSL、APPRIS、CCDS、SwissProt、经典转录本标识等)。

坐标体系:1-based(坐标从 1 开始),通过 Parquet 元数据记录。

数据来源追溯

exon/transcript/motif/regulatory/ 的每行均携带来源版本列(source_*),便于用户自行验证;source_cache 列为空,表明所有转录本均来自 RefSeq。

使用建议

用户可通过 Hugging Face CLI 按需下载完整缓存或仅下载特定染色体的数据(如 chr21.parquet + chrom_manifest.json)。注意 vepyr 0.4.0 版本对部分下载有特殊要求,需要调整清单文件。相关文件也无需 vepyr 即可用 SQL 直接查询。

许可与合规

该数据集整体不适用于商业用途,因其包含需要商业许可的 COSMIC v102 和 HGMD-PUBLIC 2020.4 记录。商业用户需自行获取相应许可或通过 SQL 过滤掉相关记录:

  • COSMIC 记录:cosmic_ids 非空
  • HGMD-PUBLIC 记录:allele_string = HGMD_MUTATION

其他来源(Ensembl、GENCODE、Regulatory Build、dbSNP、ClinVar、gnomAD、1000 Genomes)均无限制或可公开获取。

预期用途

本数据集是研究与软件工程资源,而非临床产品。注释输出不构成诊断,且结果判定取决于所选转录本集合。

引用参考

使用该数据集时请引用 Ensembl VEP 论文(McLaren et al., Genome Biology, 2016)及所依赖的底层数据源(GENCODE、dbSNP、ClinVar、gnomAD、COSMIC、HGMD、SIFT、PolyPhen-2 等)。

搜集汇总
数据集介绍
vepyr_116_GRCh38_refseq 数据集图片
构建方式
vepyr_116_GRCh38_refseq数据集源自Ensembl VEP 116版本的homo_sapiens_refseq缓存,针对人类参考基因组GRCh38.p14构建。该数据集采用列式存储格式Parquet,将原本以Perl序列化并压缩的VEP缓存文件转换为可直接由DuckDB、Polars、DataFusion或Spark读取的结构化数据。整个数据集包含2,351个文件,总大小约30.4 GiB,按contig和特征类型分目录存储,涵盖exon、motif、regulatory、transcript、translation_core、translation_sift及variation等七类注释信息。每个文件均嵌入了上游数据源的版本信息,确保数据来源可追溯。
特点
该数据集的一个显著特点是其全面性与精细度。它整合了来自GENCODE 50、dbSNP 156、ClinVar 2025-09、COSMIC v102、HGMD-PUBLIC 2020.4、gnomAD v4.1等多个权威数据库的注释信息。variation目录收录了已知变异、等位基因频率及临床意义等丰富字段,而transcript目录则提供了完整的转录本模型,包括序列、结构及功能注释。此外,数据采用1-based坐标系统,并通过Parquet元数据明确标识,同时利用tier列对变异进行冷热分层排序,优化了查询性能。值得注意的是,该数据集包含COSMIC与HGMD-PUBLIC的受限数据,商业用户需注意合规性,可通过特定字段进行过滤。
使用方法
该数据集专为vepyr引擎设计,支持与Ensembl VEP一致的变异注释功能。用户可通过huggingface_hub的hf download命令便捷地获取完整数据集或按需下载特定contig的Parquet文件。借助DuckDB等工具,可直接以SQL语句查询分析,例如筛选特定基因的转录本信息。vepyr引擎已验证在chr1-22、chrX及chrY上能复现Ensembl VEP 116的字节级一致注释结果。对于商业用户,可通过排除cosmic_ids非空及allele_string为'HGMD_MUTATION'的记录来获得无第三方限制的子集。该数据集作为研究与软件工程资源,不应用于临床诊断。
背景与挑战
背景概述
vepyr_116_GRCh38_refseq数据集由biodatageeks团队于2026年构建,旨在将Ensembl VEP 116的RefSeq缓存转换为列式Parquet格式,以支持vepyr引擎——一个基于Rust/DataFusion的变异注释工具。该数据集整合了GRCh38.p14基因组、GENCODE 50基因集、dbSNP 156、ClinVar 2025-09、gnomAD v4.1等权威数据源,并内嵌完整溯源信息。其核心研究问题在于提升大规模基因组变异注释的效率和可访问性,使DuckDB、Polars、DataFusion或Spark等现代数据分析工具能直接读取,从而替代VEP传统的Perl序列化、gzip压缩缓存。该数据集在生物信息学领域推动了变异注释流程的现代化,为精准医学和群体遗传学研究提供了高性能、可复现的数据基础。
当前挑战
该数据集面临的挑战包括:1) 解决领域问题:传统VEP缓存采用Perl序列化和gzip压缩,难以被现代大数据工具直接利用,且注释过程运行于单机Perl环境,处理全基因组规模变异时效率低下。vepyr通过列式存储和元数据内嵌,实现了跨平台的高效并行读取,但需保证与VEP结果字节级一致,这对数据转换的精确性提出了严苛要求。2) 构建过程挑战:数据整合涉及多源异构数据(如COSMIC、HGMD-PUBLIC)的许可合规问题,需在保持数据完整性的同时提供过滤方案;同时,跨1Mb缓存区域边界的转录本去重曾导致注释不一致,需通过算法修复实现可重现构建。此外,缓存体积达30.4 GiB,如何在分片下载与元数据管理间平衡,以及确保部分下载后vepyr引擎稳定运行,亦是技术难点。
常用场景
经典使用场景
vepyr_116_GRCh38_refseq数据集是针对人类参考基因组GRCh38的Ensembl VEP 116缓存数据的Parquet格式转换,专为vepyr变异注释引擎设计。其经典使用场景在于高效地进行大规模基因组变异的功能注释,通过列式存储格式,使得DuckDB、Polars、DataFusion或Spark等现代数据分析框架能直接读取,从而极大提升了变异注释流程的吞吐量和灵活性。研究人员可借此快速获取变异在转录本、蛋白质序列上的后果预测,并整合来自ClinVar、gnomAD等数据库的人群频率与临床意义信息,为下游的关联分析和功能解读奠定数据基础。
解决学术问题
该数据集直面传统VEP缓存文件格式(Perl序列化、gzip压缩)在处理现代大规模基因组数据时面临的性能瓶颈与互操作性挑战。通过将注释信息转化为列式Parquet格式,数据集解决了VEP注释流程中数据加载缓慢、难以并行处理及与主流数据科学工具链集成困难等问题。它为学术研究提供了一套可验证、具备完整来源追溯的标准化注释缓存,使得在百万级变异规模下的全基因组/外显子组注释成为可能,并保障了注释结果的可重复性,有力支撑了群体遗传学、罕见病致病机制挖掘等领域的大数据分析需求。
衍生相关工作
该数据集的构建与应用直接关联并推动了vepyr引擎及相关工具的演进,其验证过程确保了与Ensembl VEP输出的一致性,催生了如datafusion-bio-function-vep等生物信息学函数库的优化版本。数据集的生成逻辑,包括对跨区域转录本的确定性排序、可复现构建等问题的解决,反哺了上游的cache构建工具,为其他物种或版本注释缓存的标准化提供了范式。此外,围绕该数据集,社区可能衍生出针对不同分析框架(如Spark SQL)的查询优化案例、基于列式注释的变异过滤流程,以及融合群体频率与临床注释的快速变异筛选工具,进一步丰富了基因组大数据生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务