遇见数据集

vepyr_116_GRCh38_plugin_alphamissense

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

该数据集是vepyr的AlphaMissense插件缓存,基于GRCh38基因组构建和Ensembl VEP 116版本。它预构建了按频率分层的Parquet格式缓存,包含DeepMind AlphaMissense 2023年发布的错义突变致病性预测。数据来源为AlphaMissense_hg38.tsv.gz文件(仅包含标准转录本)。该缓存复现了VEP 116的--plugin AlphaMissense插件的CSQ输出,无需在注释时使用上游TSV文件或Perl插件。数据集包含22个常染色体染色体分片(chr1-chr22),不包括chrX、chrY和chrM。总数据量约545 MB,共68,241,195行,其中83,141行标记为warm(频率层0),68,158,054行标记为cold(频率层1)。模式包含8个字段:chrom(染色体)、start(1-based起始位置)、end(1-based结束位置)、allele_string(REF/ALT等位基因,VEP最小化)、protein_variant(蛋白变异描述符,格式为ref_aa+Protein_position+alt_aa)、am_class(致病性分类,值为likely benign、ambiguous或likely pathogenic)、am_pathogenicity(致病性分数,浮点数)、tier(频率层,0为warm,1为cold)。CSQ输出字段为am_class和am_pathogenicity,按VEP自身顺序排列。am_class阈值:分数<0.34为likely benign,>0.564为likely pathogenic,否则为ambiguous。该数据集适用于基因组变异注释,特别是使用vepyr引擎进行AlphaMissense致病性预测,也可直接通过DuckDB、Polars或DataFusion等工具查询Parquet文件。许可为CC BY-NC-SA 4.0,仅限非商业用途,且需进行引用。

This dataset is a plugin cache for AlphaMissense by vepyr, based on the GRCh38 genome build and Ensembl VEP version 116. It is pre-built as a frequency-tiered Parquet cache containing missense mutation pathogenicity predictions from DeepMind AlphaMissense released in 2023. The data source is the AlphaMissense_hg38.tsv.gz file (only canonical transcripts). This cache reproduces the CSQ output of VEP 116s --plugin AlphaMissense without requiring the upstream TSV file or Perl plugin during annotation. The dataset includes 22 autosome chromosome shards (chr1-chr22), excluding chrX, chrY, and chrM. Total data size is approximately 545 MB, with 68,241,195 rows, of which 83,141 are marked as warm (frequency tier 0) and 68,158,054 as cold (frequency tier 1). The schema contains 8 fields: chrom, start (1-based), end (1-based), allele_string (REF/ALT alleles, VEP-minimized), protein_variant (protein variant descriptor in ref_aa+Protein_position+alt_aa format), am_class (pathogenicity classification: likely benign, ambiguous, or likely pathogenic), am_pathogenicity (pathogenicity score, float), and tier (frequency tier: 0 for warm, 1 for cold). The CSQ output fields are am_class and am_pathogenicity, in VEPs own order. Thresholds for am_class: score < 0.34 is likely benign, > 0.564 is likely pathogenic, otherwise ambiguous. This dataset is suitable for genome variant annotation, particularly for AlphaMissense pathogenicity prediction using the vepyr engine, and can also be queried directly via tools like DuckDB, Polars, or DataFusion. Licensed under CC BY-NC-SA 4.0 for non-commercial use only, with attribution required.

创建时间:
2026-08-28
原始信息汇总

vepyr plugin cache — AlphaMissense (GRCh38, VEP 116) 数据集详情

数据集概述

这是一个为 vepyr(基于 Rust/DataFusion 的 VEP 兼容变异注释引擎)预构建的 AlphaMissense 致病性预测 Parquet 格式缓存数据集。它能够在不依赖上游 TSV 文件或 Perl 插件的情况下,复现 Ensembl VEP 116 的 --plugin AlphaMissense 的 CSQ 输出。

数据版本与来源

项目 详情
源文件 AlphaMissense_hg38.tsv.gz(经典转录本)
上游发布 DeepMind AlphaMissense,2023 年发布(Cheng 等,Science 2023)
源文件 MD5 9fd167735f16a1b87da6eb3e4c25fcb5
构建输入 MD5 46d0028375cf95088bd014ff6855cffd
源数据获取日期 2026-07-06
基因组版本 GRCh38 / hg38,1-based,含 chr 前缀
缓存构建日期 2026-08-27
目标 VEP 版本 Ensembl VEP 116

数据内容

  • 染色体范围:仅常染色体(chr1–chr22),不包含 chrX、chrY 和 chrM
  • 数据规模:约 545 MB,共 68,241,195 行(其中 warm 层 83,141 行,cold 层 68,158,054 行)
  • 文件格式:Parquet 分片文件(chr1.parquetchr22.parquet),每染色体一个分片
  • 附带文件manifest.json(包含 schema、CSQ 字段映射、各分片行数/分层计数及来源信息)

数据模式(Schema)

列名 类型 说明
chrom string 染色体(contig)
start uint32 1-based 位置
end uint32 1-based 位置
allele_string string VEP 最小化的 REF/ALT
protein_variant string 转录本匹配判别符,格式为 {ref_aa}{Protein_position}{alt_aa}
am_class string 映射为 CSQ 字段 am_class
am_pathogenicity float 映射为 CSQ 字段 am_pathogenicity
tier int8 频率分层 — 0 为 warm,1 为 cold

CSQ 输出字段(按 VEP 顺序):am_classam_pathogenicity

am_class 分类阈值(AlphaMissense 官方标准):

  • 评分 < 0.34:likely benign(可能良性)
  • 评分 > 0.564:likely pathogenic(可能致病)
  • 其他:ambiguous(意义不明确)

匹配语义

AlphaMissense 是一种逐转录本注释工具。VEP 将每个转录本后果的氨基酸变化与数据行的 protein_variant 进行匹配。查询键为 (chrom, start, end, allele_string) 加上 protein_variant 判别符(vepyr 在运行时根据引擎属性 ref_aaProtein_positionalt_aa 构建)。等位基因以最小化形式存储,与 AlphaMissense.pm 的匹配逻辑一致。

频率分层机制

  • 每个分片按 (tier, start) 排序
  • tier 从构建时使用的 release-116 GRCh38 variation cache 逐行继承;若插件行在变异缓存中无匹配,则标记为 cold
  • tier = 0(warm)仅占 0.12%(83,141 行),物理上排列在文件前端,因此仅查询 warm 数据时只需访问少量 row groups,无需扫描整个分片
  • 各分片的 warm/cold 计数可在 manifest.json 中查看

使用方式

可直接通过 hf download 命令下载该数据集到本地目录,例如:

bash hf download biodatageeks/vepyr_116_GRCh38_plugin_alphamissense --repo-type dataset --local-dir ~/vepyr_plugin_cache/plugin/alphamissense

文件为纯 Parquet 格式,可独立于 vepyr 直接用于 DuckDB、Polars 或 DataFusion 查询,例如使用 SQL 查询某个位置范围内的数据。

许可与引用

  • 许可协议:CC BY-NC-SA 4.0(仅限非商业用途,须相同方式共享)
  • 数据版权:© 2023 DeepMind Technologies Limited
  • 使用声明:AlphaMissense 仅供研究使用,未经临床直接应用验证
  • 引用文献:Cheng, J., Novati, G., Pan, J., et al. Accurate proteome-wide missense variant effect prediction with AlphaMissense. Science 381, eadg7492 (2023). doi:10.1126/science.adg7492
搜集汇总
数据集介绍
vepyr_116_GRCh38_plugin_alphamissense 数据集图片
构建方式
该数据集源自DeepMind发布的AlphaMissense致病变异预测结果,基于GRCh38参考基因组构建。构建过程将上游TSV文件重新压缩为BGZF格式并建立索引,随后通过vepyr插件缓存生成流程进行分片与分层处理。每一行记录均继承自Ensembl VEP 116版本GRCh38变异缓存中的频率层级:与变异缓存匹配的行标记为暖层,未匹配的行归为冷层。所有分片按频率层级与起始位置排序,确保字节级可复现性,并通过manifest文件记录来源URL、校验和及每分片的行数与层级统计。
使用方法
用户可通过Hugging Face命令行工具下载全部Parquet分片至本地目录,作为vepyr的AlphaMissense插件缓存使用。该缓存可直接替代Ensembl VEP 116的Perl插件,在注释阶段无需上游TSV文件。由于文件为纯Parquet格式,亦可独立于vepyr,通过DuckDB、Polars或DataFusion等工具直接查询。例如按染色体与位置区间筛选时,可读取对应分片并返回等位基因、蛋白质变异、分类及致病性评分等字段,适用于大规模变异注释与下游分析。
背景与挑战
背景概述
随着精准医学与群体遗传学的迅猛发展,错义变异的致病性解读已成为基因组学研究的核心议题。2023年,DeepMind团队在《Science》发表AlphaMissense,以蛋白质语言模型实现了全蛋白质组范围的错义效应预测,为变异注释提供了统一量化框架。然而,Ensembl VEP的原始Perl插件在规模化注释时面临解析效率瓶颈。为此,biodatageeks团队于2026年构建了该预编译Parquet缓存,将AlphaMissense的hg38预测结果与VEP 116的CSQ输出语义对齐,使Rust/DataFusion引擎vepyr无需上游TSV与Perl插件即可复现注释。
当前挑战
该数据集所直面的领域问题,是在海量错义变异的功能注释中兼顾预测精度与计算吞吐。AlphaMissense的原始注释依赖转录本水平的氨基酸变化比对,且需与VEP的等位基因最小化语义严格一致,任何键匹配偏差都将导致注释缺失或错配。构建过程中,需在约七千万行规模上完成按频率分层、全序排序与分片校验,确保暖冷行物理连续以支持高效探测;同时须精确复现VEP 116插件的字段顺序与阈值语义,并保持Parquet分片字节的可复现性,对来源文件的MD5核验与血缘记录亦构成额外工程挑战。
常用场景
经典使用场景
在基因组变异注释领域,该数据集充当了AlphaMissense致病性预测与高通量注释引擎之间的桥梁。其最经典的使用场景在于,当研究人员利用vepyr这一Rust/DataFusion构建的VEP兼容注释工具对GRCh38版本的人类基因组变异进行批量功能注释时,无需再依赖原始的TSV文件或Perl插件,即可直接通过预构建的Parquet缓存快速获取每个错义变异的致病性分类与评分。凭借频率分层设计,热门变异行在物理存储上连续排列,使得针对常见变异的查询仅需扫描少量行组,极大提升了大规模队列研究的注释效率。
解决学术问题
该数据集有效缓解了基因组学研究中对AlphaMissense预测结果进行可复现、高效能本地化注释的迫切需求。过往研究常受限于原始数据格式的解析开销与Perl插件的运行效率,难以在数十亿级变异规模下开展系统性的错义变异功能影响评估。此缓存通过精确复现Ensembl VEP 116的CSQ输出语义,并严格遵循逐转录本匹配逻辑,为全基因组关联研究、罕见病变异过滤以及临床变异解读等学术问题提供了稳定、可验证的数据基础,其层次化结构亦为频率导向的优化策略提供了实证参考。
实际应用
在实际应用层面,该数据集为生物信息学流程提供了即取即用的注释资源。无论是基于DuckDB、Polars还是DataFusion的独立分析,还是集成于vepyr的自动化注释管线,用户均可直接查询Parquet文件获取am_class与am_pathogenicity字段,从而在肿瘤基因组分析、人群队列变异筛查及孟德尔遗传病诊断辅助等场景中快速评估错义变异的潜在致病性。其非商业性许可条款亦为学术研究与非营利性应用提供了清晰的法律边界,有利于研究成果的合规传播与二次开发。
数据集最近研究
最新研究方向
随着精准医学与大规模人群基因组计划的纵深推进,错义变异的致病性解读已成为临床遗传诊断与药物靶点发现的核心瓶颈。该数据集依托DeepMind AlphaMissense蛋白组尺度预测框架,以频率分层Parquet缓存形式重塑了Ensembl VEP插件注释范式,使温热点位仅需触及少量行组即可完成快速筛查,显著降低了全基因组注释的算力开销。当前前沿研究正围绕AlphaMissense评分与人群频率谱、ClinVar临床证据及肿瘤驱动突变谱的系统整合展开,旨在校准致病性阈值的种族异质性并提升罕见病变异解读的可迁移性。该缓存通过消除Perl插件与上游TSV依赖,为跨队列高通量变异过滤、多组学联合建模及临床决策支持系统的可复现基准测试提供了关键基础设施,亦为AI蛋白结构预测成果向临床基因组学转化铺设了高效通道。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务