ntranoslab/vesm_scores
收藏官方服务:
资源简介:
该数据集提供了使用VESM模型预测的全蛋白质组(包括UniProt, hg19, 和 hg38)变异效应分数,这些分数是根据论文中最新开发的VESM模型计算得出的。数据集包含VESM、VESM1、VESM2、VESM3和VESM++等不同模型版本,其中VESM是VESM1和VESM2的平均值,VESM++是所有三个模型的集成。VESM3和VESM++模型使用了ESM3-Open构建,因此遵循非商业许可协议。
This dataset provides proteome-wide (including UniProt, hg19, and hg38) variant-effect prediction scores computed using the VESM models developed in the paper Compressing the collective knowledge of ESM into a single protein language model. It includes different versions of the models such as VESM, VESM1, VESM2, VESM3, and VESM++ where VESM is the average of VESM1 and VESM2 (sequence-only) and VESM++ is the ensemble of all three. The VESM3 and VESM++ models are built with ESM3-Open and are subject to a non-commercial license agreement.
提供机构:
ntranoslab搜集汇总
数据集介绍
构建方式
该数据集由ntranoslab团队基于其提出的VESM系列模型构建,涵盖了全蛋白质组范围的变异效应预测分数。研究团队利用UniProtKB、hg19和hg38三种参考数据库,整合了VESM_3B、VESM3、序列仅VESM3及VESM++四种模型进行预测。其中VESM_3B与VESM3分别基于ESM2(3B参数)和ESM3架构,序列仅VESM3仅以氨基酸序列为输入,而VESM++则作为前两者的集成模型,通过综合多模型优势提升预测稳健性。所有评分均经过标准化处理,以支持跨蛋白质的泛化比较。
特点
该数据集的核心优势在于其全面性与前沿性。一方面,它覆盖了人类蛋白质组中数以亿计的变异位点,规模介于1亿至10亿之间,为大规模变异效应分析提供了丰富资源。另一方面,VESM模型融合了蛋白质语言模型ESM的集体知识,能够捕捉序列上下文中的复杂生物信号,尤其对错义突变的功能影响预测具有高灵敏度。VESM++集成策略进一步降低了单一模型的偏差,使评分更具可靠性。数据以英文注释,便于国际研究社区直接使用。
使用方法
用户可通过HuggingFace平台直接访问该数据集,无需额外预处理即可下载预计算评分。数据以标准化格式存储,支持与常见生物信息学工具(如VEP、ANNOVAR)的对接,便于整合到变异注释流程中。研究人员可针对特定基因或蛋白质子集筛选变异评分,用于致病性评估、功能验证或进化保守性分析。对于非商业用途,VESM_3B预测结果遵循MIT许可协议,而VESM3及VESM++因基于ESM3-Open,需遵守EvolutionaryScale的非商业许可条款。详细模型实现与使用示例可参考GitHub仓库。
背景与挑战
背景概述
蛋白质变异效应预测是计算生物学与精准医学领域的核心课题,旨在解析基因突变对蛋白质功能的影响,为疾病机制研究与药物开发提供关键线索。在此背景下,由Tuan Dinh、Seon-Kyeong Jang、Noah Zaitlen与Vasilis Ntranos等研究人员于近期提出的VESM模型,开创性地将蛋白质语言模型ESM2与ESM3的集体知识压缩为单一高效模型,并生成了涵盖UniProtKB、hg19和hg38参考基因组的全蛋白质组变异效应评分数据集。该数据集依托ntranoslab团队在深度学习与基因组学交叉领域的深厚积累,其发布显著降低了变异效应预测的计算门槛,为大规模功能基因组学研究提供了标准化、可复用的基准资源,对理解人类遗传变异的功能后果产生了深远影响。
当前挑战
当前该数据集面临的核心挑战首先在于领域问题的复杂性:蛋白质变异效应预测需精准区分致病性突变与中性多态性,但现有模型对罕见变异或非编码区突变的功能解读仍存在显著不确定性,尤其在跨物种保守性不足的位点上表现欠佳。其次,构建过程中遭遇了多维度技术瓶颈,包括如何高效整合ESM2(30亿参数)与ESM3的异构架构以保持预测一致性,以及处理全蛋白质组规模下序列冗余与等位基因注释冲突带来的数据质量波动。此外,VESM3模型因基于ESM3-Open构建而受非商业许可协议限制,阻碍了其在工业界与临床场景中的广泛应用,成为数据集推广与社区协作的关键障碍。
常用场景
经典使用场景
在蛋白质功能预测与变异效应解析的前沿领域,VESM scores数据集凭借其全蛋白质组规模的预计算变异效应评分,成为评估错义突变致病性与功能影响的核心资源。该数据集整合了UniProtKB、hg19及hg38三个参考基因组版本的变异注释,覆盖了超过数亿条变异位点,为研究者提供了从序列到表型的直接桥梁。经典使用场景包括:基于VESM_3B、VESM3及VESM++等先进语言模型输出的评分,系统性地评估单氨基酸替换对蛋白质稳定性和相互作用网络的影响,尤其适用于大规模基因组关联研究(GWAS)中罕见变异的优先级排序。
解决学术问题
该数据集精准回应了计算生物学中长期存在的挑战——如何从海量蛋白质序列中高效、准确地推断变异的功能后果。传统实验方法受限于通量与成本,而VESM scores通过压缩ESM系列模型(如ESM2-3B与ESM3)的集体知识,以无监督学习范式实现了对全蛋白质组变异效应的统一预测。这一突破解决了跨物种、跨数据库变异注释不一致的难题,为疾病相关突变的功能验证提供了可复现的统计基准。其深远意义在于加速了精准医学中致病位点的发现,并推动了蛋白质语言模型在突变效应预测领域的范式革新。
衍生相关工作
VESM scores数据集的发布催生了多项具有里程碑意义的衍生工作。一方面,研究者基于其评分体系开发了突变效应聚类的无监督方法,揭示了不同蛋白质家族中保守性突变的共享功能模式。另一方面,该数据集被用作训练新型变异预测模型(如基于图神经网络的突变影响推理器)的黄金标准标签,推动了弱监督学习在蛋白质功能预测中的落地。此外,VESM评分与AlphaFold结构预测的联合分析,衍生出一系列探索突变对蛋白质三维构象扰动的跨模态研究,为理解错义突变的构象致病机制开辟了新路径。
以上内容由遇见数据集搜集并总结生成



