遇见数据集

AF3 Peptide Benchmark

收藏
github2026-05-29 更新2026-05-30 收录
官方服务:

资源简介:

该仓库包含用于评估AlphaFold 3在蛋白质-肽复合物结构预测中表现的数据集,包括Set 1(185个蛋白质-肽复合物,用于分布内评估)、PepPCBench(261个蛋白质-肽复合物,用于分布外评估)、SKEMPI v2.0子集(10个蛋白质复合物和197个突变,用于比较AF3置信度变化与实验DeltaDeltaG值)以及GLP-1受体案例研究(具有折叠变化衍生的DeltaDeltaG值的GLP-1突变)。

This repository contains datasets for evaluating the performance of AlphaFold 3 in protein-peptide complex structure prediction, including Set 1 (185 protein-peptide complexes for in-distribution evaluation), PepPCBench (261 protein-peptide complexes for out-of-distribution evaluation), the SKEMPI v2.0 subset (10 protein complexes and 197 mutations for comparing changes in AF3 confidence scores with experimental DeltaDeltaG values), and the GLP-1 receptor case study (GLP-1 mutations with fold change-derived DeltaDeltaG values).

创建时间:
2026-05-28
原始信息汇总

数据集概述

AF3 Peptide Benchmark 是一个用于评估 AlphaFold 3 (AF3) 在蛋白质-多肽复合物结构预测中表现的专用数据集与配套工具库。

核心研究问题

该基准测试围绕三个核心问题展开:

  1. AF3 对基线蛋白质-多肽复合物的建模能力如何?
  2. 预测结果对单点和双点多肽突变的敏感度如何?
  3. AF3 的置信度指标能否追踪实验结合的亲和力变化?

主要结论:AF3 能生成强健的基线结构,并对许多分布外复合物具有良好的泛化能力,但其置信度指标不应被用作定量结合亲和力的代理。

数据集构成

数据集名称 描述 数量
Set 1 用于分布内评估的蛋白质-多肽复合物。 185 个复合物
PepPCBench 用于分布外评估的蛋白质-多肽复合物。 261 个复合物
SKEMPI v2.0 子集 用于比较 AF3 置信度变化与实验 DeltaDeltaG 值。 10 个蛋白质复合物和 197 个突变
GLP-1 受体案例研究 整理自 GLP-1 突变体,其 DeltaDeltaG 值来源于折叠变化。 未明确数量

仓库文件结构

text . |-- data/ # 原始输入数据 | |-- raw/ # 来自 SKEMPI, PepPCBench, PEPDB, Grantham 的原始数据 | -- processed/ # 处理后的序列及 AF3 JSON 任务文件 |-- docs/ # 辅助文档 |-- examples/ # 示例数据 | |-- glp1/ # GLP-1 突变 AF3 输入与解析得分 | |-- skempi/ # SKEMPI 突变 AF3 输入与解析得分 | -- skempi_original/ # 原始 SKEMPI 复合物 AF3 输入 |-- notebooks/ # 数据生成与探索性分析 Jupyter notebook |-- results/ # 结果文件 | |-- avgDQ/ # Set 1 的平均 DockQ 摘要 | |-- avgDQ_peppc/ # PepPCBench 的平均 DockQ 摘要 | |-- examples/ # 每个示例的 DockQ 摘要 | |-- peppcbench/ # PepPCBench 整体 DockQ/RMSD 输出 | |-- pics/ # 图表与 PyMOL 辅助脚本 | -- set1/ # Set 1 整体 DockQ/RMSD 输出 -- scripts/ # DockQ 摘要解析辅助脚本

工作流程

  1. 环境准备:安装 Python 分析依赖 (pip install -r requirements.txt)。
  2. 生成输入:使用 notebooks/ 目录下的 notebook 审查或重新生成 AF3 输入 JSON。
  3. 运行 AF3:在外部运行 AF3,使用生成的 JSON 输入文件进行预测。
  4. 汇总结果:将解析后的 DockQ/摘要输出文件放入 results/ 目录,并使用 notebooks 或 scripts/ 中的脚本进行下游结果总结。

注意事项

  • 完整 AF3 输出目录不包含在此仓库中,AF3 模型权重、数据库和完整预测输出需用户自行准备。
  • examples/results/ 中的部分文件来源于 AF3 预测,其输出受 Google DeepMind 的 AlphaFold 3 输出使用条款约束。
  • 数据集来源和输出归属信息详见 NOTICE.md

引用建议

使用此仓库时,请引用其随附的手稿(尚未发布)以及上游数据集和 AlphaFold 3。详细信息见于 CITATION.cffNOTICE.md

搜集汇总
数据集介绍
AF3 Peptide Benchmark 数据集图片
构建方式
在蛋白质-肽段相互作用的结构预测领域,AlphaFold 3(AF3)的性能仍待系统性评估。为此,我们构建了AF3 Peptide Benchmark数据集,旨在全面考察AF3在蛋白质-肽段复合物结构预测中的表现。该数据集整合了四大来源:Set 1包含185个复合物用于分布内评估,PepPCBench提供261个复合物用于分布外泛化测试,SKEMPI v2.0子集涵盖10个蛋白复合物及197个突变用于结合亲和力变化分析,此外还包括GLP-1受体案例研究中经实验衍生的突变数据。数据处理流程包括原始序列的清洗、AF3输入JSON文件的生成,以及DockQ等结构质量指标的解析与汇总。所有任务文件均通过标准化代码生成,确保可重复性与可扩展性。
特点
该数据集最显著的特点在于其多层次、多角度的问题导向设计。不仅覆盖经典复合物的基线预测能力,还深入探索AF3对单双点肽突变的敏感程度,以及其置信度指标与实验结合能变化之间的关联性。Set 1与PepPCBench的互补布局,使得模型既能评估在分布内数据上的可靠性,又能测试其在全新复合物上的泛化能力。SKEMPI子集与GLP-1研究则专门用于考察AF3在突变响应上的表现,揭示其置信度指标不宜作为定量结合亲和力替代物的关键局限性。数据集附带完整的分析代码与可视化脚本,便于用户复现结论与扩展后续研究。
使用方法
使用本数据集时,首先需安装Python分析依赖,通过执行'pip install -r requirements.txt'完成环境配置。随后,可利用notebooks目录中的Jupyter笔记本生成或检查AF3输入JSON文件,这些笔记本已内置仓库根路径感知功能,可在任意位置运行。生成的JSON文件需提交至AF3外部运行环境进行推理。预测完成后,将解析得到的DockQ及总结文件放置于results目录相应子文件夹中,再借助notebooks或scripts目录下的辅助脚本,即可生成平均DockQ、RMSD等关键指标表格与可视化图表。数据集不包含AF3权重与数据库,但提供了完整的输入、输出示例及结果归档,确保用户能够顺利复现核心分析流程。
背景与挑战
背景概述
蛋白质-多肽复合物的结构预测是计算结构生物学领域的核心挑战之一,对于理解细胞信号转导、免疫识别及药物设计等关键生物学过程具有深远意义。自AlphaFold 2在单体蛋白质结构预测上取得突破性进展后,其继任者AlphaFold 3(AF3)将预测能力扩展至蛋白质-小分子及核酸等复合物系统。AF3 Peptide Benchmark数据集由相关领域研究人员于近期创建,旨在系统评估AF3在蛋白质-多肽复合物结构预测中的表现。该数据集通过构建185个分布内复合物和261个分布外复合物的测试套件,辅以SKEMPI v2.0突变数据集及GLP-1受体案例研究,聚焦于三个核心研究问题:AF3对基线复合物的建模能力、对单双点突变的敏感性、以及其置信度指标与实验结合自由能变化之间的关联。该基准的提出为后续多肽相关计算方法的改进提供了关键参考,推动了结构预测方法从静态结构向功能预测的纵深发展。
当前挑战
该数据集所解决的领域挑战主要涵盖两大方面。其一,蛋白质-多肽复合物构象的高度动态性与结合界面的柔性特征,使得传统基于模板或能量函数的预测方法难以准确捕捉其结合模式,特别是面对高序列变异性或低相似性模板的分布外复合物时,模型泛化能力面临严峻考验。其二,AF3置信度指标能否定量反映结合亲和力变化是亟待解决的关键问题——研究表明其置信度分数不宜作为定量结合亲和力的代理指标,这一局限性暴露出当前结构预测模型在功能相关性评价上的根本瓶颈。在构建过程中,挑战同样显著:多肽长度不均一(通常3-40个残基)导致输入格式标准化困难;从PEPDB、SKEMPI等异质数据库中提取高纯度非冗余复合物需要大量人工筛选与质量评估;而AF3外部运行环境的配置、海量预测输出文件的存储与分析管线搭建,则对计算资源与数据处理流程提出了极高要求。
常用场景
经典使用场景
在蛋白质-肽段复合物结构预测领域,AF3 Peptide Benchmark数据集被广泛用于评估AlphaFold 3模型对蛋白-肽相互作用的建模能力。该数据集囊括了185个分布内复合物和261个分布外复合物,系统性地考察了模型在基线预测、单双点突变敏感性以及置信度指标与实验结合能变化关联性等方面的表现。研究者通过DockQ、RMSD等量化指标,能够深入剖析AF3在不同肽段序列与受体蛋白组合下的结构预测精度,从而验证其泛化性能与局限性。
实际应用
在实际药物研发与生物技术应用中,AF3 Peptide Benchmark为基于结构的肽类药物设计提供了关键的验证基准。例如,GLP-1受体案例研究展示了AF3在模拟天然激素突变体与受体结合构象变化中的潜力,有助于快速筛选候选肽段的结合活性。同时,SKEMPI v2.0子集内的197个突变体系为研究者提供了一套标准化管道,用于评估AI模型在突变诱导的结合能变化预测中的表现,从而辅助抗体工程、蛋白互作调控等实际场景中的理性设计决策。
衍生相关工作
基于此基准数据集,衍生出多项促进蛋白-肽预测领域发展的后续工作。研究者可复用该仓库中的AF3输入JSON文件和分析notebook,快速构建针对特定蛋白家族的肽段对接评估流程,或拓展至其他深度学习模型(如RoseTTAFold、ESMFold)的横向比较。此外,该工作提出的‘置信度-结合能解耦’视角,已催生多篇试图修正AF3置信度校准或开发融合实验约束的新一代预测方法的论文,推动了计算结构生物学从单纯结构预测向有定量可信度的功能预测演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务