Cyclic Peptide–Protein Complex Prediction Benchmark
收藏官方服务:
资源简介:
一个精心策划的基准数据集,包含111个非冗余的环肽-蛋白质复合物,用于评估结构预测工具如何放置——以及关键的是,如何对环肽配体与蛋白质靶标进行排名。
A carefully curated benchmark dataset comprising 111 non-redundant cyclic peptide-protein complexes, designed to evaluate how structural prediction tools pose—and, crucially, rank—cyclic peptide ligands against their protein targets.
创建时间:
2026-08-19
原始信息汇总
数据集概述
该数据集是一个用于评估环肽-蛋白质复合物结构预测工具的基准测试集,包含111个非冗余的环肽-蛋白质复合物,旨在评估预测工具对环肽配体与蛋白质靶标结合姿态的生成能力和排序能力。
核心内容
数据集规模与组成
- 111个环肽-蛋白质复合物,覆盖五种环化化学类型:
- 主链首尾环化(BB):27个
- 主链+二硫键(BB+SS):10个
- 仅二硫键(单桥SS*1):61个
- 仅二硫键(双桥SS*2):12个
- 仅二硫键(三桥SS*3):1个
- 配体长度:6–34个残基
- 靶标长度:67–902个残基(基于接触的受体长度)
- 总采样姿态数:22200个(111靶标 × 2工具 × 100姿态/靶标)
评估方法
- 每个姿态使用 DockQ v2 评分(标准模式和
--capri_peptide模式) - 提供 28维界面描述符 特征管线
- 提供 LightGBM 姿态质量重打分模型
测试工具
- Boltz-2(
msa配置) - Protenix(
base_msa配置) - 采样策略:10个随机种子 × 10个扩散采样 = 每个靶标100个姿态
关键发现
| 发现类别 | 具体结果 |
|---|---|
| 姿态生成 | 最高置信度姿态的中位CAPRI-peptide DockQ为0.888(Boltz-2)和0.896(Protenix);96–98%的靶标达到可接受或更好水平 |
| 置信度排序 | 自评分与DockQ的Spearman相关性仅为0.53–0.66;约12%姿态存在“高置信度但低质量”现象;97–99%靶标的采样集合中存在优于模型自选姿态的高质量姿态 |
| 最困难案例 | 二硫键环化肽和小靶标(≤200残基)预测效果显著较差;靶标大小是最大且最一致的影响因素 |
| 外部描述符 | 将链长归一化的界面描述符(主要为单位残基链间氢键密度)加入自评分后,无泄漏的目标分组交叉验证下ROC-AUC从0.765提升至0.812(Boltz),从0.874提升至0.925(Protenix) |
数据文件结构
data/targets/<PDB>/:每个靶标的蛋白质PDB文件、环肽PDB文件和元数据JSON文件data/msa/<PDB>/*.a3m:每条链的A3M格式多序列比对(MMseqs2 / UniRef90,AlphaFast profile)data/manifest.json:每个靶标的审计记录(来源、MSA统计、修正信息)data/target_lengths.csv:基于接触的受体长度表(模型输入)evaluation/persample.csv:每个姿态的评分表(单一事实来源)model/pose_quality/outputs/models/:训练好的LightGBM模型(文本格式)
使用场景
- 直接使用数据集:111个精选复合物、每个靶标的元数据和每条链的MSA均包含在
data/目录中,无需安装 - 重新运行或扩展基准测试:按照Pipeline完整流程运行(预测阶段需要GPU)
- 复用重打分模型:训练好的LightGBM模型已提供,可参考
model/pose_quality/README.md
许可协议
- 代码:Apache License 2.0
- 数据(
data/):CC BY 4.0;PDB来源的结构文件受wwPDB条款约束
搜集汇总
数据集介绍

构建方式
该基准数据集精心筛选了111个非冗余的环肽-蛋白复合物晶体结构,覆盖五种环化化学类型,包括主链首尾环化、二硫键环化及其组合。每个靶标均配备相应的蛋白与环肽结构文件、基于MMseqs2与UniRef90生成的受体多序列比对(MSA)以及详细的元数据与审计追踪。预测流程采用Boltz-2与Protenix两种工具,每种工具对每个靶标进行10个种子乘以10个扩散样本的采样,共计生成22,200个预测构象。所有构象均通过DockQ v2(标准模式与capri_peptide模式)进行评分,并提取28维界面描述符,最终由LightGBM模型进行重打分。
特点
该基准的突出特点在于其系统性的评估框架与关键发现。构象生成并非瓶颈,高置信构象的中位DockQ值达0.888(Boltz-2)与0.896(Protenix),且96-98%的靶标达到可接受或更高精度。然而,模型自身的置信度评分与真实质量仅呈中等相关(Spearman r=0.53-0.66),约12%的构象出现高置信但低质量的现象。二硫键环化肽与小靶标(≤200残基)构成最具挑战性的案例,而界面描述符的引入可显著提升构象排序能力,ROC-AUC从0.765提升至0.812(Boltz)及从0.874提升至0.925(Protenix)。
使用方法
数据集及相关模型均以开源形式提供,用户可直接利用data/目录下的111个靶标结构、每链MSA及元数据,无需额外安装。需复现或扩展基准时,可依照Pipeline逐步执行,包括输入准备、预测运行(需GPU,Boltz约15 GPU-min/靶标,Protenix约2.5 GPU-min/靶标)、DockQ评分、界面特征提取及LightGBM模型训练,全程约3-4分钟。预训练模型存放于model/pose_quality/outputs/models/,便于直接应用。所有代码与数据分别遵循Apache 2.0与CC BY 4.0许可,适合科研与工业界使用。
背景与挑战
背景概述
环肽是一类具有独特拓扑结构和优异生物活性的分子,因其在靶向蛋白-蛋白相互作用中的潜力而备受关注。随着深度学习方法在蛋白质结构预测领域的迅猛发展,如AlphaFold2等工具已能精准预测线性蛋白复合物,但环肽-蛋白复合物的结构预测仍面临显著挑战。为此,Li Z等人于2026年创建了首个系统性的环肽-蛋白复合物预测基准数据集,涵盖111个非冗余复合物,涉及五种环化化学类型,并整合了DockQ v2评分、28维界面描述符及LightGBM重打分模型。该基准旨在评估结构预测工具在姿态生成与排序两方面的表现,对环肽药物设计及计算结构生物学具有重要的推动意义。
当前挑战
此领域当前面临多重挑战。首先,环肽的拓扑约束(如二硫键、头尾环化)对扩散模型的采样空间施加严格限制,导致生成姿态的多样性有限。其次,现有置信度评估指标(如pTM/ipTM)与真实结构质量的相关性较弱,Spearman系数仅0.53-0.66,且约12%的高置信度姿态实际质量低下,凸显了置信度排序的不可靠性。此外,二硫键环化肽及小靶蛋白(≤200残基)的预测精度显著下降,表明模型对特定化学修饰和尺寸效应的泛化能力不足。在构建过程中,研究者需处理多拷贝冗余、短肽MSA不可用性及跨工具特征标准化等问题,增加了基准的构建复杂度。
常用场景
经典使用场景
该数据集为环肽-蛋白质复合物结构预测工具的评估提供了标准化的基准。其核心使用场景在于系统性地评估Boltz-2和Protenix等前沿预测工具在环肽结合模式生成与排序上的性能,涵盖10个随机种子和10个扩散采样的100个构象,通过DockQ v2评分(包括标准模式和--capri_peptide模式)对预测结果进行严格的定量比较。该基准特别关注环肽特有的化学约束(如主链环化、二硫键桥)对预测难度的影响,为研究者提供了一套可复现的评估协议和完整的数据集(111个非冗余复合物),从而支持结构预测领域向环肽这一新兴治疗模态的拓展。
衍生相关工作
该数据集催生了多项衍生研究工作。首先,其提出的基于目标分组交叉验证的特征选择方法(SFFS)和LightGBM重排序模型已成为环肽预测领域的基线方法,后续研究可在此基础上探索更复杂的图神经网络或Transformer架构以进一步提升排序精度。其次,该基准对二硫键化学和靶标大小效应的系统分析,激发了针对环肽特有约束(如共价键建模)的专用采样策略研究。此外,其公开的22,200个预测构象和完整的特征管线,为开发新的评分函数或置信度估计方法提供了大规模训练与测试资源,促进了结构预测与机器学习交叉领域的发展。
数据集最近研究
最新研究方向
环肽-蛋白质复合物结构预测基准的构建与置信度评估成为当前计算结构生物学领域的前沿热点。该基准整合111个非冗余复合物,系统评测Boltz-2与Protenix在环肽对接中的姿态生成与排序能力,揭示原生置信度作为排序器的噪声特性,并通过轻量级梯度提升模型融合界面描述符显著提升姿态排序精度,为环肽药物理性设计提供关键方法论支撑。
以上内容由遇见数据集搜集并总结生成



