遇见数据集

Tenstorrent/mgtbind-boltz2

收藏
Hugging Face2026-06-04 更新2026-06-14 收录
官方服务:

资源简介:

该数据集包含对MGTBind数据库中所有3,607个分子胶复合物的Boltz-2三元复合物结构预测。这些预测是与Bindbridge合作,使用TT-Boltz在Tenstorrent AI加速器上计算生成的。数据集提供了每个复合物的五个扩散样本结构文件(以CIF格式存储),并包含置信度指标和评估结果,用于比较AlphaFold 3预测。文件结构遵循MGTBind的AlphaFold 3结构约定,并附有批量下载脚本和详细的结果文件(如JSON和CSV格式)。数据集旨在支持分子胶和药物发现研究,特别是在结构生物学领域。

Boltz-2 ternary complex structure predictions for all 3,607 molecular glue complexes in the MGTBind database. Predicted in partnership with Bindbridge and computed on Tenstorrent AI accelerators using TT-Boltz. The dataset includes five diffusion samples per complex in CIF format, with confidence metrics and evaluation results compared to AlphaFold 3 predictions. The file structure mirrors MGTBinds AlphaFold 3 convention and includes batch download scripts and detailed result files (e.g., JSON and CSV). It is designed to support research in molecular glues and drug discovery, particularly in structural biology.

提供机构:
Tenstorrent
搜集汇总
数据集介绍
Tenstorrent/mgtbind-boltz2 数据集图片
构建方式
MGTBind-Boltz2数据集基于北京大学来鲁华课题组创建的MGTBind分子胶数据库,针对其中全部3607个三元复合物,采用Boltz-2模型通过TT-Boltz实现进行结构预测。所有预测任务均运行于Tenstorrent Blackhole AI加速器上,以bfloat16精度执行,每个复合物生成5次扩散采样,并依据置信度得分(0.8×ipTM+0.2×pTM)选取最优模型。输入序列使用MGTBind提供的规范序列,MSA生成依赖MMseqs2算法,最终输出每个复合物5个排名模型及其对应的CIF结构文件和置信度汇总信息。
使用方法
研究者可通过Git克隆命令获取完整数据集,或利用提供的批量下载脚本按需获取指定复合物ID的子集。每个复合物的结构文件可通过HuggingFace的URL直接访问,路径格式为{complex_id}/boltz2_structure/Model-{N}/model.cif。数据集中附带的results.json和results.csv文件提供了全部3607个复合物的完整度量指标,便于按质量阈值进行筛选和分析。顶级模型(Model-1)基于置信度得分排序,与MGTBind中AF3的排名规则一致,方便直接对比评估。
背景与挑战
背景概述
MGTBind-Boltz2数据集由北京大学Jianfeng Pei团队联合Bindbridge公司及Tenstorrent公司于2025年创建,专注于分子胶(Molecular Glue)三元复合物结构预测。该数据集基于MGTBind数据库中的3,607个分子胶复合物,利用先进的Boltz-2模型在Tenstorrent Blackhole AI加速器上生成结构预测,旨在弥补AlphaFold 3在分子胶构象预测中的局限性。研究核心在于通过高精度结构预测揭示分子胶介导的蛋白质-蛋白质相互作用机制,为靶向蛋白降解等药物研发提供关键三维结构信息。该数据集的发布显著提升了分子胶设计领域的结构覆盖度与预测可信度,基准测试显示其核心指标MG Chain ipTM平均提升0.0453,高质量构象比例突破70%,对推动农业生物技术与化学生物学交叉研究具有里程碑意义。
当前挑战
当前分子胶设计面临的核心挑战在于三元复合物构象的极端动态性,传统同源建模与分子对接方法难以准确捕获蛋白-配体-蛋白的非共价协同作用。MGTBind-Boltz2数据集构建过程中需应对多重技术难题:Boltz-2模型对蛋白质残基端到端距离的敏感性导致pLDDT评分方差较大,70.7%的分子胶链重原子pLDDT超过70的阈值亦表明约三成预测缺乏结构可靠性;扩散采样机制生成5个候选模型的置信度离散性要求复杂的排序算法(0.8×ipTM+0.2×pTM)来遴选最优构象,但ipTM与pLDDT双标准达标率仅56.7%,凸显多指标协同评估的局限性;此外,计算资源方面,在Tenstorrent加速器上以bfloat16精度运行MMseqs2多序列比对,需平衡推理吞吐量与存储开销,3,607个复合物的批量预测产生了超过14,000个模型文件的管理复杂度。
常用场景
经典使用场景
在分子胶水(molecular glue)药物发现与蛋白质结构生物学领域,分子胶水作为一类能够诱导蛋白质间异源相互作用的双功能小分子,其三元复合物的结构预测是理解其作用机制的核心。该数据集汇聚了来自MGTBind数据库的3,607个分子胶水三元复合物,利用先进的Boltz-2模型在Tenstorrent AI加速器上执行结构预测,提供了比现有AlphaFold 3更优的界面预测TM分数(平均提升约4.5个百分点)。研究者可直接使用这些预训练的结构与置信度指标,进行分子胶水介导的蛋白质-蛋白质相互作用模式分析、构象多样性评估,以及结合亲和力的结构基础推断。
解决学术问题
该数据集系统地解决了分子胶水领域长期存在的核心挑战:三元复合物高质量结构的匮乏限制了对其诱导结合模式的机制揭示。在AlphaFold 3已提供初步预测的背景下,Boltz-2模型通过平均MG链ipTM达0.7896、超过70%的复合物ipTM高于0.68的优异表现,显著提升了预测的可靠性。这些高置信度结构使研究人员能够精确解析分子胶水如何桥接靶标蛋白与效应蛋白,进而探究其别构调控、协同结合及界面残基偏好等关键作用原理,为理性设计新型分子胶水提供了结构生物学层面的坚实数据基石。
实际应用
该数据集的真实价值体现在药物研发与农业生物技术的前沿转化中。在制药工业界,研究团队可借助这些高精度三元复合物结构,快速筛选具有潜力的分子胶水候选化合物,并基于结构信息优化其化学骨架以增强诱导结合能力与选择性。特别在由Bindbridge发起的农作物保护项目中,这些结构预测被用于发现能够靶向病原体关键蛋白的新型分子胶水,从而开发出作用机制清晰、抗性风险更低的绿色农药,推动从传统小分子抑制剂到蛋白-蛋白相互作用调控策略的范式跃迁。
数据集最近研究
最新研究方向
该数据集聚焦于分子胶(molecular glue)三元复合物结构的前沿预测研究,结合Boltz-2模型与AlphaFold 3的对比分析,揭示了计算结构生物学在药物发现中的新突破。通过大规模批量生成3607个复杂体系的置信度指标,该工作不仅验证了Boltz-2在界面预测TM-score(ipTM)上的显著提升(平均+0.0453),还开创性地将pLDDT与ipTM联合作为更严格的质量标准,推动了分子胶靶向疗法的理性设计。这一方向与近期AI驱动的小分子诱导蛋白相互作用研究热潮紧密相连,为农业化学和抗肿瘤药物开发提供了可扩展的验证框架,同时展示了Tenstorrent专用AI加速器在科学计算中的潜力,凸显了跨机构协作对结构化生物学数据库迭代的催化作用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务