遇见数据集

llnl/SurGBSA

收藏
Hugging Face2026-07-01 更新2026-04-05 收录
官方服务:

资源简介:

该数据集源自PDBBind CASF-2016基准测试,作为精炼集的代表性子样本。它为基准测试中242/285个结构提供了10ns的分子动力学模拟,每个结构最多使用6个起始点。所有结构都包含晶体结构作为起始点,并额外提供最多5个Vina对接姿势作为附加起始点。数据集包括生产运行的原始Amber MD模拟文件、预处理后的numpy格式ml-ready文件,以及每个快照的mmgbsa评分。此外,还提供了用于k折交叉验证的分割和相应的模型权重。

This dataset is derived from the PDBBind CASF-2016 benchmark, as a representative subsample of the refined set. 10ns MD simulations are provided for 242/285 structures in the benchmark using up to 6 starting points per structure. The crystal structure is included as a starting point for all structures and up to 5 Vina docking poses are provided as additional starting points. We include the raw Amber MD simulation files for the production runs, the preprocessed ml-ready files in numpy format, and mmgbsa scoring for each snapshot. We additionally provide the splits used for k-fold cross validation and the corresponding model weights.

提供机构:
llnl
搜集汇总
数据集介绍
llnl/SurGBSA 数据集图片
构建方式
SurGBSA数据集源自PDBBind CASF-2016基准测试集,以其精炼集中的代表性子样本为基础构建。针对该基准中的242个蛋白质-配体复合物结构(共285个),研究团队执行了长达10纳秒的分子动力学模拟,每个结构最多包含6个不同的起始构象。除晶体结构作为所有复合物的默认起点外,额外引入至多5个通过Vina分子对接生成的构象作为补充起始点。数据集囊括了原始Amber分子动力学模拟的生产运行文件、经预处理并格式化为numpy数组的机器学习就绪数据,以及每个快照对应的MM/GBSA结合自由能评分,从而实现了从原子级轨迹到可计算特征的完整转化。
特点
该数据集的核心特色在于其快照分辨率的分子力学广义Born表面积(MM/GBSA)测量值,这为每帧轨迹赋予物理化学意义上的能量标签。相比传统仅依赖单一晶体结构或对接构象的数据集,SurGBSA通过多起始点长时间模拟捕获了蛋白质-配体结合过程中的动态构象变化,提供了更为丰富的结构-能量关联信息。数据格式兼顾原始模拟轨迹与轻量级预处理矩阵,既支持传统分子动力学分析,也适配现代深度学习架构。此外,数据集明确划分了用于k折交叉验证的训练-测试集,并附带对应模型权重,便于研究者复现基准结果。
使用方法
研究者可直接利用numpy格式的预处理特征矩阵加载数据,无需复杂环境配置即可快速训练回归或分类模型,以预测结合亲和力或构象稳定性。对于需要深入分析动态路径的用户,可访问原始Amber轨迹文件,通过分子动力学分析工具提取时间相关性、自由能景观等高级特征。数据集内嵌的交叉验证划分方案支持标准化性能评估,而提供的预训练模型权重允许直接开展迁移学习或作为基线对比。结合配套代码仓库,用户可复现论文中的图神经网络表示学习流程,或针对药物发现中的虚拟筛选任务调整输入管道。
背景与挑战
背景概述
在计算生物物理与药物发现领域,分子动力学模拟与结合自由能计算是理解蛋白质-配体相互作用的核心工具。SurGBSA数据集由Lawrence Livermore National Laboratory的Derek Jones、Yue Yang、Felice C. Lightstone等研究人员于2025年创建,旨在弥合原子级模拟与机器学习表征之间的鸿沟。该数据集基于PDBBind CASF-2016基准集,提供了242个蛋白质-配体复合物的10纳秒分子动力学轨迹,并为每个结构生成了多达6个起始构象的快照解析分子力学广义Born表面积(MM/GBSA)评分。通过融合晶体结构与Vina对接姿态作为多起点模拟,该数据集不仅支撑了SurGBSA表征学习方法的开发,更为药物发现中的亲和力预测与构象动力学建模奠定了标准化基准,对推动深度学习在计算化学中的应用具有重要影响力。
当前挑战
该数据集所解决的领域核心挑战在于如何从高维、时序的分子动力学轨迹中提取具有物理意义的表征,以提升结合亲和力预测的准确性与泛化能力。传统方法常忽略构象动态性,而SurGBSA通过快照级MM/GBSA评分实现对稳态信息的捕捉,但面临分子模拟中固有采样不足与力场精度的双重制约。在构建过程中,研究人员需应对PDBBind子集的结构完整性与模拟稳定性问题,242个复合物的最终筛选反映了对断裂结构及异常轨迹的严格过滤;此外,多起点模拟的生成涉及Vina对接姿态的遴选与初始构象的平衡,而大规模轨迹的预处理、标准化为机器学习就绪格式(numpy)则对计算资源与数据管理提出了严峻挑战。
常用场景
经典使用场景
在计算化学与药物发现领域,SurGBSA数据集为从分子动力学模拟中提取有意义的表示提供了宝贵的资源。其核心用途在于训练和评估基于机器学习的模型,以学习蛋白质-配体复合物的动态行为特征。通过整合PDBBind CASF-2016基准集的代表性子集,该数据集提供了涵盖285个复合物中242个结构的10纳秒分子动力学轨迹,每个结构最多包含6个起始点,包括晶体结构和Vina对接姿态。这些丰富的模拟数据,结合预处理为NumPy格式的机器学习就绪文件,使得研究人员能够开发出能够捕捉蛋白质-配体相互作用中时间演化信息的深度学习方法,从而突破传统静态结构分析的局限。
实际应用
在实际药物研发管线中,SurGBSA数据集的应用前景广阔。它可直接用于构建预测模型,评估候选药物分子与靶点蛋白的结合强度,从而在先导化合物优化阶段显著减少大规模虚拟筛选和实验验证的成本。制药公司可以利用该数据集训练的模型,快速筛选出高亲和力的候选分子,进而将有限的实验资源集中于最有希望的化合物上。此外,该数据集提供的多样起始点设计(包括晶体和对接构象)模拟了实际对接场景中的不确定性,使得模型能够更鲁棒地处理从不同对接程序生成的姿态,提高了在实际高通量筛选流水线中的实用性和泛化能力。
衍生相关工作
围绕SurGBSA数据集,已涌现出一系列开创性的研究工作,其中最核心的便是其衍生的代表性工作——SurGBSA模型。该模型由Jones等人提出,旨在从分子动力学模拟中学习动态表征,代表了将深度学习与经典分子模拟相结合的重要方向。此外,该数据集促进了对图神经网络在蛋白质-配体复杂系统中应用的深入探索,催生了针对时间序列模拟数据的新颖架构设计。其公开的模型权重和复现的交叉验证划分,为后续研究者提供了可靠的基准,激励了更多关于能量景观表征学习、动态结合模式识别以及多构象集成方法的研究,共同推动了计算药物发现领域从静态对接向动态分析的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务