遇见数据集

SidechainNet

收藏
arXiv2020-11-15 更新2024-06-21 收录
官方服务:

资源简介:

SidechainNet是由匹兹堡大学开发的蛋白质序列和结构数据集,旨在解决蛋白质结构预测中侧链信息缺失的问题。该数据集扩展自ProteinNet,包含了描述蛋白质结构中所有重原子的角度和原子坐标信息。数据集的创建过程涉及从Protein Data Bank重新下载所有原子蛋白质结构,并整合了多种数据类型。SidechainNet的应用领域包括结构生物学、药物发现和分子动力学模拟,旨在提高蛋白质结构预测的准确性和表达能力。

SidechainNet is a protein sequence and structure dataset developed by the University of Pittsburgh, designed to address the problem of missing side chain information in protein structure prediction. This dataset is extended from ProteinNet, and contains angle and atomic coordinate information for all heavy atoms in protein structures. The dataset creation process involves re-downloading all atomic protein structures from the Protein Data Bank and integrating multiple data types. The application fields of SidechainNet include structural biology, drug discovery and molecular dynamics simulations, aiming to improve the accuracy and expressive capability of protein structure prediction.

提供机构:
匹兹堡大学
创建时间:
2020-10-16
搜集汇总
数据集介绍
SidechainNet 数据集图片
构建方式
SidechainNet的构建始于对ProteinNet数据集的继承与扩展。首先,从ProteinNet的原始文本记录中解析出蛋白质序列与结构信息,随后利用ProDy软件包从蛋白质数据银行重新下载每个蛋白质的全原子结构,包括所有重原子的坐标与扭转角。在序列比对的基础上,将重新获取的原子坐标与缺失残基掩码替换原始数据,并与保留的位置特异性得分矩阵及信息含量数据合并,最终形成统一的数据集。构建过程中排除了约0.3%因解析错误或序列不一致而无法处理的蛋白质结构。
特点
SidechainNet的核心特点在于首次将蛋白质主链与侧链的全原子信息统一于一个标准化数据集中。它不仅包含主链的扭转角与键角,还涵盖每个残基侧链多达六个扭转角及十个重原子坐标,为全原子结构预测提供了完备的表示。数据集沿用了ProteinNet基于CASP竞赛的划分策略,通过聚类方法构建多个验证集以控制序列相似性,有效避免了信息泄露。此外,数据以Python字典结构组织,支持角度与坐标的双重表示,并提供了从角度重建笛卡尔坐标的方法。
使用方法
SidechainNet提供了灵活的使用方式,适配不同的研究需求。用户可通过Python包以字典形式加载数据,直接访问序列、角度、坐标、掩码及进化信息等字段。对于深度学习任务,推荐使用PyTorch DataLoader接口,其内置的动态批处理方法可依据蛋白质长度自动调整批次大小,提升GPU利用效率。此外,数据集中提供的角度信息可通过StructureBuilder类转换为全原子笛卡尔坐标,并支持导出为PDB、py3Dmol视图或gLTF格式,便于结构可视化与下游分析。
背景与挑战
背景概述
蛋白质结构预测是计算生物学领域的核心挑战之一,近年来随着深度学习技术的突破,尤其是AlphaFold在CASP竞赛中的卓越表现,该领域取得了显著进展。然而,现有数据集多聚焦于蛋白质主链结构,忽略了侧链原子层面的精细信息,而侧链的精确构象对酶催化、药物结合等生物学功能至关重要。为此,Jonathan E. King与David Ryan Koes于2020年提出了SidechainNet数据集,该数据集直接扩展自Mohammed AlQuraishi的ProteinNet,整合了蛋白质主链与侧链的全原子坐标及扭转角信息,旨在为机器学习模型提供更完整的结构表征。SidechainNet通过继承CASP竞赛的严谨数据划分策略,有效避免了信息泄露问题,为蛋白质结构预测及下游药物发现研究提供了高质量的统一基准。
当前挑战
SidechainNet所面临的挑战具有双重性。在领域问题层面,尽管深度学习在蛋白质主链预测上取得突破,但将侧链信息纳入端到端训练仍属空白,现有方法多将主链与侧链预测割裂,导致模型无法捕捉原子间协同作用,限制了结构预测的精度与生物学相关性。在构建过程中,SidechainNet遭遇了数据可用性瓶颈:蛋白质数据库(PDB)中仅有约17万条结构,远少于序列数据库的1.56亿条,且数据预处理缺乏标准化。此外,从PDB解析全原子结构时,约0.3%的条目因文件解析错误、序列不一致等问题被排除;同时,基于固定键角重建坐标的假设会引入显著误差,迫使数据集额外记录主链键角以提升重建精度。这些挑战凸显了在有限且异构的结构数据中构建全原子、无偏数据集的技术难度。
常用场景
经典使用场景
在蛋白质结构预测与深度学习交叉领域中,SidechainNet 被广泛用作全原子蛋白质结构数据的基准数据集。研究者通常利用其提供的蛋白质主链与侧链的扭转角、键角以及全重原子坐标信息,训练端到端的神经网络模型,以实现从氨基酸序列到完整三维结构的精准映射。该数据集特别适用于需要同时建模主链构象与侧链取向的任务,例如基于角度的坐标重建、蛋白质结构生成以及结构质量评估等经典研究场景。
实际应用
在实际应用中,SidechainNet 为基于结构的药物发现与酶催化机制研究提供了关键数据支撑。由于其包含侧链的原子级精度信息,研究人员可将其用于虚拟筛选中的配体-蛋白质结合位点识别,或用于分子动力学模拟的初始构象生成。此外,SidechainNet 支持将角度表示高效转换为笛卡尔坐标,便于直接对接下游计算流程,如结合自由能预测、蛋白质-蛋白质相互作用分析以及结构可视化,显著加速了结构生物学领域的计算研究。
衍生相关工作
SidechainNet 的发布催生了一系列衍生性研究工作,其中最典型的是基于全原子角度表示的蛋白质结构生成模型与自监督表示学习方法。例如,一些工作借鉴其角度与坐标的双重表示,开发了可微分的结构构建模块,用于端到端训练;另一些研究则利用其无偏的数据划分策略,构建了更严格的结构相似性聚类数据集。此外,SidechainNet 的代码框架也被复用至 CATH 等结构分类数据库的自动化数据集生成中,推动了蛋白质结构预测与设计领域的标准化进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务