THU-ATOM/casp_data
收藏官方服务:
资源简介:
CASP数据集包含来自CASP14、CASP15和CASP16三个竞赛的蛋白质结构预测数据,数据主要用于单链蛋白质结构预测测试。数据集包括实验确定的蛋白质结构(PDB格式)和对应的序列(FASTA格式),以及预计算的多重序列比对(MSA)文件。
The CASP dataset contains protein structure prediction data from the CASP14, CASP15, and CASP16 competitions, primarily used for single-chain protein structure prediction testing. The dataset includes experimentally determined protein structures (in PDB format), corresponding sequences (in FASTA format), and precomputed Multiple Sequence Alignments (MSA) files.
提供机构:
THU-ATOM搜集汇总
数据集介绍
构建方式
该数据集源自关键评估蛋白质结构预测(CASP)竞赛第14至16届的实验数据,系统整合了2020年、2022年及2024年三个周期的蛋白质结构预测任务。数据集的构建遵循严谨的层次化组织原则,按竞赛年份划分为casp14、casp15及casp16三个子目录,每个子目录均包含三个核心文件模块:sequences.fasta文件存储了所有目标蛋白的氨基酸序列,采用FASTA格式以支持便捷的序列检索;experiment_structures目录收录了通过实验测定的蛋白质三维结构,以PDB格式提供,作为评估预测精度的金标准;precomputed_msa目录则预计算了每个靶标的多序列比对信息,利用MMseqs2工具结合ColabFold脚本,搜索UniRef30及ColabFold环境数据库生成A3M格式的比对文件,为深度学习模型提供丰富的进化信息输入。
特点
该数据集的核心特色在于其高度的专业性与实用性,专为单链蛋白质结构预测模型的性能评估而设计。数据覆盖了CASP竞赛近六年的典型靶标,总计近千个样本,确保了评估结果的时效性与代表性。每个靶标均配有多序列比对预计算结果,免去了研究者自行生成MSA的计算开销,显著提升了模型测试的便捷性与可重复性。实验结构数据直接源自蛋白质数据银行(PDB),确保了真实性的权威标准。此外,数据集的目录结构清晰统一,靶标标识符与CASP官方命名完全一致,便于与竞赛官方结果进行横向对比分析,为蛋白质结构预测领域的基准测试提供了标准化资源。
使用方法
该数据集主要适用于深度学习蛋白质结构预测模型的评估与验证环节。使用者可直接从HuggingFace平台加载数据集,通过解析casp14、casp15及casp16子目录下的sequences.fasta文件获取目标序列,作为模型输入。随后,调用precomputed_msa中的A3M文件作为多序列比对特征,提升预测准确性。模型的预测结构可与experiment_structures目录中对应的PDB文件进行比对,利用TM-score、RMSD等经典指标量化预测误差。数据集的结构设计支持批量处理,研究者可编写脚本循环遍历各年份子目录,自动化完成序列读取、特征加载、结构预测及结果评估的全流程,从而高效地检验模型在CASP基准上的表现水平。
背景与挑战
背景概述
蛋白质结构预测是计算生物学领域的核心挑战之一,其准确性直接关系到药物设计、酶工程及疾病机制解析等前沿研究。THU-ATOM/casp_data数据集由清华大学相关团队整理,系统汇集了2020年至2024年间举办的CASP14、CASP15与CASP16三届国际蛋白质结构预测竞赛的测试数据。该数据集以单链蛋白质结构预测为核心研究问题,提供了目标序列、实验解析的PDB结构文件及预计算的多序列比对信息,为评估深度学习模型在蛋白质三维结构预测中的表现提供了标准化基准。凭借对最新竞赛成果的整合,该数据集已成为推动AlphaFold等先进方法迭代验证的重要资源,显著促进了结构生物学与人工智能交叉领域的发展。
当前挑战
该数据集所面临的挑战首先源于蛋白质结构预测领域本身的复杂性,即如何从氨基酸序列准确推断出多样且动态的三维构象,尤其针对缺乏同源模板的新型折叠结构,现有模型仍存在精度瓶颈。在构建过程中,挑战体现为多源数据的异构整合与标准统一,包括不同年份竞赛中目标标识符命名规则差异、PDB文件格式兼容性处理,以及多序列比对数据库(如UniRef30与ColabFold环境数据库)版本更新带来的MSA一致性维护问题。此外,实验解析结构在分辨率与完整性上的参差不齐,也对评估指标的公平性提出了更高要求。
常用场景
经典使用场景
THU-ATOM/casp_data数据集汇集了CASP14至CASP16三届国际蛋白质结构预测竞赛的评测数据,涵盖目标蛋白序列、实验解析的天然构象PDB文件以及预先生成的多序列比对(MSA)信息。其最经典的用途在于作为基准测试集,评估和比较各类深度学习模型在单链蛋白质结构预测任务上的性能。研究者可借此复现CASP竞赛的评测流程,系统检验模型在从头预测、模板建模等子任务中的泛化能力与鲁棒性。
实际应用
在实际应用中,该数据集为药物发现与蛋白质工程提供了关键支撑。基于CASP数据训练的模型能够高精度预测未知蛋白质的三维结构,从而辅助识别药物结合位点、设计具有特定功能的突变体,并加速酶工程与抗体设计流程。例如,预测结果可直接用于虚拟筛选小分子配体,或指导定向进化实验中的热点残基选择,显著降低湿实验的试错成本。此外,该数据集还服务于结构基因组学计划,帮助解析大量通过传统X射线或冷冻电镜难以测定的蛋白构象。
衍生相关工作
围绕此数据集已衍生出一系列开创性工作,其中最具代表性的是基于CASP靶标构建的端到端预测管道,如AlphaFold2在CASP14上的突破性应用,以及后续整合语言模型与几何深度学习的改进方案。此外,研究者利用该数据开发了针对MSA质量评估的预训练策略,并催生了诸如Evoformer、SE(3)-Transformer等专用于蛋白质结构建模的神经网络架构。这些工作不仅深化了对蛋白质折叠规律的理解,还推动了生物信息学与人工智能交叉领域的蓬勃发展。
以上内容由遇见数据集搜集并总结生成



