遇见数据集

LiteFold/CATH

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

CATH是一个用于蛋白质结构域层次分类的数据库,按照类(class)、架构(architecture)、拓扑(topology)和同源超家族(homologous superfamily)对域进行组织。

CATH is a hierarchical classification database for protein domain structures, organizing domains by class, architecture, topology, and homologous superfamily.

提供机构:
LiteFold
搜集汇总
数据集介绍
LiteFold/CATH 数据集图片
构建方式
CATH数据集源自蛋白质结构域的层次化分类体系,其构建以CATH数据库为核心,依据类(Class)、构架(Architecture)、拓扑(Topology)和同源超家族(Homologous Superfamily)四个层级对蛋白质域进行系统归类。数据集整合了来自PDB的原始结构数据、CATH域列表、序列聚类信息及FASTA序列文件,并经过精心处理形成Parquet格式的表格。为确保模型评估的严谨性,数据划分采用基于S35序列簇的泄漏感知策略,确保同一同源超家族内的所有域以及共享S35簇键的序列被完整保留在同一划分中,从而有效避免了训练集与测试集之间的序列相似性偏差。最终数据集包含超过60万个域,分别归入训练集和测试集,并涵盖多种CATH类别的平衡分布。
使用方法
通过Hugging Face的datasets库,用户可以便捷地加载CATH数据集,仅需一行代码即可获取预分割的训练与测试集。支持流式加载模式,适用于内存受限场景下的迭代处理。数据集的列结构清晰,用户可直接访问域标识符、分类编码、序列及序列簇信息。一个重要的使用场景是过滤非冗余子集:利用布尔型列如in_s35_nonredundant_subset,可以轻松提取特定聚类水平的代表性域集合,以降低冗余性对机器学习模型训练的影响。同时,数据以Parquet格式存储,提供了高效的列式访问与压缩性能,便于开展大规模蛋白质结构预测与功能注释研究。
背景与挑战
背景概述
CATH是一个自上而下的层级结构蛋白结构域分类数据库,由伦敦大学学院(UCL)的研究团队(包括Sillitoe、Bordin、Dawson等)于20世纪90年代创建,并持续更新至2021年发布第4.3版。其核心研究问题在于通过结构域的分类解析蛋白质进化与功能关系,将结构域按类别(Class)、架构(Architecture)、拓扑(Topology)及同源超家族(Homologous Superfamily)四个层级组织,为结构生物学、生物信息学及蛋白质设计提供了关键参考框架。该数据集在Nucleic Acids Research上发表的CATH论文已被广泛引用,深刻影响了蛋白质结构预测方法的基准测试与模型评估。基于LiteFold团队整理的Parquet格式版本,CATH数据集包含了超过60万个结构域条目,并提供了S35序列聚类划分以保障数据拆分无信息泄露,进一步增强了其在深度学习和统计建模中的适用性。
当前挑战
CATH数据集所应对的领域核心挑战在于蛋白质结构域自动识别的多层级分类问题,该问题涉及从氨基酸序列推断结构域在高度稀疏且不均衡的类别空间中的分布,例如“少量二级结构”和“特殊”类的样本远少于“Alpha Beta”类。在构建过程中,重大挑战在于如何避免由序列相似性引起的数据泄露,CATH通过引入S35簇感知分割策略,确保训练集与测试集不含共享同源超家族及S35簇的结构域,从而维护模型的泛化能力。此外,原始数据中结构分辨率信息的缺失标记(如999.000的哨兵值)需要谨慎处理,同时多链PDB文件、非连续残基区间及长序列(最长达1275个氨基酸)的解析也增加了数据清洗与整合的复杂性。
常用场景
经典使用场景
在蛋白质结构生物学与计算生物学研究中,CATH数据集被广泛用于蛋白质结构域的分类与功能预测任务。该数据集基于层级分类体系,将蛋白质域划分为类、架构、拓扑和同源超家族四个层次,为深度学习模型提供了高质量的结构与序列对应关系。研究人员通常利用CATH中丰富的结构注释信息,训练诸如卷积神经网络或Transformer架构,以执行蛋白质域的自动分类,从而推断未知结构蛋白的进化关系与功能特性。该数据集的序列长度从9到1275个氨基酸不等,覆盖了从全α到α/β等多种折叠类型,确保了模型的泛化能力和生物学多样性。
解决学术问题
CATH数据集的核心学术贡献在于解决了蛋白质结构域层次分类的可重复性和数据泄漏问题。通过S35簇感知的分裂策略,确保同源超家族内相似序列不会同时出现在训练集和测试集中,从而解决了传统数据划分中因序列相似性过高导致的模型性能虚高问题。该数据集提供了多分辨率非冗余子集,支持研究人员在不引入冗余信息的前提下评估模型的泛化性能。CATH的层级结构还推动了蛋白质结构与进化关系的定量研究,为揭示折叠空间的组织规律和序列-结构-功能映射关系奠定了数据基础。
实际应用
在实际应用中,CATH数据集为药物发现和蛋白质工程提供了关键的支撑资源。研究人员可借助CATH的分类体系快速注释新测序蛋白质的结构域组成,预测其三维折叠模式,从而指导靶点识别与先导化合物优化。在酶设计领域,CATH有助于定位特定拓扑家族中的保守功能位点,加速理性设计流程。此外,该数据集被集成到自动化结构预测管线中,用于评估AlphaFold等模型输出域结构的合理性,并为蛋白质设计提供拓扑约束条件,降低实验筛选成本。CATH的高质量注释也推动了生物信息学软件在结构比对和功能注释方面的性能提升。
数据集最近研究
最新研究方向
在蛋白质结构预测与功能注释的前沿领域,CATH数据集因其层级化且经过同源性过滤的域分类体系,成为深度学习模型对抗序列与结构偏差的关键基准。当前热点方向聚焦于利用其S35簇感知的严格划分策略,验证图神经网络与大规模预训练语言模型(如ESM系列)在低序列相似性下的泛化能力,从而推动蛋白质功能域从头预测与远程同源检测的突破。此外,该数据集的高分辨率结构覆盖与层级标签(从折叠到超家族)为多任务学习框架(如联合架构与拓扑预测)提供了天然训练场,其影响在于加速解析未表征蛋白的结构-功能关联,为药物发现与酶工程注入数据驱动的理性设计基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务