遇见数据集

CATH

收藏
Hugging Face2026-05-27 更新2026-05-28 收录
官方服务:

资源简介:

CATH Domain Classification是一个基于CATH层次分类数据库构建的蛋白质结构域分类数据集。该数据集旨在为蛋白质结构域分类、结构预测和功能注释等计算生物学任务提供标准化的训练和测试数据。它包含601,328个蛋白质结构域样本,划分为训练集(541,123行)和测试集(60,205行),采用基于S35聚类的确定性划分策略以避免数据泄露。数据集提供了丰富的字段,包括标识符、CATH分类信息、序列聚类信息、序列信息、结构信息等,并涵盖关键统计信息如结构类别分布和序列长度范围。数据来源于CATH官方文件。

CATH Domain Classification is a protein domain classification dataset built on the CATH hierarchical classification database. It aims to provide standardized training and testing data for computational biology tasks such as protein domain classification, structure prediction, and functional annotation. The dataset contains 601,328 protein domain samples, divided into a training set (541,123 rows) and a test set (60,205 rows), using a deterministic S35 cluster-aware partitioning strategy to prevent data leakage. It offers extensive fields including identifiers, CATH classification information, sequence clustering information, sequence information, structural information, and key statistics such as structural class distribution and sequence length range. The data is sourced from official CATH files.

创建时间:
2026-05-13
原始信息汇总

数据集名称

CATH Domain Classification

数据集简介

CATH 是一个蛋白质结构域的层次分类数据库,按 类别(Class)架构(Architecture)拓扑(Topology)同源超家族(Homologous Superfamily) 对蛋白质结构域进行组织。本数据集以 Parquet 格式提供预处理后的 CATH 数据。

数据集规模与划分

  • 总行数:601,328 条记录(每个结构域为一行)
  • 训练集:541,123 行
  • 测试集:60,205 行
  • 划分策略:基于 S35 聚类键和同源超家族进行确定性划分,确保同一 S35 聚类簇的亲属结构域不会同时出现在训练集和测试集中,避免信息泄露。

核心统计指标

  • 唯一 S35 聚类键:37,350
  • 唯一同源超家族:6,630
  • 唯一拓扑:1,472
  • 唯一架构:43
  • 训练/测试集 S35 聚类重叠数:0
  • 未知结构分辨率哨兵行:9,726
  • 序列长度范围:9 至 1,275 个氨基酸,中位长度为 140。

CATH 类别分布

CATH 类别 行数
Alpha Beta(α/β) 305,361
Mainly Beta(主要β) 158,943
Mainly Alpha(主要α) 126,178
Few Secondary Structures(极少二级结构) 6,034
Special(特殊) 4,812

主要列说明

列名 描述
domain_id CATH 结构域标识符,例如 1oaiA00
pdb_id, chain_id, pdb_chain_id 解析出的 PDB 和链标识符
cath_version 来自 FASTA 头部的 CATH 版本号
cath_code 同源超家族级别的完整 CATH 分类代码
class_*, architecture_*, topology_*, homologous_superfamily_* 数字代码、完整层次代码、名称及示例结构域
s35_cluster_id, s60_cluster_id, s95_cluster_id, s100_cluster_id 来自结构域列表的 CATH 序列聚类标识符
s35_cluster_key 用于泄露感知划分的复合键
domain_length 来自 CATH 结构域列表的结构域长度
raw_structure_resolution_angstrom 原始结构分辨率值
structure_resolution_angstrom 将 CATH 的未知哨兵值 999.000 转换为 null 后的分辨率
sequence 来自 cath-domain-seqs.fa 的氨基酸序列
sequence_length 序列长度
sequence_range 源 FASTA 残基范围,包含不连续范围(如 2-78_187-208
sequence_range_start, sequence_range_end 解析出的最小起始和最大结束残基位置
sequence_segment_count sequence_range 中以下划线分隔的片段数
in_s35_nonredundant_subset 结构域是否出现在相应的 CATH 非冗余子集列表中

数据加载

使用 Hugging Face datasets 库加载: python from datasets import load_dataset ds = load_dataset("LiteFold/CATH") train = ds["train"] test = ds["test"]

支持流式加载和按非冗余子集过滤。

数据来源文件

  • cath-domain-list.txtcath-domain-list-S35.txt 等聚类列表
  • cath-domain-seqs.fa(序列文件)
  • cath-names.txt(名称文件)
  • 原始 PDB tar 包保留在仓库中,但未嵌入 Parquet 表。

许可协议

Creative Commons Attribution 4.0 International(CC BY 4.0)

引用

bibtex @article{sillitoe2021cath, title = {CATH: increased structural coverage of functional space}, author = {Sillitoe, Ian and Bordin, Nicola and Dawson, Natalie and others}, journal = {Nucleic Acids Research}, volume = {49}, number = {D1}, pages = {D266--D273}, year = {2021}, doi = {10.1093/nar/gkaa1079} }

搜集汇总
数据集介绍
CATH 数据集图片
构建方式
CATH数据集源自蛋白质结构域层次分类数据库,将蛋白质域按类别、架构、拓扑及同源超家族层级归类。其构建过程基于S35聚类感知的确定性划分策略,确保共享相同CATH同源超家族及S35聚类密钥的结构域被分配至同一数据子集,从而避免训练集与测试集间出现近距离S35簇相似样本。数据集整合了来自CATH官方源文件的多维信息,包括结构域列表、序列簇、氨基酸序列及名称注释,最终以Parquet列式存储格式呈现,共涵盖60余万条结构域记录。
特点
该数据集的核心特征在于其多粒度层次化分类体系,涵盖43种架构、1472种拓扑及6630种同源超家族,同时提供S35至S100四种序列相似性聚类标识。序列长度分布广泛,从9至1275个氨基酸不等,中位长度为140。通过严格的训练-测试零重叠设计,保证了生物信息学评估的严谨性。数据集还包含结构域分辨率信息,其中CATH标志性的999.000未知分辨率值被智能转换为空值,便于下游处理。
背景与挑战
背景概述
蛋白质结构域的分类与注释是结构生物信息学领域的核心任务之一,对于理解蛋白质功能、进化关系以及药物设计具有深远意义。CATH数据库作为一个历经多年发展的层次化蛋白质结构域分类体系,由伦敦大学学院等机构的研究人员于1990年代创建,并持续更新至2021年版本。该数据集将蛋白质结构域按照类(class)、架构(architecture)、拓扑(topology)和同源超家族(homologous superfamily)四个层级进行系统组织,为大规模蛋白质结构分析提供了关键基准。CATH数据集在蛋白质结构预测、功能注释及进化研究等领域具有广泛影响力,其分类标准被众多后续研究采纳,推动了计算结构生物学的发展。
当前挑战
CATH数据集所解决的领域问题核心在于蛋白质结构域的层次化分类与大规模比对,这一任务面临多重挑战:首先,蛋白质三维结构的多样性与复杂性使得自动分类精度受限,尤其是在处理低分辨率或新折叠类型时。其次,构建过程中需应对序列相似性带来的数据泄漏问题,数据集通过S35聚类感知的分割策略,确保同一簇的域不跨训练集与测试集分布,但如何平衡序列冗余与分类覆盖仍是一项技术难题。此外,来自不同实验技术(如X射线晶体学、冷冻电镜)的结构分辨率差异显著,约有9,726个域的分辨率标记为未知,引入噪声并影响模型泛化能力。序列长度从9到1,275个氨基酸不等,长尾分布进一步增加了分类器的鲁棒性挑战。
常用场景
经典使用场景
CATH数据集作为蛋白质结构域层次分类的权威资源,广泛用于蛋白质结构预测与功能注释的研究。其经典的使用场景在于利用该数据集训练深度学习模型,如卷积神经网络或Transformer架构,以自动将蛋白质结构域分配到CATH分类体系中的类、架构、拓扑和同源超家族四个层级。研究人员通常基于CATH提供的序列与结构信息,开发序列到结构的映射模型,例如通过多序列比对和进化信息增强的分类器,从而在蛋白质工程、药物设计等下游任务中实现高精度的结构域识别。
解决学术问题
CATH数据集有效解决了蛋白质结构域自动分类这一长期困扰生物信息学界的核心问题。在传统依赖实验结构解析的背景下,CATH通过提供大规模、层次化标注的结构域数据,使得研究者能够系统性地探索序列与结构之间的演化关系。该数据集尤其推动了序列-结构-功能关联的定量分析,例如通过解决同源超家族预测中序列多样性带来的挑战,帮助揭示蛋白质折叠规律。其贡献还体现在为评估结构预测算法提供了标准化的基准,显著提升了计算生物学在蛋白质设计中的可信度。
衍生相关工作
基于CATH数据集衍生出众多突破性工作,其中最经典包括DeepMind的AlphaFold系列采用CATH作为训练数据之一,实现了蛋白质结构预测的精度革命。此外,Ian Sillitoe等人开发的CATH FunFHMMer算法通过整合隐马尔可夫模型,显著提升了远程同源检测能力。近年来,GraphQA等图神经网络方法利用CATH的超家族标签进行结构质量评估,而ESMFold等语言模型则依赖其序列-标签对应关系预训练蛋白质表示。这些工作共同推动了结构生物学从手工分析向数据驱动范式的根本转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务