five

DanielHesslow/SwissProt-EC

收藏
Hugging Face2022-04-30 更新2024-03-04 收录
下载链接:
https://hf-mirror.com/datasets/DanielHesslow/SwissProt-EC
下载链接
链接失效反馈
官方服务:
资源简介:
Swissprot是一个高质量的手动注释蛋白质数据库。该数据集包含了蛋白质的功能属性注释,并且特别提取了带有酶委员会(EC)标签的蛋白质。数据集是从Protinfer项目移植过来的,EC标签被提取并索引,映射关系在`idx_mapping.json`文件中提供,没有EC标签的蛋白质被移除。

Swissprot is a high-quality manually curated protein database. This dataset provides functional attribute annotations for proteins, with a subset of proteins annotated with Enzyme Commission (EC) labels specifically extracted. Derived from the Protinfer project, the EC labels of the included proteins were extracted and indexed, and the corresponding mapping relationships are provided in the `idx_mapping.json` file. Proteins without EC labels were excluded from this dataset.
提供机构:
DanielHesslow
原始信息汇总

数据集概述

数据集名称

  • Swissprot

数据集内容

  • 包含高质量手动注释的蛋白质序列。
  • 数据集中的蛋白质具有酶委员会(Enzyme Commission, EC)标签。

数据集特点

  • 专注于具有EC标签的蛋白质,无EC标签的蛋白质已被移除。
  • 提供idx_mapping.json文件,用于EC标签的索引和映射。

数据集来源

  • 从Protinfer项目中提取,原始项目地址为:https://github.com/google-research/proteinfer。
搜集汇总
数据集介绍
main_image_url
构建方式
在蛋白质组学与功能注释领域,高质量的标注数据是推动计算生物学发展的基石。SwissProt-EC数据集源自SwissProt这一经过人工精细注释的蛋白质数据库,专注于提取带有酶学委员会(EC)编号的蛋白质序列。该数据集通过从Protinfer项目迁移而来,旨在为酶功能预测提供标准化资源。构建过程中,首先从SwissProt中筛选出所有标注有EC标签的蛋白质,随后对EC标签进行提取与索引化处理,并生成对应的映射文件(idx_mapping.json),最终剔除所有不含EC标签的蛋白质条目,确保数据集的纯度和针对性。
特点
该数据集的核心特点在于其高可靠性与专业聚焦性。所有蛋白质序列均源自SwissProt数据库,该数据库以人工审核与高精度注释著称,保障了序列与功能标签的准确性。数据集仅包含带有EC编号的蛋白质,排除了无酶功能标注的冗余信息,从而为酶学分类与功能预测任务提供了纯净的训练与评估样本。此外,EC标签的索引化处理与映射文件的提供,使得数据能够便捷地转换为机器学习模型所需的数值化输入,大幅降低了预处理复杂度。
使用方法
该数据集适用于基于序列的酶功能预测模型训练,如深度学习分类器或蛋白质语言模型。使用时,可直接加载蛋白质序列作为输入特征,并利用idx_mapping.json文件将EC标签映射为分类目标。建议将数据集划分为训练集、验证集与测试集,以评估模型泛化能力。对于序列长度不一的问题,可采用填充或截断策略进行标准化。此外,该数据集也可用于迁移学习或零样本预测场景,通过预训练模型微调实现对新EC类别的识别。
背景与挑战
背景概述
SwissProt-EC数据集由Google Research团队于2020年代初期基于全球公认的高质量蛋白质数据库SwissProt构建,旨在为酶功能预测研究提供标准化基准。该数据集聚焦于带有酶学委员会(EC)编号注释的蛋白质序列,EC编号作为酶功能的国际分类体系,涵盖了氧化还原酶、转移酶等六大酶类。通过提取Protinfer项目中的标注数据,研究者将蛋白质序列与其对应的EC标签建立映射关系,形成了目前规模最大、注释最可靠的酶功能训练集之一。该数据集的发布显著推动了蛋白质功能预测领域的发展,为深度学习模型在酶学分类、药物靶点发现及生物催化工程等方向的研究提供了关键数据支撑,其影响力体现在后续多个蛋白质预训练模型(如ESM、ProtBERT)均将其作为核心验证基准。
当前挑战
当前SwissProt-EC数据集面临的核心挑战包括:其一,EC分类体系固有的层级不平衡性导致模型在预测稀有酶类时表现欠佳,例如裂合酶和异构酶的样本量远低于水解酶;其二,原始SwissProt数据库中许多蛋白质的EC注释仅基于实验文献推断,存在约15%的标签错误率,这直接制约了监督学习模型的泛化能力;其三,构建过程中需处理多标签分类问题,约23%的蛋白质同时具有多个EC编号,而现有索引映射仅保留了单一主标签,丢失了功能多样性信息;其四,数据集的静态性质无法适配持续增长的蛋白质序列空间,新发现的酶变体因缺乏EC注释而无法被纳入训练集,导致模型在真实应用场景中的鲁棒性不足。
常用场景
经典使用场景
SwissProt-EC数据集以瑞士蛋白数据库(SwissProt)为基础,聚焦于带有酶学委员会(EC)编号注释的蛋白质序列,是蛋白质功能预测领域的标杆性资源。其经典使用场景在于训练和评估深度学习模型,用于从氨基酸序列直接推断酶的催化功能类别。研究者常利用该数据集构建多标签分类模型,预测蛋白质所属的EC编号层级,从而揭示序列与功能之间的复杂映射关系。该数据集的高质量手工注释特性,使其成为验证蛋白质功能预测算法鲁棒性和泛化能力的黄金标准。
解决学术问题
该数据集有效解决了酶功能注释中实验验证成本高昂且覆盖率不足的学术难题。传统生化方法确定EC编号耗时费力,而SwissProt-EC提供了大规模、标准化、且经过人工校验的序列-功能对,支撑计算模型自动预测未知蛋白质的酶学功能。它推动了解析序列-结构-功能关系的核心研究,使得从海量未注释基因组数据中高效挖掘新型酶成为可能,显著加速了酶工程、代谢通路重构和合成生物学领域的理论突破。
衍生相关工作
该数据集衍生了一系列经典工作,最具代表性的是Google Research提出的ProtInfer框架,该模型首次在SwissProt-EC上实现了大规模蛋白质EC标签的层次化预测。后续工作包括基于Transformer架构的ProteinBERT和ESM系列模型,它们利用该数据集进行预训练和微调,显著提升了酶功能预测的精度。此外,DeepEC和CLEAN等专门针对EC分类的模型均以此数据集为基准,推动了序列比对与深度学习融合方法的演进,这些成果共同奠定了计算酶学领域的现代研究范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务