遇见数据集

LiteFold/UniProtKB

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

UniProtKB Processed 是一个基于UniProt知识库(UniProtKB)的蛋白质序列数据集,旨在为用户提供全面、高质量且免费访问的蛋白质序列数据,这些数据带有功能注释信息。数据集包括三个主要源集:Swiss-Prot已审核的规范蛋白质(574,627条记录)、Swiss-Prot替代异构体序列(41,333条记录)以及TrEMBL未审核的蛋白质(202,556,314条记录),总计203,172,274条蛋白质记录。数据集还包含总残基数75,747,523,712、序列分片205个、蛋白质条目表分片615个等附加指标。它支持特征提取任务,并提供了训练、验证和测试分割,适用于生物信息学和蛋白质研究。数据以JSONL格式存储,并包含元数据记录和序列文件。

UniProtKB Processed is a protein sequence dataset based on the UniProt Knowledgebase (UniProtKB), aiming to provide users with a comprehensive, high-quality, and freely accessible set of protein sequences annotated with functional information. The dataset includes three main source sets: Swiss-Prot reviewed canonical proteins (574,627 records), Swiss-Prot alternative isoform sequences (41,333 records), and TrEMBL unreviewed proteins (202,556,314 records), totaling 203,172,274 protein records. Additional metrics include total residues of 75,747,523,712, sequence shards of 205, and protein-entry table shards of 615. It is designed for feature-extraction tasks and provides train-validation-test splits, suitable for bioinformatics and protein research. Data is stored in JSONL format and includes metadata records and sequence files.

提供机构:
LiteFold
搜集汇总
数据集介绍
LiteFold/UniProtKB 数据集图片
构建方式
UniProtKB数据集基于全球权威的UniProt知识库构建,旨在提供高质量、无冗余且功能注释详尽的蛋白质序列集合。其生产流程经过精心设计,通过自动与人工相结合的筛选机制,将收录的序列限制在高品质的参考蛋白质组范围内。数据集的构建采用多源整合策略,涵盖Swiss-Prot经人工审编的蛋白质、其可变剪接异构体以及TrEMBL自动注释的未审编条目,总计超过2.03亿条记录,并以JSONL格式压缩存储,辅以确定性的哈希分桶与精确序列分裂方法,确保数据划分的稳定性和可复现性。
特点
该数据集最显著的特征在于其层次化的精细划分与规模的庞大致使信息密度极高。它提供了多种配置选项,包括default索引、sprot、sprot_varsplic和trembl子集,满足从精准审编到海量探索的不同研究需求。每个蛋白质条目不仅包含氨基酸序列,还附带丰富的元数据,如访问号、蛋白质名称及功能注释。此外,数据集结构严谨,内置了明确的训练、验证与测试集划分,并支持流式加载与分片索引,极大地方便了大规模生物信息学分析及深度学习模型的训练与评估。
使用方法
使用者可通过Hugging Face的`datasets`库便捷地加载UniProtKB数据集。调用`load_dataset("LiteFold/UniProtKB")`即可获取默认的文件索引,而指定配置名如`"sprot"`则能加载相应审编蛋白质的子集。数据集支持标准加载与流式处理两种模式,后者尤其适用于存放于云端的海量TrEMBL条目。同时,用户可利用默认索引中的`source_set`和`table_split`等字段,精准过滤出特定来源与分区的数据分片,并直接读取其路径,从而灵活构建个性化的数据处理流水线,或结合UniRef等工具实现同源性感知的严格划分。
背景与挑战
背景概述
UniProtKB(Universal Protein Knowledgebase)是全球最权威的蛋白质序列与功能信息数据库,由UniProt联盟持续维护与更新,其2025年版本的数据集通过HuggingFace平台以结构化形式发布。该数据集整合了Swiss-Prot(人工审评的规范蛋白质)、Swiss-Prot可变剪接异构体及TrEMBL(自动注释的未审评蛋白质)三类来源,总计超过2.03亿条蛋白质记录,涵盖约757亿个氨基酸残基。自其诞生以来,UniProtKB已成为蛋白质组学、生物信息学及计算生物学领域的基石性资源,支持从序列比对、功能预测到药物设计等一系列研究。2025年版本进一步优化了生产流程,将序列限制为高质量、非冗余的参考蛋白质组,并融合机器学习技术进行自动注释,同时鼓励社区审评以确保文献信息的完整性。该数据库被授予全球核心生物数据资源(Global Core Biodata Resource)地位,彰显了其在科学界的不可或缺性。
当前挑战
UniProtKB数据集所面临的挑战可分为两个层面。在领域问题层面,其主要挑战在于应对蛋白质序列数据的爆炸性增长与功能注释的准确性之间的平衡。TrEMBL部分包含超过2亿条未审评序列,如何利用机器学习模型可靠地预测其功能,同时避免错误传播,是待突破的瓶颈。此外,序列同源性导致的偏差使得训练模型时需谨慎划分训练、验证与测试集,以避免信息泄漏。在构建过程中,数据集面临的技术挑战包括:对超过750亿残基的序列进行高效存储与索引,采用205个序列分片和615个蛋白质条目表分片实现分布式访问;确保确定性哈希分割策略下序列去重与分割的严格一致性;以及维护跨多版本更新的数据兼容性。这些挑战要求数据集在规模、精度与可用性之间达成精妙平衡,从而为下游研究提供可靠支持。
常用场景
经典使用场景
UniProtKB作为全球蛋白质序列与功能注释的核心知识库,在生物信息学研究中常被用于大规模蛋白质序列分析、功能域预测和进化关系重建。研究者借助该数据集中的Swiss-Prot高质量手工注释条目与TrEMBL自动注释条目,能够开展蛋白质结构与功能的系统挖掘。经典用法包括利用其丰富的序列-功能关联数据进行基于深度学习的蛋白质功能预测模型训练。例如,通过提取蛋白质序列、基因本体注释及亚细胞定位信息,科学家可以构建端到端的预测框架,在缺乏实验验证的蛋白质上推断其潜在功能角色,这对解析非模式生物的蛋白质组具有重要推动作用。
衍生相关工作
基于UniProtKB数据集,衍生出多项具有里程碑意义的研究工作。DeepMind的AlphaFold系列模型便利用UniProtKB中的蛋白质序列与结构信息进行训练,最终实现了从序列到三维结构的高精度预测,颠覆了结构生物学的研究范式。此外,以UniProtKB为基准数据源,研究人员开发了Prottrans、ESM等蛋白质语言模型,通过对数亿条序列的预训练,掌握了蛋白质的语义表征,进而用于功能预测与设计。在数据库整合方面,SIDER、DrugBank等资源通过与UniProtKB的交叉引用,建立了蛋白质-药物间的关联网络,为计算药物重定位提供了坚实的数据锚点。
数据集最近研究
最新研究方向
在蛋白质组学与人工智能深度融合的前沿浪潮中,UniProtKB数据集正被广泛应用于大规模蛋白质语言模型的预训练与微调,驱动着从序列到功能预测的范式变革。当前研究热点聚焦于利用其收录的逾2亿条高质量蛋白质序列(涵盖Swiss-Prot审校条目与TrEMBL未审校条目),结合自监督学习技术,构建能够捕捉进化与结构信息的深度表征。尤为值得关注的是,该数据集与AlphaFold等结构预测工具联动,催生了针对稀有变体、可变剪接异构体及未表征蛋白的零样本推理方法。通过引入序列精确拆分策略与同源性感知评估框架,研究者正有效规避数据泄漏风险,提升模型在药物靶点发现、酶工程及病原体演化监测等紧迫任务中的泛化能力。UniProtKB作为全球核心生物数据资源的最新认证,进一步巩固了其在开放科学与精准医疗领域的基石地位。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务