遇见数据集

AlphaFoldDB

收藏
Hugging Face2026-05-27 更新2026-05-28 收录
官方服务:

资源简介:

AlphaFoldDB Prediction Index是一个基于AlphaFold DB构建的开放数据集,提供大规模预测的蛋白质三维结构及其置信度分数,显著扩展了已知蛋白质序列的结构覆盖范围。数据集以Parquet格式存储,包含约2.47亿行数据,分为训练集(约2.22亿行)和测试集(约0.25亿行),分割方式基于UniProt登录号的哈希值取模10的确定性分割(模0为测试集,模1-9为训练集)。数据统计显示蛋白质序列长度最小为5,最大为4,186,中位数约278,平均长度328.55。最新版本以版本6为主(约2.41亿行)。数据集包含8个关键字段:UniProt登录号(uniprot_accession)、AlphaFold DB标识符(alphafold_id)、最新模型版本(latest_version)、起始和结束残基索引(first_residue_index、last_residue_index)、序列长度(sequence_length)、片段编号(fragment_number,可为空)、是否为片段化预测(is_fragmented_prediction)以及确定性分割桶(split_bucket)。数据来源于AlphaFold DB的镜像,包括48个批量归档文件(16个蛋白质组归档、30个全球健康归档和2个Swiss-Prot归档)。适用于蛋白质结构预测、生物信息学分析、机器学习模型训练与评估等任务,可通过HuggingFace datasets库加载,支持流式处理以提高大规模数据处理效率。

AlphaFoldDB Prediction Index is an open dataset built on AlphaFold DB, providing large-scale predicted protein 3D structures and confidence scores, significantly expanding the structural coverage of known protein sequences. The dataset is stored in Parquet format, containing approximately 247 million rows, divided into a training set (about 222 million rows) and a test set (about 25 million rows), with a deterministic split based on modulo 10 of the hash value of UniProt accession numbers (modulo 0 for test set, modulo 1-9 for training set). Data statistics show a minimum protein sequence length of 5, maximum of 4,186, median of approximately 278, and average length of 328.55. The latest version is predominantly version 6 (about 241 million rows). The dataset includes 8 key fields: UniProt accession (uniprot_accession), AlphaFold DB identifier (alphafold_id), latest model version (latest_version), start and end residue indices (first_residue_index, last_residue_index), sequence length (sequence_length), fragment number (fragment_number, nullable), whether it is a fragmented prediction (is_fragmented_prediction), and deterministic split bucket (split_bucket). Data is sourced from a mirror of AlphaFold DB, comprising 48 batch archive files (16 proteome archives, 30 global health archives, and 2 Swiss-Prot archives). It is suitable for tasks such as protein structure prediction, bioinformatics analysis, machine learning model training and evaluation, and can be conveniently loaded via the HuggingFace datasets library, supporting streaming for efficient large-scale data processing.

创建时间:
2026-05-13
原始信息汇总

数据集概述

AlphaFoldDB Prediction Index 是一个开放的预测蛋白质3D结构索引数据集,包含蛋白质序列的结构预测与置信度评分。数据集以 Parquet 格式存储,总共有 246,689,516 行 数据,涵盖 14 个 Parquet 文件

数据集划分

划分 行数 Parquet 文件数
训练集(train) 222,017,452 12
测试集(test) 24,672,064 2
总计 246,689,516 14
  • 划分规则:基于 hash(uniprot_accession) % 10 的结果,结果为 0 的行归入测试集,结果 19 的行归入训练集。

数据集统计

指标 数值
总行数 246,689,516
最小序列长度 5
近似中位数序列长度 278
平均序列长度 328.55
最大序列长度 4,186
缺少解析片段编号的行数 5,619,027

最新版本分布

最新版本 行数
1 5,271,725
2 347,302
6 241,070,489

镜像文件 download_metadata.json 描述了 48 个批量归档文件:16 个蛋白质组归档、30 个全球健康归档和 2 个 Swiss-Prot 归档。

数据集列说明

列名 描述
uniprot_accession 来自 accession_ids.csv 的 UniProt 登录号。
alphafold_id AlphaFold DB 标识符,例如 AF-Q5VSL9-F1
latest_version 条目可用的最新 AlphaFold DB 模型版本。
first_residue_index UniProt 编号中的第一个残基索引。
last_residue_index UniProt 编号中的最后一个残基索引。
sequence_length 推导值:last_residue_index - first_residue_index + 1
fragment_number alphafold_id 解析的 F<数字> 后缀,当后缀缺失或非标准时可为空。
is_fragmented_prediction 指示 fragment_number 是否大于 1。
split_bucket hash(uniprot_accession) % 10 确定的桶,桶 0 为测试集。

许可与引用

  • 许可协议:Creative Commons Attribution 4.0 International (CC-BY-4.0)
  • 引用

@article{varadi2022alphafolddb, title = {{AlphaFold} Protein Structure Database: massively expanding the structural coverage of protein-sequence space with high-accuracy models}, author = {Varadi, Mihaly and Anyango, Stephen and Deshpande, Mandar and others}, journal = {Nucleic Acids Research}, volume = {50}, number = {D1}, pages = {D439--D444}, year = {2022}, doi = {10.1093/nar/gkab1061} }

搜集汇总
数据集介绍
AlphaFoldDB 数据集图片
构建方式
AlphaFoldDB是由DeepMind团队开发的蛋白质三维结构预测数据库,其构建基于AlphaFold算法对已知蛋白质序列进行大规模结构预测。数据集采用确定性拆分策略,通过对UniProt登录号进行哈希运算并取模10,将结果为零的条目归入测试集,其余归入训练集。最终数据集包含约2.47亿条记录,以Parquet格式存储,训练集与测试集分别包含12个和2个文件,覆盖了从最小5个残基到最长4186个残基的广泛蛋白质序列长度分布。
特点
该数据集的核心特点在于其无与伦比的规模与结构覆盖广度,提供了超过2.46亿个蛋白质条目的预测三维结构及置信度分数。数据集中涵盖了多个AlphaFold模型版本,其中最新版本6的条目占比最高,达到2.41亿。此外,数据集提供了丰富的元信息列,包括UniProt登录号、AlphaFold标识符、序列长度、残基索引范围以及片段编号等,并特别标注了预测是否为片段化结果,为下游分析提供了细腻的粒度控制。
使用方法
用户可通过Hugging Face的datasets库便捷加载数据集,支持直接加载全部数据或按训练/测试拆分分别加载。对于大规模处理场景,推荐启用流式模式以避免内存压力,或直接使用DuckDB、PyArrow等列式引擎处理底层Parquet文件。数据集还支持灵活的过滤操作,例如筛选特定版本号的条目。每一条记录均可通过构造AlphaFold DB的URL链接访问对应的在线预测结构页面,极大地方便了结果验证与可视化。
背景与挑战
背景概述
AlphaFoldDB是由DeepMind团队与欧洲生物信息学研究所(EMBL-EBI)于2021年合作推出的大型蛋白质结构预测数据库,其核心研究问题在于利用深度学习模型AlphaFold2为已知蛋白质序列提供高置信度的三维结构预测。该数据库的发布标志着计算结构生物学领域的重大突破,将蛋白质结构覆盖率从实验方法限制的约20%扩展至超过2亿个条目,彻底改变了蛋白质科学的研究范式。通过提供带有置信度评分的预测结构,AlphaFoldDB不仅推动了功能注释、药物设计及疾病机制解析等下游任务的发展,还催生了诸如LiteFold等高效数据索引方案,显著降低了大尺度结构分析的准入门槛,对结构生物信息学、蛋白质工程及合成生物学产生了深远影响。
当前挑战
AlphaFoldDB面临的首要挑战在于领域问题的复杂性:尽管模型在大部分预测中表现卓越,但对于多结构域蛋白、无序区域或非常规构象的预测仍存在显著偏差,且缺乏对蛋白质动态性和分子间相互作用的描述。在构建过程中,数据索引层需处理超过2.46亿条记录,涉及序列碎片化(约562万条无碎片编号条目)、版本迭代(v1至v6的分布不均)及跨数据库一致性维护(UniProt与AlphaFold ID的映射)等工程难题;此外,大规模数据的可复现性与可扩展性亦成挑战,例如如何通过确定性哈希切割确保训练/测试集无泄漏,以及在不物化全表的前提下支持流式查询,这对列式存储引擎(如Parquet)和分布式计算框架提出了优化需求。
常用场景
经典使用场景
AlphaFoldDB数据集作为蛋白质结构预测领域的里程碑式资源,其最经典的使用场景在于大规模蛋白质三维结构的检索与比对。研究人员可利用该数据集中超过2.46亿条包含置信度评分的预测结构条目,对已知蛋白质序列进行系统性结构覆盖,从而揭示蛋白质折叠模式、功能域组织及进化保守性。例如,通过访问每个条目的AlphaFold ID构建结构链接,能够快速获取特定蛋白质的空间构象,为后续分子动力学模拟或结构生物学实验提供可靠起点。此外,该数据集按UniProt登录号确定性划分的训练集与测试集,为开发新一代结构预测模型提供了标准化基准,推动了深度学习在蛋白质科学中的深度应用。
实际应用
在实际应用层面,AlphaFoldDB数据集已成为药物发现与生物技术创新的核心基础设施。制药工业利用其高置信度预测结构进行虚拟筛选,识别与靶点蛋白高亲和力结合的候选化合物,显著降低先导化合物优化的实验成本。在酶工程与蛋白质设计中,科研人员通过比对数据集中的同源结构信息,定向改造酶活性位点以提升催化效率或底物特异性。此外,该数据集支撑了抗体设计平台对非结构化区域的构象建模,助力开发针对难成药靶点的生物制剂。AlphaFoldDB甚至还被整合进临床基因组学分析流程,辅助解读罕见病患者的错义变异对蛋白质稳定性的潜在破坏作用,为精准医学提供结构层面的决策依据。
衍生相关工作
AlphaFoldDB的发布催生了一系列具有深远影响的相关工作。基于其大规模结构数据,研究者构建了如Foldseek等超快结构相似性搜索工具,革新了传统序列比对方法在远缘同源检测中的局限性。在整合生物学领域,该数据集被用于训练ProteinMPNN等逆折叠模型,实现了从骨架结构到氨基酸序列的精确生成,进而推动了de novo蛋白质设计范式的突破。此外,AlphaFoldDB与序列数据库的联合分析揭示了蛋白质构象多样性与翻译后修饰之间的关联规律,衍生出动态蛋白质组学的新研究方向。围绕该数据集还建立了多个基准测试,如CASP评估的延伸体系,持续检验并提升下一代预测算法在特殊场景下的泛化能力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务