遇见数据集

LiteFold/protenix-data

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

Protenix Data是字节跳动开源的AlphaFold3复现模型Protenix所使用的完整预处理训练数据集,是目前公开的最大AF3风格训练语料库之一。该数据集基于wwPDB构建,专门用于AF3风格训练,支持蛋白质、DNA、RNA、配体、离子和修饰等多种生物分子的全原子扩散模型预测。数据集包含原始文件931,270个,总大小1.05 TiB,分为52个未压缩的tar分片。数据内容包含mmCIF文件、生物组装结构、MSA(多序列比对)模板、RNA MSA以及通过ColabFold流程生成的UniRef30和环境数据库比对结果。Protenix-v1版本将PDB数据截止时间扩展到2025-06-30,并增加了RNA MSA和基于HMMER的结构模板。数据集文件类型主要包括.a3m、.cif、.fasta、.pkl.gz、.csv等格式,适用于生物信息学、蛋白质结构预测和计算生物学研究。

Protenix Data is the full preprocessed training dataset released by ByteDance for training Protenix, an open-source PyTorch reproduction of AlphaFold3. It is one of the largest publicly available AF3-style training corpora, built from the wwPDB and designed for drop-in use in AF3-style training. The dataset supports a unified all-atom diffusion model for proteins, DNA, RNA, ligands, ions, and modifications. It contains 931,270 original files with a total payload of 1.05 TiB, organized into 52 uncompressed tar shards. The data includes mmCIF files, bioassembly structures, MSA templates, RNA MSAs, and alignments generated via the ColabFold pipeline against UniRef30 and environmental databases. The Protenix-v1 version extends the PDB cutoff to 2025-06-30 and adds RNA MSAs and HMMER-derived structural templates aligned with the AF3 template strategy. Common file formats include .a3m, .cif, .fasta, .pkl.gz, and .csv, making it suitable for bioinformatics, protein structure prediction, and computational biology research.

提供机构:
LiteFold
搜集汇总
数据集介绍
LiteFold/protenix-data 数据集图片
构建方式
该数据集源自蛋白质数据银行(wwPDB),是字节跳动团队为复现AlphaFold3而构建的预处理训练语料。原始数据以2021年9月30日为截止日期(与AF3一致),后续版本进一步将截止日期扩展至2025年6月30日。多序列比对(MSA)采用ColabFold流程,针对UniRef30与ColabFold环境数据库生成,其中UniRef序列通过分类学标识符进行配对,其余序列融入未配对的MSA特征。Protenix-v1版本额外整合了RNA的MSA及基于HMMER的结构模板,所有模板策略均与AF3保持一致。最终语料包含超过93万个文件,总容量约1.05 TiB,并被打包为52个tar分片。
特点
该数据集以公开可用的大型AF3风格训练语料为定位,其核心特点在于全面性与即用性。数据涵盖蛋白质、DNA、RNA、配体、离子及修饰等多种生物分子类型,并统一采用全原子扩散模型框架。在组织形式上,数据集被精细划分为common、mmcif、posebusters等若干源目录,分别存放通用文件、晶体结构、基准验证结构等不同类别的数据。所有文件均通过metadata.csv与shards.csv进行索引,支持按路径、分片、大小及修改时间等元数据字段进行精准查询,极大便利了用户的检索与提取。
使用方法
使用该数据集时,推荐采用huggingface_hub工具进行整体下载,并通过循环解压所有tar分片至本地目录。若需按需获取特定文件,可先利用datasets库加载元数据表,查询目标文件的shard_path,随后通过huggingface_hub下载对应分片,并使用tarfile模块解压其中的member_path文件。此外,datasets库还支持流式读取元数据,允许用户在不下载全部数据的情况下逐行查看文件路径与分片信息,适合进行数据预览或小规模采样分析。所有tar分片均为未压缩格式,以简化打包与随机提取流程,避免对已压缩数据的重复计算开销。
背景与挑战
背景概述
Protenix数据集的诞生源于字节跳动团队对AlphaFold3的开源复现,该项目于2025年正式发布,由ByteDance AML AI4Science团队主导。该数据集以wwPDB为构建基础,整合了蛋白质、DNA、RNA、配体、离子及修饰小分子的结构信息,旨在提供一个统一的原子扩散模型生物分子结构预测训练语料库。其核心研究问题在于推动全原子水平上的生物大分子结构预测,填补了公共领域在AF3风格训练数据上的空白。通过公开超过93万份原始文件、容量达1.05 TiB的预训练数据,Protenix数据集不仅支持了高精度结构预测模型的迭代,还为全球计算生物学研究提供了可复现的基准训练资源,对蛋白质结构预测领域产生了深远影响。
当前挑战
Protenix数据集在构建与应用中面临多重挑战。在领域问题层面,生物分子结构预测的核心挑战在于从序列信息精确推断三维构象,尤其是处理蛋白质-核酸复合物、配体结合等复杂场景,并需兼顾计算效率与预测泛化能力。在数据集构建过程中,首要挑战涉及海量多序列比对(MSA)的生成与存储,包括对UniRef30及ColabFold环境数据库的检索,以及将UniRef序列按分类学ID配对,剩余序列折叠为非配对MSA特征。此外,数据生成的时效性也是一大难点,需定期更新PDB截止日期(自2021-09-30至2025-06-30)以纳入最新结构,同时整合RNA MSA和HMMER模板特征,确保数据与先进策略对齐。最终,将1.05 TiB原始数据均匀分片至52个tar包(每包约20 GiB),并设计无压缩存储以简化随机访问,体现了对大规模数据高效管理与分发挑战的系统性应对。
常用场景
经典使用场景
在生物信息学与计算结构生物学领域,Protenix-Data数据集作为AlphaFold3开源复现项目Protenix的训练语料,其最经典的使用场景是训练基于扩散模型的通用型生物分子结构预测模型。该数据集整合了来自wwPDB的蛋白质、DNA、RNA、配体、离子及化学修饰等多类生物分子的结构信息,并提供了与AlphaFold3一致的预处理流程和多序列比对(MSA)特征,使研究者能够直接用于训练能够同时处理多种分子类型的统一结构预测框架。
实际应用
在实际应用中,Protenix-Data可被直接用于训练或微调商业级生物分子结构预测系统,助力药物研发与分子设计。例如,制药企业可利用该数据集训练模型以预测小分子配体与靶点蛋白的结合构象,加速先导化合物优化;合成生物学团队则可用于设计具有特定功能的蛋白质变体或核酸纳米结构。此外,其提供的RNA MSA与HMMER结构模板数据,为RNA结构预测和RNA-蛋白质复合物建模提供了宝贵的训练资源,在非编码RNA功能解析和RNA药物开发中展现出广阔的应用前景。
衍生相关工作
依托Protenix-Data数据集的开放性与高质量,已衍生出一系列重要的研究工作。ByteDance团队自身基于该数据集迭代训练了Protenix-v1-20250630版本,将PDB截止日期扩展至2025年6月,验证了更大规模、更新数据对模型泛化能力的提升作用。此外,该数据集为对比不同MSA生成策略(如ColabFold管道与RoseTTAFold MSAs)的效果提供了标准基准,并催生了面向多链复合物结构预测的改进型扩散模型。部分工作还利用其中的非蛋白质模态数据,探索了配体-受体协同构象采样与RNA三维结构从头预测等前沿课题,形成了以数据驱动结构生物学为特色的研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务