遇见数据集

Synthyra/PDB-Chain-Complex-Benchmark

收藏
Hugging Face2026-06-30 更新2026-07-22 收录
官方服务:

资源简介:

PDB-Chain-Complex-Benchmark 是一个基于蛋白质数据库(PDB)的蛋白质链和生物组装基准数据集。该数据集包含两个配置:chains(每个蛋白质聚合物链实例为一行数据)和complexes(每个生物组装为一行数据,并包含成员链列表)。数据集采用严格的分割策略,基于精确序列重复组、30% MMseqs2序列聚类、Foldseek结构聚类和生物组装共成员关系的连通组件进行分割,确保训练、验证和测试集之间在序列、序列聚类、结构聚类和组件上完全独立,以避免数据泄漏。数据集旨在为蛋白质结构预测和生物组装研究提供高质量的基准数据。

PDB-Chain-Complex-Benchmark is a PDB-derived protein chain and biological assembly benchmark with strict sequence, sequence-cluster, structure-cluster, and component-disjoint splits. It includes two configs: chains (one row per protein polymer chain instance) and complexes (one row per biological assembly with list-valued member chains). The dataset is designed to provide high-quality benchmark data for protein structure prediction and biological assembly research, ensuring no data leakage across splits.

提供机构:
Synthyra
搜集汇总
数据集介绍
Synthyra/PDB-Chain-Complex-Benchmark 数据集图片
构建方式
PDB-Chain-Complex-Benchmark的构建依托于蛋白质数据银行(PDB)中收录的蛋白质链与生物组装体信息,旨在为蛋白质结构预测与比对研究提供严格无泄漏的基准数据集。构建过程中,首先提取所有蛋白质聚合物链实例作为基础单元,并依据生物组装体的共成员关系将相关链聚合法为复合物数据。为确保数据划分的严谨性,该数据集在精确序列重复组、MMseqs2序列聚类(30%阈值)、Foldseek结构聚类以及生物组装体共成员关系等多个维度上进行连通组件分析,从而将数据划分为训练集、验证集与测试集。构建流水线会执行严格的泄漏断言检查,确保任何配置的泄漏断言在数据上传之前均被满足,从而保障跨数据集划分的零泄漏特性。
使用方法
使用PDB-Chain-Complex-Benchmark数据集时,用户可通过HuggingFace Datasets库加载,并选择'chains'或'complexes'配置以适配不同的研究需求。每个配置均预划分了训练、验证与测试子集,用户可直接用于蛋白质表征学习、序列-结构关系建模或复合物组装预测等任务的模型训练与评估。数据集成包了每行的唯一链标识符、序列信息、序列与结构聚类标签及分割组件属性,便于用户进行细粒度分析。对于需要验证模型泛化能力的研究,建议严格遵循其预设的数据划分,充分利用其零泄漏特性,以确保实验结果的可重复性与公正性。此外,构建流水线的元数据与泄漏断言结果可供用户复现或扩展该基准。
背景与挑战
背景概述
PDB-Chain-Complex-Benchmark是由Synthyra研究团队于2026年创建的高质量蛋白质结构基准数据集,源自蛋白质数据银行(PDB),旨在为蛋白质链与生物组装体的结构预测与比对研究提供严格、无泄漏的训练与评估框架。该数据集涵盖了超过106万条蛋白质链和36万个生物组装复合物,通过精确序列重复分组、MMseqs2序列聚类、Foldseek结构聚类及生物组装共成员关系构建连通组件,实现了跨分割的无泄漏划分。其严谨的分割策略不仅解决了传统数据集中因序列或结构相似性导致的信息泄漏问题,还为蛋白质结构预测、功能注释及药物设计等领域的研究提供了可靠的训练与测试基准,显著提升了模型评估的公平性与可重复性。
当前挑战
该数据集所解决的领域核心挑战在于蛋白质结构预测与比对中普遍存在的数据泄漏问题,传统数据集往往因序列或结构的高度相似性导致模型在训练集与测试集间产生虚假的性能提升,而PDB-Chain-Complex-Benchmark通过多层级连通组件划分策略,确保了链与复合物级别的严格无泄漏分割。在构建过程中,团队面临的技术挑战包括:整合大规模PDB数据时需协调序列聚类(MMseqs2)、结构聚类(Foldseek)与生物组装关系之间的复杂依赖,以及通过自动化流水线处理超过百万条记录时保证分割逻辑的一致性与可验证性。此外,构建元数据中记录的单一结构提取失败案例,亦揭示了从原始PDB文件中提取三维结构时潜在的不稳定性与数据质量问题。
常用场景
经典使用场景
在蛋白质结构预测与功能解析的研究长河中,如何构建一个无信息泄漏的高质量训练与评估基准,始终是制约深度学习模型泛化能力的核心瓶颈。PDB-Chain-Complex-Benchmark 正是为此而生,它从蛋白质数据库(PDB)中提炼出超过百万条蛋白质链和三十六万余个生物组装体,并基于严格的序列重复组、MMseqs2 序列聚类、Foldseek 结构聚类以及生物组装共成员关系,将数据划分为训练、验证与测试集。这一设计使得每条蛋白质链或复合体在跨划分时具有最低的相似性,从而为蛋白质结构预测、复合体组装建模以及蛋白质间相互作用推断等任务,提供了一个公平且严苛的评测平台。
解决学术问题
长期以来,蛋白质计算领域面临着一个严峻的挑战:许多公开数据集的划分方式存在无意间的信息泄漏,导致模型在测试集上的表现被高估,真实泛化能力被掩盖。PDB-Chain-Complex-Benchmark 通过引入多重去冗余策略与连通分量划分算法,彻底杜绝了训练集与测试集之间的序列或结构相似性。这一严谨的分割机制,让研究者能够真实评估模型在未见过的蛋白质链和复杂生物组装体上的表现,进而推动了蛋白质结构预测、分子对接以及多聚体建模等方向的评估标准走向科学化与规范化,为后续学术成果的可重复性和可比性奠定了坚实基础。
实际应用
该数据集的应用已超越学术边界,深入至药物研发与生物工程的实际场景。在新药靶点发现中,研究人员可以利用其严格划分的测试集,验证基于深度学习的蛋白质-配体结合模式预测模型,从而筛选出高亲和力的候选分子。在抗体设计中,它能帮助优化针对特定抗原表位的抗体结构预测算法。此外,在酶工程与合成生物学领域,该数据集为定向进化提供了可靠的起始结构库,使得研究者能够高效识别具有催化潜力的新酶突变体,加速工业酶的理性设计。
数据集最近研究
最新研究方向
在蛋白质结构预测与功能理解的前沿领域,PDB-Chain-Complex-Benchmark作为一份严格去除了序列与结构泄露的高质量基准数据集,正引领着基于深度学习的蛋白质链与复合物建模研究。该数据集融合了MMseqs2序列聚类与Foldseek结构聚类技术,构建了多层级的无偏拆分方案,有效解决了传统数据划分中因同源性与结构相似性导致的评估偏差问题。其庞大样本规模(超过106万条链与36万复合物)为开发泛化能力更强的蛋白质表示模型与复合物相互作用预测模型提供了坚实的数据支撑,尤其在AlphaFold等结构预测工具取得突破性进展后,此类防止信息泄漏的基准对于客观评估模型真实性能、推动结构生物学与药物发现领域的发展具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务