遇见数据集

Synthyra/PDB-Chain-Complex-Benchmark-Rigor

收藏
Hugging Face2026-07-06 更新2026-07-22 收录
官方服务:

资源简介:

PDB-Chain-Complex-Benchmark-Rigor是一个基于蛋白质数据银行(PDB)的链和复合物基准数据集,用于机器学习和生物信息学应用。该数据集是对原始数据集Synthyra/PDB-Chain-Complex-Benchmark的严格重新构建,重新计算了拆分分配以确保数据完整性。它包含两种配置:chains(单个蛋白质链)和complexes(蛋白质复合物),数据经过过滤,排除了序列长度小于10或包含X残基的链。拆分策略基于多个组件(如序列、序列哈希、30%序列聚类、结构聚类等)进行连接,目标是训练集占90%、验证集和测试集各占5%的组件计数分布,并严格防止训练、验证和测试集之间的数据泄漏。数据集支持集群平衡的PyTorch采样,适用于训练模型时避免过拟合。构建元数据显示,链数据包含约103.7万行,复合物数据包含约34.5万行,并提供了详细的统计信息和质量控制检查。

PDB-Chain-Complex-Benchmark-Rigor is a chain and complex benchmark dataset derived from the Protein Data Bank (PDB), intended for machine learning and bioinformatics applications. This dataset is a rigorous reconstruction of the original Synthyra/PDB-Chain-Complex-Benchmark dataset, with split assignments recalculated to ensure data integrity. It features two configurations: chains (single protein chains) and complexes (protein complexes). The dataset has been filtered to exclude chains with sequence length less than 10 or containing X residues. The split strategy is formulated by combining multiple components (e.g., sequence, sequence hash, 30% sequence identity clustering, structure clustering, etc.), targeting a component count distribution where the training set accounts for 90% of the total, while the validation and test sets each account for 5%, with strict prevention of data leakage between the training, validation, and test sets. The dataset supports cluster-balanced PyTorch sampling, which is ideal for mitigating overfitting during model training. The metadata generated during dataset construction shows that the chain subset contains approximately 1,037,000 rows, and the complex subset contains approximately 345,000 rows, with detailed statistical information and quality control checks provided.

提供机构:
Synthyra
搜集汇总
数据集介绍
Synthyra/PDB-Chain-Complex-Benchmark-Rigor 数据集图片
构建方式
PDB-Chain-Complex-Benchmark-Rigor 数据集是基于 Synthyra/PDB-Chain-Complex-Benchmark 的严格重建版本,其核心构建在于对链(chains)与复合物(complexes)进行无泄漏的划分。构建流程首先对原始链数据进行质量过滤,剔除长度小于最小序列长度阈值或含有 X 残基的条目。随后,通过连通分量算法,综合考虑精确序列、序列哈希、30% 序列聚类、结构聚类、来源划分分量、同一PDB不对称单元隶属关系、链组装隶属关系及生物组装共隶属关系等多维信息,将数据划分为训练集、验证集和测试集,目标比例为 90/5/5。在划分过程中,系统会硬性失败以防止任何链或复合物成员在跨划分时泄漏,确保链 UID、序列等关键字段的严格独立。复合物的列表值有效载荷列则由链表在重建过程中重新生成,并直接断言其一致性。整个构建过程验证了所有发布的聚类标签,并包含可选的序列验证边。
特点
该数据集具有几个突出特点。首先,其严格的划分策略确保了在链 UID、序列、序列哈希、30% 序列聚类、结构聚类和划分分量等所有关键维度上,训练、验证和测试集之间不存在任何交叉泄漏,为蛋白质结构预测研究提供了高度可靠的基准。其次,数据集的元数据详尽记录了构建过程的每个步骤,包括过滤掉的链和复合物数量、各划分的样本计数以及所有字段的唯一值分布,使得数据集的来源和构建细节完全透明。此外,数据集支持两种配置模式:链模式(chains)和复合物模式(complexes),分别包含超过一百万个链和三十多万个复合物,覆盖了广泛的蛋白质结构多样性。质量过滤标准包括排除含有 X 残基的序列和设置最小序列长度,确保了数据的高质量。
使用方法
该数据集可通过 Hugging Face Datasets 库便捷加载。用户可以使用 `load_dataset` 函数指定仓库 ID 和配置名称('chains' 或 'complexes')以及所需划分('train'、'valid' 或 'test')来获取数据。数据集设计了一种基于聚类的平衡采样策略,特别适用于训练深度学习模型。用户可以通过实现一个自定义的 PyTorch Dataset 类(如 README 中提供的 PDBClusteredDataset),在每个训练周期内从每个序列聚类组中随机采样一个样本,从而确保模型能够均衡地学习不同聚类中的蛋白质结构信息。对于链模式,分组基于 'sequence_cluster_30' 字段;对于复合物模式,可设置为按成员序列聚类或按复合物聚类集进行分组。加载的数据可以通过标准的 PyTorch DataLoader 进行批处理,方便集成到现有的蛋白质结构预测流水线中。
背景与挑战
背景概述
蛋白质结构预测与分子互作研究是计算生物学领域的核心议题,其进展高度依赖于高质量、无泄漏的结构数据集。PDB-Chain-Complex-Benchmark-Rigor数据集由Synthyra团队于2026年基于原始PDB-Chain-Complex-Benchmark重构发布,旨在系统性地解决结构生物学数据划分中长期存在的信息泄漏问题。该基准通过严格的连通分量分割策略,综合考量精确序列、序列哈希、30%序列同源性簇、结构簇以及非对称单元与生物组装关系等多重维度,实现了训练、验证与测试集在链与复合物层面零泄漏的严苛目标。数据集覆盖逾百万条蛋白质链与三十余万复合物条目,为蛋白质序列-结构-复合物多层级学习的公平评估提供了坚实基石,对结构预测、蛋白质设计及分子对接等方向产生了深远影响。
当前挑战
该数据集所面对的领域挑战主要源于蛋白质数据天然的高冗余性和跨结构生物的复杂关联性,传统随机划分常导致同源或同源复合物在训练与测试集间泄漏,严重虚增模型泛化性能评估。在构建过程中,首要挑战在于需同时维护链与复合物表在序列、结构、组装等多个维度上的同步无泄漏划分,任何遗漏都将破坏基准的可靠性。大规模数据处理亦对计算效率提出考验,系统需在半小时内完成超百万条链与逾三十六万复合物的扫描、过滤、连通成分构建及多重校验。此外,过滤逻辑的定界(如剔除含X残基或过短序列)与保留完整复合物的取舍,要求精心平衡数据纯净度与覆盖率,确保产出既严格又具备生物学代表性。
常用场景
经典使用场景
在蛋白质结构生物学与计算生物学的交汇地带,PDB-Chain-Complex-Benchmark-Rigor数据集为深度学习模型的训练与评估提供了严谨的数据基石。其最经典的使用场景聚焦于蛋白质链级与复合物层级的结构预测任务,研究者可凭借该数据集训练基于序列或结构的编码器,从而精准推断蛋白质的三维构象。数据集内建的链与复合物双模式配置,配合基于精确序列、序列哈希、30%序列聚类及结构聚类等多元约束的划分策略,确保了训练集、验证集与测试集之间无任何信息泄露。这一精心设计的框架尤其适用于同源建模、蛋白质-蛋白质相互作用界面预测,以及基于进化信息的接触图估计等前沿议题,为模型泛化能力的可靠衡量奠定了坚实基础。
解决学术问题
该数据集系统性地解决了计算结构生物学领域中长期困扰学界的数据泄露与划分偏差问题。传统蛋白质结构数据集常因序列或结构相似性在训练与测试集间的无意渗透,导致模型性能被虚高估计,进而阻碍了学术社区对算法真实泛化能力的客观评判。PDB-Chain-Complex-Benchmark-Rigor通过连通组件分析,在精确序列、序列哈希、30%序列聚类、结构聚类、源划分组件、同一PDB不对称单元、链组装及生物组装共多个维度上实施严格的无重叠约束,从根源上遏制了数据污染。这一严谨的划分策略使得该数据集成为评估蛋白质结构预测方法鲁棒性与可迁移性的黄金标准,深刻推动了同类研究在方法论上的规范化进程。
衍生相关工作
围绕PDB-Chain-Complex-Benchmark-Rigor的严苛划分原则,学界已衍生出一系列影响深远的工作。其中,基于该数据集构建的聚类平衡采样器成为后续研究的标准组件,它保证了每个训练周期内每类序列簇仅被随机抽取一条样本,从而避免了冗余序列对模型训练的不当偏置,这一策略被广泛复用于大规模蛋白质语言模型的微调阶段。该数据集亦催生了关于蛋白质复合物结构预测任务的评估基准重组工作,研究者在其基础上提出了考虑多链生物组装完整性的验证协议,进一步丰富了结构生物学方法论体系。此外,数据集中对不对称单元与生物组装成员关系的细致编码,为后续开发面向结构域划分与多聚体界面预测的图神经网络架构提供了启发性思路。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务