Synthyra/PDB-Chain-Complex-Benchmark
收藏资源简介:
PDB-Chain-Complex-Benchmark 是一个基于蛋白质数据库(PDB)的蛋白质链和生物组装基准数据集。该数据集包含两个配置:chains(每个蛋白质聚合物链实例为一行数据)和complexes(每个生物组装为一行数据,并包含成员链列表)。数据集采用严格的分割策略,基于精确序列重复组、30% MMseqs2序列聚类、Foldseek结构聚类和生物组装共成员关系的连通组件进行分割,确保训练、验证和测试集之间在序列、序列聚类、结构聚类和组件上完全独立,以避免数据泄漏。数据集旨在为蛋白质结构预测和生物组装研究提供高质量的基准数据。
PDB-Chain-Complex-Benchmark is a PDB-derived protein chain and biological assembly benchmark with strict sequence, sequence-cluster, structure-cluster, and component-disjoint splits. It includes two configs: chains (one row per protein polymer chain instance) and complexes (one row per biological assembly with list-valued member chains). The dataset is designed to provide high-quality benchmark data for protein structure prediction and biological assembly research, ensuring no data leakage across splits.




