PCAC-Affinitydata
收藏资源简介:
This dataset contains antigen-antibody binding affinity data compiled from multiple established databases for machine learning applications in immunology research. The dataset includes sequence-based information from five major sources: PaddlePaddle 2021 Antibody Dataset, AB-Bind, SKEMPI 2.0, SAbDab (Structural Antibody Database), and a derived Benchmark dataset.The compiled dataset comprises a total of 18,651 raw entries, which were filtered and preprocessed to yield 6,956 high-quality data points. The PaddlePaddle 2021 dataset serves as the primary training and validation set with 4,875 entries (originally 5,210), containing AG and Kd-derived entries with explicit chain sequences. Additional datasets include AB-Bind (691 entries from 1,101 raw), SKEMPI 2.0 (387 entries from 7,085 raw), SAbDab (579 entries from 3,241 raw), and Benchmark (264 entries from 2,014 raw).All data are provided in sequence format, with preprocessing steps applied to retain only wild-type antigen-antibody complexes with available chain sequences and measured binding affinities. The dataset follows a 6:2:2 training-validation-testing split ratio for the main datasets, while the Benchmark dataset serves as an independent test set to ensure robust model evaluation with less than 30% sequence identity to training antigens.This curated dataset enables researchers to develop and evaluate machine learning models for predicting antigen-antibody binding affinity, supporting computational immunology and therapeutic antibody design applications.
本数据集收录了从多个权威成熟数据库整理得到的抗原-抗体结合亲和力数据,用于支撑免疫学研究中的机器学习应用。数据集包含5个主要来源的序列信息:PaddlePaddle 2021抗体数据集(PaddlePaddle 2021 Antibody Dataset)、AB-Bind、SKEMPI 2.0、结构抗体数据库SAbDab(Structural Antibody Database)以及衍生基准测试数据集(Benchmark dataset)。 本数据集初始包含18651条原始数据条目,经筛选与预处理后得到6956条高质量数据点。其中PaddlePaddle 2021数据集为核心的训练与验证集,包含4875条有效数据(原始条目为5210条),涵盖抗原(Antigen,AG)与解离常数(dissociation constant,Kd)衍生的条目,并附带明确的链序列信息。 其余子数据集分别为:AB-Bind(原始1101条,经处理后得到691条)、SKEMPI 2.0(原始7085条,经处理后得到387条)、SAbDab(原始3241条,经处理后得到579条)以及基准测试数据集(原始2014条,经处理后得到264条)。 所有数据均以序列格式提供,预处理步骤仅保留带有完整链序列信息且结合亲和力已被实测的野生型抗原-抗体复合物。 主数据集采用6:2:2的训练-验证-测试划分比例,而基准测试数据集作为独立测试集,其与训练集抗原的序列同一性低于30%,以此保障模型评估的鲁棒性。 本经精心整理优化的数据集可支持研究者开发并评估用于预测抗原-抗体结合亲和力的机器学习模型,为计算免疫学与治疗性抗体设计相关研究提供有力支撑。




