遇见数据集

PDCs数据集

收藏
arXiv2025-06-15 更新2025-11-28 收录
数据链接:
官方服务:

资源简介:

PDCs数据集是由华南理工大学等机构构建的,用于探索肽-药物偶联物(PDCs)的结构-活性关系和活性预测的基准数据集。该数据集包含834个抗癌PDCs的结构和活性标签,涵盖了广泛的结构多样性和化学空间。数据集的构建过程严谨,每个条目包含三个关键组成部分:肽序列、连接剂SMILES和载荷SMILES。该数据集旨在解决PDCs设计的复杂性和缺乏系统性预测工具的问题,为开发新的PDCs药物提供了重要的数据基础。

The PDCs dataset is a benchmark dataset developed by institutions including South China University of Technology for exploring the structure-activity relationship (SAR) and activity prediction of peptide-drug conjugates (PDCs). It contains structural information and activity labels for 834 anticancer PDCs, spanning a broad spectrum of structural diversity and chemical space. The dataset was constructed rigorously, with each entry comprising three core components: peptide sequence, linker SMILES, and payload SMILES. This dataset aims to resolve the complexity of PDC design and the scarcity of systematic prediction tools, serving as a critical data foundation for the development of novel PDC-based therapeutics.

提供机构:
华南理工大学
创建时间:
2025-06-15
搜集汇总
数据集介绍
PDCs数据集 数据集图片
构建方式
肽-药物偶联物(PDC)作为一类新兴的靶向治疗实体,尤其在肿瘤治疗领域展现出巨大潜力,但长期以来缺乏系统性的结构-活性关系(SAR)探究与活性预测的标准数据资源。为填补这一空白,研究者精心构建了PDCs基准数据集。该数据集源自两大渠道:从PubMed数据库中通过关键词检索并手动收集的767条文献来源PDC条目,以及自PDCdb数据库获取的708条记录。经过合并去重、保留完整结构信息(涵盖肽序列、连接体SMILES及载荷SMILES)、剔除含非标准氨基酸的条目、统一细胞水平生物活性单位为微摩尔(μM)以及为含多重活性数据的条目择取最小测试值等一系列严格标准化流程,最终获得了由834条独特抗癌PDC结构组成的高质量建模数据集。其中,每个条目均包含三项核心组分信息,209条标记为“活性”,625条标记为“非活性”,数据集中含2个已获批临床PDC、16个处于临床试验阶段及1个临床前开发阶段的实例,展现出丰富的结构多样性与宽广的化学空间覆盖度。
特点
PDCs基准数据集呈现出多种显著且富有挑战性的特点。首先,其组分构成极为复杂且多样,包含408种独特肽序列、231种连接体及202种载荷,肽链长度多集中于20个及以下氨基酸以内,其中精氨酸、赖氨酸与甘氨酸出现频率最高。其次,连接体可归为十二个结构类别,酰胺键、琥珀酰亚胺硫醚键、酯键、二硫键及戊二酰基类最为常见;载荷则以阿霉素、柔红霉素、喜树碱等高细胞毒性药物为主,体现了PDC经典设计范式。尤为关键的是,数据集中连接体与载荷的骨架新颖率分别达11.69%与56.44%,暗示了PDC结构优化中易对连接体进行修饰而改变载荷骨架较少。此外,连接体与载荷的计算化学空间极为广阔(分子量范围18至1670 Da,AlogP范围-7.6至12.9),进一步印证了该数据集在化学多样性及组成复杂性上的突出表现,为基于深度学习的SAR建模提供了既真实反映现实世界又极具挑战性的基准。
使用方法
PDCs基准数据集的使用方式灵活且系统,为模型训练与评估提供了标准化流程。在PDCNet框架中,该数据集按8:1:1的比例被随机划分为训练集、验证集与测试集,采用三种不同随机种子进行划分以增强评估的鲁棒性。数据集中每条记录的肽序列、连接体SMILES与载荷SMILES分别作为模型的独立模态输入:肽段经One-hot、BLOSUM62、位置编码及Z-scale编码后融入BiLSTM与自注意力机制进行氨基酸级特征提取,同时利用ESM-2蛋白语言模型提取肽段级特征;连接体与载荷则通过预训练的FG-BERT模型进行小分子特征表征。最终,四通道特征经拼接后输入全连接层完成活性预测。模型训练采用早停策略与贝叶斯超参数优化,通过AUC、F1、MCC及平衡准确率(BA)等指标全面评估性能。该数据集亦可直接用于传统机器学习基线模型的训练,通过分子指纹(如Morgan或MACCS)与肽序列特征结合,构建支持向量机、随机森林、逻辑回归及XGBoost等预测模型。
背景与挑战
背景概述
肽-药物偶联物(PDCs)作为继抗体-药物偶联物(ADCs)之后的新一代靶向治疗剂,在癌症治疗领域展现出巨大潜力。然而,由于其结构复杂性——包含肽、连接子和载荷三个关键组分——当前PDCs的研发主要依赖经验方法,缺乏系统性的计算工具来阐明结构-活性关系(SARs)并预测其活性。针对这一空白,华南理工大学的王岭研究团队与贵州医科大学的张继全团队于2024年协同构建了PDCs数据集。该数据集聚类了834种具有明确结构和活性标签的抗癌PDCs,涵盖了408种独特肽段、231种连接子和202种载荷,展现出广泛的化学空间与结构多样性。该数据集的问世填补了领域内标准化数据资源的缺失,为基于深度学习的PDC活性预测提供了关键的基准,从而推动了PDC理性设计与发现范式的形成。
当前挑战
PDCs数据集的核心挑战首先体现在领域问题上,即如何准确预测结构复杂、组分多样的PDCs的抗癌活性。由于PDCs由肽、连接子和载荷三部分协同决定活性,且数据集存在显著的类别不平衡(活性样本仅占约25%),传统机器学习方法难以有效捕捉其细粒度结构特征与复杂构效关系。其次,数据集构建过程面临多重技术障碍:需要从海量文献和PDCdb数据库中手动收集并标准化异源活性数据(IC50、EC50、GI50),统一浓度单位至微摩尔级别,同时需处理非标准氨基酸、不完整结构信息以及重复条目。此外,对活性阈值(如1μM)的客观界定和边界样本的归类也需要审慎设计,以确保数据标签的生物学合理性。
常用场景
经典使用场景
在药物发现与设计领域,PDCs数据集作为首个系统化的多肽-药物偶联物活性预测基准,被广泛用于构建和评估深度学习模型。研究者利用该数据集训练PDCNet等框架,通过整合多肽序列、连接子及载荷的分子特征,精准预测PDCs的抗癌活性。该数据集的化学空间多样性和结构复杂性为模型提供了真实世界的训练环境,使其能够有效捕捉PDC组分间的微妙构效关系,从而成为评估和比较不同机器学习方法性能的核心标准。
衍生相关工作
围绕PDCs数据集,衍生出一系列开创性研究。其中,PDCNet框架作为首个统一深度架构,通过多层级特征融合策略精准预测PDC活性,成为该领域标杆。后续工作包括基于该数据集开发的多任务学习模型,用于同时预测PDC的多种活性指标;以及利用图神经网络探索偶联物分子拓扑结构对活性的影响。此外,该数据集还催生了结合生成式深度学习的智能分子设计平台,实现从虚拟生成到活性预测的闭环优化。
数据集最近研究
最新研究方向
PDCs数据集作为首个标准化的多肽-药物偶联物活性预测基准资源,正推动精准肿瘤治疗领域从经验驱动向计算驱动的范式转变。当前前沿研究聚焦于构建统一深度学习框架以系统解析PDC中肽段、连接子与载荷的复杂构效关系,PDCNet模型通过多层级特征融合架构实现了AUC达0.9213的卓越预测性能,并首次在外部独立验证中展现出对新型PDC分子的强泛化能力。值得关注的是,该数据集覆盖了从临床获批到探索性研究的全谱系PDC结构,涵盖408种独特肽段与202种载荷的广阔化学空间,为突破传统抗体-药物偶联物在肿瘤穿透性、免疫原性及生产成本等方面的固有局限提供了关键数据支撑。随着PDCNet架构的跨疾病扩展潜力被验证,该基准数据集正成为连接计算化学、结构生物学与临床转化的枢纽,加速新一代靶向抗癌药物的理性设计进程。
相关研究论文
  • 1
    通过华南理工大学 · 2025年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务