Exploiting Pretrained Biochemical Language Models for Targeted Drug Design
收藏资源简介:
This repository contains materials for the paper,<em> Exploiting Pretrained Biochemical Language Models for Targeted Drug Design, </em>which<em> </em>has been accepted for publication in <em>Bioinformatics</em> Published by Oxford University Press. <em>data.zip</em> contains vocabulary files for the pretrained models, additional information regarding proteins (PFAM family, protein similarity) and interactions filtered from BindingDB which are further split into train, validation and test sets and used to train target specific molecule generation models. <em>models.zip </em>includes files for the models trained in this study. <em>predictions.zip </em>comprises the compounds generated with the targeted models and the result of their evaluation with respect to benchmarking metrics. <em>docking.zip </em>contains <em>targets/ </em>including PDB files of the test proteins selected for docking evaluation, <em>ligands/ </em>including SDF files for molecules generated with the targeted models and two decoding strategies (i.e. beam search and sampling) and <em>complex/ </em>including docking outputs.
本仓库收录了论文《利用预训练生化语言模型开展靶向药物设计》(*Exploiting Pretrained Biochemical Language Models for Targeted Drug Design*)的配套资料,该论文已被由牛津大学出版社出版的《Bioinformatics》(《生物信息学》)期刊正式录用。其中,data.zip 内含预训练模型的词汇文件、蛋白质相关补充信息(PFAM家族(PFAM family)、蛋白质相似性数据),以及从BindingDB中筛选得到的相互作用数据集;该数据集已被划分为训练集、验证集与测试集,用于训练靶点特异性分子生成模型。models.zip 包含本研究中训练得到的所有模型文件。predictions.zip 收录了使用靶向模型生成的化合物,以及基于基准评测指标对这些化合物进行评估后得到的结果。docking.zip 内含三个子文件夹:targets/ 存放用于对接评估的测试蛋白质的PDB文件(PDB file);ligands/ 包含使用靶向模型生成的分子的SDF文件(SDF file),以及两种解码策略:束搜索(beam search)与采样(sampling);complex/ 存放对接结果文件。



