Pharmit Dataset
收藏资源简介:
Pharmit数据集是由卡内基梅隆大学和匹兹堡大学联合构建的大规模3D分子构象库,包含5亿个配体分子及其药效团特征。该数据集源自公共化学库,采用深度学习友好格式存储,显著扩展了训练数据的化学多样性。数据经过严格筛选和标准化处理,可作为蛋白质-配体数据的补充资源。该数据集主要应用于结构基药物设计领域,支持多任务学习框架下的分子对接、从头分子生成等任务,旨在提升生成模型的化学空间探索能力。
The Pharmit dataset is a large-scale 3D molecular conformation library jointly constructed by Carnegie Mellon University and the University of Pittsburgh, containing 500 million ligand molecules and their pharmacophore features. Derived from public chemical repositories, this dataset is stored in a deep learning-friendly format and significantly expands the chemical diversity of training datasets. Rigorously screened and standardized, the data serves as a supplementary resource for protein-ligand datasets. Primarily applied in the field of structure-based drug design, this dataset supports tasks including molecular docking and de novo molecular generation under the multi-task learning framework, aiming to enhance the chemical space exploration capability of generative models.
OMTRA数据集概述
数据集基本信息
- 数据集名称:OMTRA (A Multi-Task Generative model for Structure-Based Drug Design)
- 核心功能:基于流匹配的生成模型,用于小分子-蛋白质系统,支持多种基于结构的药物设计任务。
- 相关论文:预印本发布于 https://arxiv.org/abs/2512.05080,并将在MLSB 2025会议上展示。
支持的任务类型
无条件生成
- 无条件3D从头分子生成
- 无条件配体构象生成
蛋白质条件生成
- 蛋白质口袋条件从头分子设计
- 蛋白质-配体对接(刚性对接,柔性对接即将推出)
- 蛋白质和药效团条件分子设计
- 蛋白质和药效团条件对接
药效团条件生成
- 药效团条件分子生成
- 药效团条件构象生成
模型权重与获取
- 状态:模型检查点尚未上传,相关下载指令为占位符。
- 预期获取方式:通过
wget或curl命令从远程存储位置下载至OMTRA/omtra/trained_models/目录。 - 使用:CLI根据任务自动选择检查点,也可通过
--checkpoint标志显式指定。
数据生成与采样
采样方式
- 命令行界面(CLI):用于脚本和批处理。
- Web应用程序:用于交互式探索。
核心采样参数
--task:指定采样任务(必需)。--n_samples:生成样本数量(默认100)。--n_timesteps:采样过程中的积分步数(默认250)。--output_dir:输出文件保存目录。--metrics:计算生成样本的评估指标。
输入文件格式
- 蛋白质结构文件:PDB或CIF格式。
- 配体结构文件:SDF格式。
- 药效团约束文件:XYZ格式。
可用任务列表
无条件生成
denovo_ligand_condensed:从头生成类药分子。
蛋白质条件生成
fixed_protein_ligand_denovo_condensed:为固定蛋白质结合位点设计配体。protein_ligand_denovo_condensed:与柔性蛋白质联合生成配体。
对接任务
rigid_docking_condensed:将已知配体对接到固定蛋白质结构中。flexible_docking_condensed:蛋白质柔性对接。expapo_conditioned_ligand_docking_condensed:从实验性apo结构开始对接。predapo_conditioned_ligand_docking_condensed:从预测apo结构开始对接。
构象生成
ligand_conformer_condensed:为给定配体生成3D构象。
药效团条件任务
denovo_ligand_pharmacophore_condensed:联合生成配体和药效团。denovo_ligand_from_pharmacophore_condensed:设计匹配给定药效团的配体。ligand_conformer_from_pharmacophore_condensed:生成满足药效团的构象。fixed_protein_pharmacophore_ligand_denovo_condensed:为具有药效团约束的蛋白质设计配体。rigid_docking_pharmacophore_condensed:具有药效团约束的配体对接。
系统要求
- 操作系统:Linux系统。
- 硬件:支持CUDA的NVIDIA GPU(推荐CUDA 12.1)。
- 软件:Python 3.11。
附加文档
- 训练文档:位于 https://github.com/gnina/OMTRA/blob/main/docs/training.md。
- Pharmit数据集:位于 https://github.com/gnina/OMTRA/blob/main/docs/pharmit_dataset.md。
- 结果复现:位于 https://github.com/gnina/OMTRA/blob/main/docs/reproducing_results.md。




