SMDD-Bench
收藏资源简介:
SMDD-Bench是一个用于评估LLM代理在小分子药物设计任务上的基准,它是小分子药物设计领域的类似SWE-Bench的工具:代理被赋予一个任务和固定工具包(Python解释器、结构预测模型、RDKit等),必须产生可验证的工件。任务设计为计算上易于验证(通过ML模型或RDKit),但科学上具有挑战性。基准涵盖5种任务类型:2D药效团识别、相互作用点发现、骨架跃迁、先导优化和片段组装。
SMDD-Bench is a benchmark for evaluating LLM Agents on small-molecule drug design tasks, and it is analogous to SWE-Bench in the field of small-molecule drug design. Agents are assigned a task and a fixed toolkit including Python interpreter, structure prediction models, RDKit, etc., and are required to produce verifiable artifacts. The tasks are designed to be computationally verifiable via ML models or RDKit yet scientifically challenging. The benchmark covers five task types: 2D pharmacophore identification, interaction site discovery, scaffold hopping, lead optimization, and fragment assembly.
SMDD-Bench 数据集概述
SMDD-Bench 是一个用于评估 LLM 智能体在小分子药物设计(SMDD)任务上的基准测试集。它是小分子药物设计领域类比 SWE-Bench 的基准:智能体获得一个任务和固定工具包(Python 解释器、结构预测模型、RDKit 等),必须生成可验证的结果。任务设计为 computationally simple to verify(通过 ML 模型或 RDKit)但科学上具有挑战性。
任务类型
基准测试涵盖 5 种任务类型:
- 2D 药效团识别 — 根据给定靶点的活性/非活性分子,推导出能区分它们的 2D 药效团。
- 相互作用点发现 — 给定一个结合口袋,预测跨多样配体的 3 个最保守的 3D 药效团点。
- 骨架跃迁 — 给定一个活性分子,设计一个具有显著不同骨架但保留药效团和口袋相互作用的分子。
- 先导化合物优化 — 在保持其他属性和硬约束不变的情况下,沿采样目标改进分子。SMDD-Bench 任务最多包含 5 个同时优化目标和 4 个保持约束以及若干硬约束。
- 片段组装 — 将 1-2 个片段(带 3D 姿势)组装成单个类药结合剂。
数据集构成
- 任务数量:500 个基准任务实例。
- 目录结构:
tasks/:包含 500 个任务子文件夹,每个任务实例一个文件夹,内含task.yaml和支持文件。该目录在源码仓库中被 gitignore,需从 Hugging Face 单独下载tasks_4_4_final.tar.gz文件并解压到仓库根目录。evaluator/:评估框架。每个任务的task.yaml指定用于评分的指标、预期输出和通过条件。metrics/:可从task.yaml调用的验证指标。agent_harness/:极简 LLM 智能体循环、工具定义和运行器。agent_env/:沙箱智能体环境的 Dockerfile。
真实任务设置与关键说明
- 智能体使用固定工具包(Python 解释器、结构预测模型、RDKit 等)。
- 任务设计为 computationally simple to verify,但 scientifically challenging to solve。
- 关于结合亲和力的重要说明:整个基准测试中,
binding_affinity值是原始 Boltz2 预测的 log10(IC50),源自以 μM 测量的 IC50。因此,任务描述中可能会提及降低 Boltz2 生成的binding_affinity字段,以获得更强的结合能力。
许可证与引用
- 如需引用,请使用提供的 BibTeX 条目。
- 问题或合作可联系 kevinhan@cmu.edu。




