遇见数据集

SMDD-Bench

收藏
github2026-05-23 更新2026-05-28 收录
数据链接:
官方服务:

资源简介:

SMDD-Bench是一个用于评估LLM代理在小分子药物设计任务上的基准,它是小分子药物设计领域的类似SWE-Bench的工具:代理被赋予一个任务和固定工具包(Python解释器、结构预测模型、RDKit等),必须产生可验证的工件。任务设计为计算上易于验证(通过ML模型或RDKit),但科学上具有挑战性。基准涵盖5种任务类型:2D药效团识别、相互作用点发现、骨架跃迁、先导优化和片段组装。

SMDD-Bench is a benchmark for evaluating LLM Agents on small-molecule drug design tasks, and it is analogous to SWE-Bench in the field of small-molecule drug design. Agents are assigned a task and a fixed toolkit including Python interpreter, structure prediction models, RDKit, etc., and are required to produce verifiable artifacts. The tasks are designed to be computationally verifiable via ML models or RDKit yet scientifically challenging. The benchmark covers five task types: 2D pharmacophore identification, interaction site discovery, scaffold hopping, lead optimization, and fragment assembly.

创建时间:
2026-05-15
原始信息汇总

SMDD-Bench 数据集概述

SMDD-Bench 是一个用于评估 LLM 智能体在小分子药物设计(SMDD)任务上的基准测试集。它是小分子药物设计领域类比 SWE-Bench 的基准:智能体获得一个任务和固定工具包(Python 解释器、结构预测模型、RDKit 等),必须生成可验证的结果。任务设计为 computationally simple to verify(通过 ML 模型或 RDKit)但科学上具有挑战性。

任务类型

基准测试涵盖 5 种任务类型:

  1. 2D 药效团识别 — 根据给定靶点的活性/非活性分子,推导出能区分它们的 2D 药效团。
  2. 相互作用点发现 — 给定一个结合口袋,预测跨多样配体的 3 个最保守的 3D 药效团点。
  3. 骨架跃迁 — 给定一个活性分子,设计一个具有显著不同骨架但保留药效团和口袋相互作用的分子。
  4. 先导化合物优化 — 在保持其他属性和硬约束不变的情况下,沿采样目标改进分子。SMDD-Bench 任务最多包含 5 个同时优化目标和 4 个保持约束以及若干硬约束。
  5. 片段组装 — 将 1-2 个片段(带 3D 姿势)组装成单个类药结合剂。

数据集构成

  • 任务数量:500 个基准任务实例。
  • 目录结构
    • tasks/:包含 500 个任务子文件夹,每个任务实例一个文件夹,内含 task.yaml 和支持文件。该目录在源码仓库中被 gitignore,需从 Hugging Face 单独下载 tasks_4_4_final.tar.gz 文件并解压到仓库根目录。
    • evaluator/:评估框架。每个任务的 task.yaml 指定用于评分的指标、预期输出和通过条件。
    • metrics/:可从 task.yaml 调用的验证指标。
    • agent_harness/:极简 LLM 智能体循环、工具定义和运行器。
    • agent_env/:沙箱智能体环境的 Dockerfile。

真实任务设置与关键说明

  • 智能体使用固定工具包(Python 解释器、结构预测模型、RDKit 等)。
  • 任务设计为 computationally simple to verify,但 scientifically challenging to solve。
  • 关于结合亲和力的重要说明:整个基准测试中,binding_affinity 值是原始 Boltz2 预测的 log10(IC50),源自以 μM 测量的 IC50。因此,任务描述中可能会提及降低 Boltz2 生成的 binding_affinity 字段,以获得更强的结合能力。

许可证与引用

  • 如需引用,请使用提供的 BibTeX 条目。
  • 问题或合作可联系 kevinhan@cmu.edu。
搜集汇总
数据集介绍
SMDD-Bench 数据集图片
构建方式
SMDD-Bench是专为评估大语言模型在真实小分子药物设计任务中表现而构建的基准测试集。其构建方式借鉴了SWE-Bench的设计理念,为智能体提供固定的计算工具包和可验证的任务,要求其自主完成分子设计。数据集涵盖5种任务类型:二维药效团识别、相互作用位点发现、骨架跃迁、先导化合物优化及片段组装。每类任务均依赖计算模型或RDKit等工具进行验证。全部500个任务实例以独立的子文件夹形式组织,每个任务包含task.yaml配置文件及支持验证的辅助文件,任务数据从Hugging Face平台下载后置于tasks目录中。
特点
该数据集的核心特点在于将计算可验证性与科学挑战性巧妙融合。任务被设计为在计算上易于通过机器学习模型或RDKit进行自动化评分,但在实际药物化学设计层面却颇具难度。先导优化任务可同时涉及多达五个优化目标与四个需保持不变的约束条件,极大考验智能体的多目标权衡能力。此外,结合亲和力数值采用Boltz2预测的log10(IC50),为模型提供了基于配体-靶标结合强度的直接反馈信号,增强了评估的科学严谨性。
使用方法
使用者需首先通过Conda创建专用环境并安装Open Babel、PLIP等非pip工具,随后安装Python依赖并构建智能体与评测器的Docker镜像。运行智能体时通过agent_harness/run.py脚本为每个任务启动独立的Docker容器,支持按任务ID、任务列表文件或指定GPU批量并行执行。完成推理后,利用evaluator/evaluate.py评测器对智能体输出进行打分,支持按全部任务、已有输出文件夹、特定类型或任务子集进行灵活评估,最终在每个任务子目录中生成结果文件与汇总摘要。
背景与挑战
背景概述
SMDD-Bench由Kevin Han、Renfei Zhang等来自卡内基梅隆大学的研究人员于2026年创建,旨在评估大型语言模型代理在真实世界小分子药物设计任务中的表现。该基准测试受SWE-Bench启发,是小分子药物设计领域的类比基准,涵盖2D药效团识别、相互作用点发现、骨架跃迁、先导化合物优化及片段组装五类核心任务。通过提供固定工具包(如Python解释器、结构预测模型及RDKit),SMDD-Bench要求代理生成可验证的计算工件,其任务设计在计算上易于验证但在科学上极具挑战性。该基准包含500个任务实例,推动了AI在药物发现领域从理论到实践的跨越,对药物化学与人工智能交叉领域产生了显著影响。
当前挑战
该基准面临的挑战主要来自两方面。领域问题层面,小分子药物设计需解决多目标优化难题,如先导化合物优化任务同时涉及最多五个优化目标和四个约束条件,且需平衡药效、选择性及药代动力学性质;骨架跃迁任务要求代理在保留药效团特征的前提下彻底改变分子骨架,对创造性提出极高要求。构建过程层面,验证指标设计极为复杂,需依赖经物理建模预测的结合亲和力(如Boltz2预测log10(IC50))与计算成本高昂的分子对接和三维药效团匹配;此外,沙箱环境需整合Open Babel、PLIP等非pip可安装的系统工具,并确保Docker容器化的GPU计算任务稳定执行,所有工具链的协同工作与结果可复现性亦是巨大工程挑战。
常用场景
经典使用场景
在药物发现与计算化学的交叉领域中,SMDD-Bench被设计为评估大型语言模型(LLM)智能体解决小分子药物设计问题的标准化测试平台。其最经典的使用场景是提供一个封装了Python解释器、结构预测模型(如Boltz2)以及RDKit等化学信息学工具的固定工具箱环境,让LLM智能体在无需人工干预的情况下,自主完成从理解任务、生成分子结构到通过计算验证的完整闭环。研究者通过该基准测试可以系统性地衡量LLM在药物设计推理与工具调用方面的能力,从而推动AI辅助药物研发的自动化水平。
实际应用
在实际药物研发管线中,SMDD-Bench所涵盖的任务类型直接对应着工业界的关键痛点。例如,先导化合物优化任务要求智能体在同时优化多达五个目标属性(如结合亲和力、代谢稳定性)并维持四项约束不变的前提下改进分子,这与真实项目中多参数权衡的决策场景高度吻合。骨架跃迁任务则引导智能体穿越庞大的化学空间去发现新颖母核结构,对于突破专利壁垒、设计新靶点分子具有直接应用价值。此外,片段组装任务模拟了基于结构的药物设计中从片段到先导物的拼接过程,可被用于自动化生成候选分子库,提升早期研发效率。
衍生相关工作
SMDD-Bench的提出催生了若干具有启发性的衍生研究方向。受SWE-Bench评估范式的启发,该工作将软件工程中的自动化补丁验证思路迁移至化学领域,开创了“任务-工具-验证”三位一体的智能体评估框架。围绕该基准,后续研究者可能开发出专用于分子设计的LLM智能体策略,例如结合蒙特卡洛树搜索进行分子构象优化、利用检索增强生成(RAG)引用已知药效团知识、或设计层次化规划以分解复杂的多目标优化任务。此外,该数据集提供的标准化评估协议有望催生化学领域专用的智能体排行榜,驱动更高效、更可靠的AI药物设计系统的迭代发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务