遇见数据集

datamol-io/safe-drugs

收藏
Hugging Face2023-10-28 更新2024-03-04 收录
官方服务:

资源简介:

SAFE(基于顺序连接的片段嵌入)是一种新的分子线性表示法,用于通过生成模型改进分子设计。该数据集是用于基准测试的药物数据集,包含了药物成分、适应症类别、分子ID、分子类型、口服标志、首选名称、治疗标志、USAN词干、USAN词干定义、USAN年份、撤回标志、SMILES、InChIKey、切片、变形、基序、支架和超结构等特征。

The SAFE dataset is a benchmark dataset used in the field of molecular design. It includes various features related to drug molecules, such as dosed_ingredient, indication_class, molecule_chembl_id, molecule_type, oral, pref_name, therapeutic_flag, usan_stem, usan_stem_definition, usan_year, withdrawn_flag, smiles, inchikey, slices, morphing, motif, scaffold, and superstructure. The dataset is split into a training set with 26 examples. Additionally, the file mentions the SAFE notation, which is a novel molecular line notation used to represent molecules as an unordered sequence of fragment blocks.

提供机构:
datamol-io
原始信息汇总

数据集概述

许可证

配置

  • 默认配置 (default) 包含以下数据文件:
    • 训练集 (train) 路径为 data/train-*

数据集信息

特征

  • dosed_ingredient: 布尔型 (bool)
  • indication_class: 字符串型 (string)
  • molecule_chembl_id: 字符串型 (string)
  • molecule_type: 字符串型 (string)
  • oral: 布尔型 (bool)
  • pref_name: 字符串型 (string)
  • therapeutic_flag: 布尔型 (bool)
  • usan_stem: 字符串型 (string)
  • usan_stem_definition: 字符串型 (string)
  • usan_year: 浮点型 (float64)
  • withdrawn_flag: 布尔型 (bool)
  • smiles: 字符串型 (string)
  • inchikey: 字符串型 (string)
  • slices: 字符串型 (string)
  • morphing: 字符串型 (string)
  • motif: 字符串型 (string)
  • scaffold: 字符串型 (string)
  • superstructure: 字符串型 (string)

数据分割

  • 训练集 (train):
    • 字节数:12691
    • 样本数:26

数据集大小

  • 下载大小:18556 字节
  • 数据集大小:12691 字节
搜集汇总
数据集介绍
构建方式
在药物研发与化学信息学领域,分子表征的精确性与灵活性对于生成模型的应用至关重要。SAFE(Sequential Attachment-based Fragment Embedding)作为一种创新的分子线性标记法,通过将分子表示为无序的片段块序列,显著提升了分子设计的效率。datamol-io/safe-drugs数据集正是基于这一方法构建的基准数据集,用于评估和验证SAFE表示法的性能。该数据集精心挑选了26个药物分子样本,每个样本均包含丰富的结构化信息,如分子类型、给药途径、治疗标志、撤市状态等,并提供了SMILES、InChIKey等标准化学标识符。此外,数据集还通过切片(slices)、变形(morphing)、基序(motif)、骨架(scaffold)和超结构(superstructure)等多维度特征,全面刻画了分子的片段化表示,为生成模型的训练与测试提供了高质量的数据基础。
特点
该数据集的核心特点在于其多维度、结构化的分子表征体系,充分体现了SAFE方法的独特优势。每个分子样本不仅包含传统的化学标识符和药理属性(如口服可行性、治疗分类),还通过五种片段化特征——slices、morphing、motif、scaffold和superstructure——从不同粒度揭示了分子的组成与结构关系。这种设计使得数据集能够支持从局部基序到整体骨架的层级式分子分析,特别适用于基于片段的药物设计与生成模型研究。数据集规模虽小(仅26个样本),但每个样本的注释密度极高,涵盖布尔型、字符串型和浮点型等多种数据类型,确保了信息的完整性与多样性。此外,采用CC-BY-4.0许可协议,为学术与工业界的广泛使用提供了便利。
使用方法
datamol-io/safe-drugs数据集的使用方法紧密结合SAFE框架,用户可通过HuggingFace Datasets库直接加载。具体而言,使用`load_dataset`函数并指定数据集名称与配置(如`default`)即可获取训练集。加载后,每个样本包含18个字段,用户可根据研究需求选取特定特征,例如利用`smiles`字段进行分子结构可视化,或借助`morphing`与`scaffold`字段训练分子生成模型。该数据集与SAFE开源仓库(https://github.com/datamol-io/safe)深度集成,用户可参考配套的论文与代码库,实现从数据预处理到模型评估的完整工作流。建议在生成模型任务中,将片段化特征作为输入,结合SAFE的序列化方法进行分子优化与虚拟筛选。
背景与挑战
背景概述
在计算药物发现领域,分子表示方法的选择对生成模型的性能具有决定性影响。传统的SMILES表示法虽被广泛使用,但其线性序列结构难以捕捉分子中复杂的拓扑关系与化学语义。为突破这一瓶颈,Datamol研究团队于2023年提出了基于序列化片段嵌入的SAFE分子表示方法(Sequential Attachment-based Fragment Embedding),并同步发布了SAFE-Drugs基准数据集。该数据集由26个精选药物分子构成,涵盖了给药途径、治疗类别、分子类型及撤市状态等十余项结构化标注信息,旨在评估基于片段级分子表示的生成模型在药物设计任务中的表现。作为SAFE方法论的核心验证资源,该数据集为分子生成、骨架跃迁及药效团优化等任务提供了标准化的评测基准,对推动分子表示学习与药物分子生成研究具有重要价值。
当前挑战
SAFE-Drugs数据集所面临的挑战主要体现在两个层面。在领域问题层面,分子生成模型需解决从片段序列到有效化学空间的映射难题,如何在保持片段语义完整性的前提下生成具有合理药理活性的分子结构,仍是制约模型实用性的核心瓶颈。在数据集构建层面,当前样本规模仅含26个分子,有限的数据量可能限制深度学习模型的泛化能力;同时,标注信息虽丰富但缺乏三维构象与靶点结合数据,难以全面评估生成分子的生物活性。此外,片段划分策略的合理性、序列顺序的语义一致性,以及分子可合成性的隐式约束,均为模型性能的可靠评估增添了额外复杂度。
常用场景
经典使用场景
在药物分子设计与生成式化学领域,SAFE-Drugs数据集凭借其基于顺序附着的片段嵌入(SAFE)表示法,成为分子生成模型的标准评测基准。该数据集包含26种代表性药物分子,每个分子以无序片段序列的形式编码,并附有SMILES、InChIKey、分子类型、给药途径、适应症类别及撤市标志等丰富属性。研究者常利用该数据集训练和评估基于Transformer或扩散模型的分子生成算法,通过对比生成分子与真实药物在结构合理性、片段多样性及药理学特征上的吻合度,验证模型对药物化学规则的掌握能力。其核心价值在于将分子生成从原子级别提升至片段级别,显著降低了化学空间搜索的复杂度。
解决学术问题
该数据集有效解决了传统分子表示法(如SMILES)在生成模型中面临的语法约束强、局部结构不自然等学术难题。通过引入片段级序列嵌入,SAFE-Drugs使生成模型能够直接操作具有明确化学意义的药效团或骨架,避免了原子级生成中频繁出现的无效分子问题。研究团队利用该数据集验证了SAFE表示法在分子重构准确率、片段组合多样性及药物相似性(如Lipinski五规则)保持上的优越性,为化学信息学中分子表征与生成范式的革新提供了实证基础。其意义在于推动生成式AI从“原子拼接”向“片段组装”的认知跃迁,加速了先导化合物优化的理论框架发展。
衍生相关工作
围绕SAFE-Drugs数据集已衍生出多项标志性研究工作。原论文(arXiv:2310.10773)首次提出SAFE表示法并在此数据集上验证了分子重构与生成性能,后续工作将其与强化学习结合,开发出面向多目标优化的片段级分子设计框架。另有研究者基于该数据集构建了对比学习预训练模型,通过片段序列的掩码预测任务学习药物分子的结构语义,进而迁移至活性预测与毒性评估任务。此外,该数据集作为基准之一,被用于评测分子生成模型的片段覆盖率、新颖性及合成可及性指标,推动了化学生成领域标准化评估体系的建立。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务