遇见数据集

mke-novel-druglike-smiles

收藏
Hugging Face2026-07-06 更新2026-07-07 收录
官方服务:

资源简介:

MKE新颖类药分子数据集是一个由人工智能生成的、专注于药物发现的小分子化学数据集,包含22,153个经过严格验证和过滤的、具有类药性和生物利用度潜力的新颖小分子。每个分子以规范的SMILES字符串表示,并通过RDKit验证确保化学有效性。其核心特点是100%的新颖性,已针对MOSES、ZINC-250k和ChEMBL数据库中的超过464万已知化合物进行了查重验证。数据集中的分子满足类药性标准:定量估计药物相似性(QED)得分≥0.50(最高达0.947),合成可及性(SA)得分≤4.0(平均低于3.0),分子量(MW)≤500 Da(平均约280 Da),并且其脂水分配系数(LogP)等ADMET相关属性分布在理想治疗窗口内(例如平均LogP为1.53)。超过99%的分子符合Lipinski规则五。数据集以CSV格式(novel_molecules.csv)提供,包含smiles(SMILES字符串)、qed(QED得分)、sa(SA得分)、mw(分子量)和logp(LogP值)五个字段。该数据集适用于虚拟筛选、先导化合物优化、生成式人工智能模型基准测试以及基于片段的药物发现等应用场景。数据集由MKE Chemistry Platform使用定制化的80M参数Causal Transformer模型,在本地消费级硬件上基于180万分子训练数据生成,并采用严格的拓扑采样和新颖性过滤流程。数据集采用MKE Dataset License v1.0许可,允许商业研究使用。

The MKE Novel Drug-like Molecules Dataset is an AI-generated small molecule chemistry dataset focused on drug discovery. It contains 22,153 rigorously validated and filtered novel small molecules with drug-like properties and bioavailability potential. Each molecule is represented by a canonical SMILES string and validated for chemical validity using RDKit. Its core feature is 100% novelty, verified through deduplication against over 4.64 million known compounds from the MOSES, ZINC-250k, and ChEMBL databases. The molecules in the dataset meet drug-like criteria: Quantitative Estimate of Drug-likeness (QED) score ≥ 0.50 (up to 0.947), Synthetic Accessibility (SA) score ≤ 4.0 (average below 3.0), molecular weight (MW) ≤ 500 Da (average around 280 Da), and ADMET-related properties such as LogP are within an ideal therapeutic window (e.g., average LogP of 1.53). Over 99% of the molecules comply with Lipinskis Rule of Five. The dataset is provided in CSV format (novel_molecules.csv) with five fields: smiles (SMILES string), qed (QED score), sa (SA score), mw (molecular weight), and logp (LogP value). It is suitable for applications such as virtual screening, lead optimization, generative AI model benchmarking, and fragment-based drug discovery. The dataset was generated by the MKE Chemistry Platform using a customized 80M-parameter Causal Transformer model on local consumer-grade hardware, based on 1.8 million molecular training data, with strict topological sampling and novelty filtering. It is licensed under the MKE Dataset License v1.0, permitting commercial research use.

创建时间:
2026-07-05
原始信息汇总

数据集概述

数据集名称: MKE Novel Drug-Like Molecules — AI-Generated SMILES Dataset
数据集地址: https://huggingface.co/datasets/MKEChem/mke-novel-druglike-smiles
许可证: MKE Dataset License v1.0(商业研究可用)


数据集规模与核心指标

  • 总化合物数量: 22,154 个
  • 有效性: 35.1%
  • 新颖性: 100.0%(与 MOSES、ZINC-250k、ChEMBL 中 4,643,595 个已知化合物比对确认)
  • 先导化合物筛选率: 100.0%
  • 最高 QED 得分: 0.947
  • 生成耗时: 约 25 分钟

分子特性与药物相似性

  • Lipinski 五规则符合率: 21,955 / 22,154(99.1%)
  • 平均 LogP(脂溶性): 1.53(理想治疗窗口)
  • LogP 范围: -3.42 至 6.77
  • 分子量: 硬上限 ≤ 500 Da(平均约 280 Da)
  • 合成难易度(SA): 平均低于 3.0(易于合成)
  • 药物相似性(QED): 所有分子 ≥ 0.50,前导分子可达 0.947

数据集格式

  • 文件: novel_molecules.csv
  • 字段说明:
字段名 数据类型 描述
smiles string 规范 SMILES(经 RDKit 验证)
qed float 定量药物相似性估计(0–1)
sa float 合成可及性评分(1–10,分数越低越易合成)
mw float 分子量(Da)
logp float 辛醇-水分配系数(脂溶性/水溶性)

生成方法

  • 模型: 80M 参数因果 Transformer(FlashAttention 优化)
  • 架构: 自定义 StableTransformerLayer,D_MODEL=768,12 头,12 层
  • 训练数据: 来自 MOSES + ZINC-250k 的 180 万分子
  • 采样策略: Top-P 核采样(p=0.85, T=0.80),附结构修复保护
  • 新颖性过滤: 基于 MOSES、ZINC-250k 和 ChEMBL 的 4,643,595 个唯一 SMILES 的 RAM 索引参考集
  • 运行硬件: NVIDIA RTX 5070(Blackwell),完全本地运行,无云端依赖

应用场景

  • 虚拟筛选: 原生支持针对生物靶点进行筛选
  • 先导化合物优化: 作为药物化学起始骨架
  • AI/ML 研究: 在新型化学空间中对比生成模型性能
  • 片段药物发现: 挖掘子结构用于新候选药物开发

访问与获取

  • 完整数据集可通过 Gumroad 购买: https://mkechem.gumroad.com/
  • 免费样本(100 个分子)可通过 Hugging Face 社区页申请
  • 许可证: MKE Dataset License v1.0,允许商业研究使用
搜集汇总
数据集介绍
mke-novel-druglike-smiles 数据集图片
构建方式
该数据集源于一个80M参数的因果Transformer模型,其架构基于自定义的StableTransformerLayer,包含768维模型维度、12个注意力头和12个网络层,并采用FlashAttention优化技术提升计算效率。模型使用来自MOSES和ZINC-250k的180万个分子进行训练,通过Top-P核采样策略(p=0.85,T=0.80)结合结构修复屏蔽机制生成新颖分子。随后,所有生成的分子经过严格验证:首先通过RDKit确认化学有效性,继而与MOSES、ZINC-250k和ChEMBL数据库中总计4,643,595个已知化合物进行新颖性比对,最终保留那些绝对新颖的分子。在此基础上,进一步施加药效团过滤条件,包括QED≥0.50、SA≤4.0及分子量不超过500 Da,以筛选出符合药物相似性和生物利用度要求的高价值候选物,整个过程在本地NVIDIA RTX 5070(Blackwell架构)硬件上约25分钟内完成。
使用方法
该数据集以novel_molecules.csv文件形式提供,包含smiles、qed、sa、mw和logp五个字段,分别对应标准SMILES表示、药物相似性定量估计、合成可及性评分、分子量和脂水分配系数。用户可直接加载CSV文件进行虚拟筛选,针对特定生物靶点进行分子对接或药效团匹配;也可用于先导化合物优化,将数据集中的分子作为医药化学起始骨架进行结构改造。在人工智能与机器学习研究中,该数据集可作为基准测试集,评估生成模型探索新颖化学空间的能力;此外,还可应用于基于片段的药物发现,通过挖掘子结构寻找新的候选药物。数据集遵循MKE数据集许可证v1.0,允许商业研究使用,并提供100个分子的免费样本供评估。
背景与挑战
背景概述
该数据集名为MKE Novel Drug-Like Molecules — AI-Generated SMILES Dataset,由MKEChem团队于近期创建,旨在利用生成式人工智能技术探索新型药物分子的化学空间。核心研究问题聚焦于如何通过AI模型高效生成具有高药物相似性、新颖性和合成可行性的小分子,以解决传统药物筛选依赖已知化合物数据库的局限性。数据集包含22,153个经RDKit验证的SMILES表示分子,其新颖性通过与MOSES、ZINC-250k和ChEMBL中逾460万已知分子的比对得以确认。这一资源的推出,为虚拟筛选、先导化合物优化及生成模型基准测试提供了宝贵的数据支撑,在药物发现与AI化学领域具有显著影响力。
当前挑战
该数据集所应对的领域挑战主要包括:传统高通量筛选成本高昂且搜索空间有限,而AI生成分子常面临化学有效性低下、新颖性不足及可合成性差等问题。本数据集通过35.1%的SMILES有效性率、100%的新颖率以及平均低于3.0的合成可及性评分,部分缓解了上述痛点。然而,其构建过程仍面临多重挑战:包括如何在有限计算资源下平衡生成多样性(Top-P核采样参数p=0.85)与分子质量,确保ADMET属性分布合理(如LogP范围-3.42至6.77),以及实现99.1%的Lipinski五规则通过率。此外,数据集的商业许可性质可能限制其开源协作潜力,而生成的分子仍需进一步实验验证以确认生物活性。
常用场景
经典使用场景
在药物发现与化学信息学领域,MKE Novel Drug-Like Molecules数据集为虚拟筛选与先导化合物优化提供了高质量的起始骨架。该数据集包含超过两万个由生成式AI设计、经RDKit验证的SMILES分子,其内在的类药性(QED≥0.50)与合成可及性(SA≤4.0)指标使其天然适配于基于结构的药物设计流程。研究者可直接利用这些分子对接至特定生物靶点,或将其作为片段扩展与药效团修饰的起点,显著加速从计算到实验验证的转化链条。
解决学术问题
该数据集有力回应了计算药物化学中长期面临的‘新颖性-类药性’权衡困境。传统虚拟库往往在扩展化学空间时牺牲类药属性,或过度依赖已知骨架,导致先导命中率低下。MKE数据集通过严格的去重过滤(对比超过460万已知分子)与多维度ADMET约束(如99.1%通过Lipinski五规则),在确保100%新颖性的同时维持了理想的口服生物利用度分布。这为生成模型泛化能力与分子质量之间的平衡研究提供了实证基准,推动了对隐式化学空间约束策略的探讨。
实际应用
在实际药物研发管线中,该数据集可作为早期苗头化合物库用于高通量筛选替代方案。制药企业可将其作为虚拟库,通过分子对接、药效团匹配等方法快速识别候选分子,降低初期实验筛选成本。同时,因其分子具备良好的合成可及性(平均SA低于3.0),药化团队可直接基于SMILES进行定向合成与结构优化,缩短从虚拟命中到实际先导物的周期。此外,该数据集对硬件依赖低,可部署于本地GPU环境,特别适用于数据敏感性高的专有项目。
数据集最近研究
最新研究方向
该数据集聚焦于利用大规模因果Transformer模型自主生成全新类药小分子,并通过严格的新颖性验证与ADMET筛选(如99.1%符合Lipinski五规则、平均QED≥0.85)确保其成药潜力。当前前沿方向包括:基于局部推理的隐私保护型药物发现范式、基于结构修复的低采样温度生成策略以提升化学有效性,以及将此类生成数据用于虚拟筛选、先导优化和片段药物设计的闭环验证。这一工作体现了生成式AI在未探索化学空间中快速产出高价值先导化合物的能力,为加速早期药物开发提供了可复现、低成本的新路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务