MOSES
收藏官方服务:
资源简介:
该数据集是一个化学分子数据集,包含约190万个样本,总大小约516MB。数据集由五个特征字段构成:SMILES(简化分子线性输入规范)、ID(分子标识符)、SELFIES(自引用嵌入字符串)和SAFE(另一种分子表示字符串),这些字段提供了分子的多种字符串表示形式。数据被划分为五个分割:训练集(train,约120万样本)以及四个测试集——基于分子量的测试集(test_molecular_weight,约9.4万样本)、基于分子支架的测试集(test_scaffold,约39.6万样本)、基于最大相异性的测试集(test_max_dissimilarity,约9.3万样本)和随机测试集(test_random,约9.4万样本)。测试集的不同划分方式表明该数据集可能用于评估分子性质预测、分子生成或化学相似性分析等任务的模型鲁棒性和泛化能力。数据集适用于计算化学、药物发现和分子机器学习领域的研究与应用。
创建时间:
2026-07-21
搜集汇总
数据集介绍

构建方式
MOSES数据集是一个专注于分子生成与优化的标准化基准库,由机器学习与化学信息学领域的研究者精心构建。该数据集从ZINC Clean Leads化合物库中筛选出约190万条分子,经过严格的去重、过滤和标准化处理,最终保留约120万个训练样本。数据集以SMILES、SELFIES和SAFE三种分子表征格式存储,便于兼容不同分子生成模型。为了全面评估生成模型的性能,数据集中设计了四个测试子集,分别基于分子量、分子骨架、最大不相似性及随机采样划分,确保测试覆盖分子多样性与化学空间的广度。
使用方法
使用MOSES数据集时,研究者可通过HuggingFace Datasets库直接加载,支持按指定配置名调用训练集与多个测试集。通常,利用SMILES或SELFIES序列作为输入,训练分子生成模型;在评估阶段,可依次使用分子量、骨架、最大不相似性和随机四个测试集,分别计算化学有效性、新颖性、多样性及Fréchet ChemNet Distance等标准指标。数据集预定义了数据划分,无需手动分割,便于快速开展对比实验与基准测试。
背景与挑战
背景概述
MOSES(Molecular Set)数据集由Insilico Medicine等机构的研究人员于2018年创建,旨在推动分子生成模型的发展与评估。该数据集聚焦于药物化学领域中的分子生成问题,提供了约190万个小分子化合物,以SMILES、SELFIES和SAFE等多种分子表示形式存储,成为分子生成模型标准化的基准数据集。MOSES的发布填补了当时该领域缺乏统一、高质量评估数据集的空白,对分子生成和优化研究产生了深远影响,促进了模型的公平比较与性能提升。
当前挑战
MOSES数据集主要面临的挑战包括:1)领域问题方面,分子生成模型需要解决生成具有成药性、合成可及性和多样性分子的核心难题,而现有模型常面临生成不稳定或无效分子的问题;2)构建过程中,数据清洗和标准化是重大挑战,需要从大型化学数据库(如ZINC)中筛选出符合药物化学规则的分子,并处理异构体和重复项;3)数据集划分策略的设计,包括基于分子量、骨架和最大相似性的测试集,旨在模拟真实应用场景,但如何确保划分的公平性和对模型评估的全面性仍是持续挑战。
常用场景
经典使用场景
MOSES数据集是分子生成模型领域中的基准测试平台,广泛应用于评估基于SMILES、SELFIES或SAFE表示的分子生成算法。研究人员利用该数据集的训练集(包含约120万种药物类分子)来训练生成模型,并通过其四种精心设计的测试集(分子权重、骨架、最大相异度和随机分割)来系统性地衡量模型在化学多样性、结构新颖性及分布拟合能力上的表现。这一经典使用场景不仅促进了变分自编码器、生成对抗网络和流模型等生成方法的发展,还推动了分子生成任务标准化评估框架的确立。
解决学术问题
MOSES数据集解决了分子生成研究中缺乏统一、可重复评估标准的核心难题。此前,不同工作采用私有数据集或自定义分割,导致结果难以横向比较。MOSES通过提供特定于化学领域的测试集划分(如基于Bemis-Murcko骨架的scaffold分割),直面泛化能力评估这一关键学术问题。它还引入了分子权重和最大相异度等指标,帮助研究者更准确地判断模型发现结构新颖且性质优良分子的潜力。该数据集对推动生成模型在化学空间探索和逆向分子设计中的应用具有深远影响。
实际应用
在实际应用中,MOSES数据集训练出的分子生成模型可直接服务于药物研发管线的早期阶段。例如,生成模型能够快速产生大量符合特定物理化学性质(如类药性、可合成性)的候选分子结构,供制药公司进行后续虚拟筛选和药效评估。此外,MOSES所引导的分子表示方法(如SELFIES的鲁棒性和SAFE的分段线性特性)已集成到开源化学信息学工具中,帮助计算化学家高效生成靶向分子库,显著缩短先导化合物优化的探索周期。
数据集最近研究
最新研究方向
MOSES数据集作为药物分子生成与优化领域的标杆性基准,近期研究聚焦于利用生成式化学模型(如变分自编码器、生成对抗网络及基于Transformer的架构)探索新颖分子结构的广阔化学空间。伴随人工智能制药热潮的兴起,该数据集成为评估分子多样性、药物相似性及合成可及性的关键测试平台,尤其在零样本学习与低样本分子设计等前沿方向展现出独特价值。其包含的分子量、骨架及最大不相似性等多维度测试拆分,为模型泛化能力与稳健性的验证提供了严谨依据,进而推动可逆分子表示(如SELFIES与SAFE格式)与逆合成分析技术的深度融合,加速了从虚拟筛选到先导化合物优化的全链条创新,对缓解传统药物研发的高耗时与高成本困境具有深远意义。
以上内容由遇见数据集搜集并总结生成



