遇见数据集

Alex99Gsy/M-3_Multi-Modal-Molecule

收藏
Hugging Face2024-06-20 更新2024-06-12 收录
官方服务:

资源简介:

M<sup>3</sup>-20M是一个大规模的多模态分子数据集,包含超过2000万个分子,旨在支持AI驱动的药物设计和发现。数据集提供了多种模态,如一维SMILES字符串、二维分子图、三维分子结构、物理化学性质和文本描述。它支持多种下游任务,如分子生成、分子性质预测、先导化合物优化、虚拟筛选、药代动力学建模和药物-靶点相互作用预测。数据集整合了来自多个来源的数据,提供了每个分子的全面视图。

M<sup>3</sup>-20M is a large-scale Multi-Modal Molecular dataset designed to support AI-driven drug design and discovery. It contains over 20 million molecules and includes various modalities such as one-dimensional SMILES strings, two-dimensional molecular graphs, three-dimensional molecular structures, physicochemical properties, and text descriptions. It supports diverse applications like molecule generation, molecular property prediction, lead optimization, virtual screening, pharmacokinetics modeling, and drug-target interaction prediction. The dataset is available for download from multiple sources including Google Drive, Baidu Cloud, and Hugging Face.

提供机构:
Alex99Gsy
原始信息汇总

数据集概述

许可证信息

  • 许可证类型: MIT License
搜集汇总
数据集介绍
构建方式
M³-20M数据集由同济大学与复旦大学的研究团队联合构建,旨在为人工智能驱动的药物设计与发现提供大规模多模态分子数据。该数据集整合了来自PubChem、GPT-3.5以及多种理化性质计算工具的多源信息,涵盖超过2000万个分子。构建过程中,团队将每个分子的一维SMILES字符串、二维分子图、三维分子结构、理化性质以及文本描述进行系统化融合,形成统一的多模态表示。数据以CSV文件形式组织,包括原始描述、理化性质、组合描述及多模态子集,并针对分子性质预测、分子生成等任务划分了专用文件夹(如MPP、MOSES-Multi、QM9-Multi),确保数据的结构化与易用性。
使用方法
使用M³-20M数据集时,用户可通过Hugging Face、Google Drive或百度云等渠道下载CSV文件。加载数据可借助Pandas库的read_csv函数直接读取,例如通过'pd.read_csv('path-to-dataset.csv')'导入并查看前几行以了解结构。针对不同任务,用户可选择对应子文件夹,如MPP目录下的BBBP-MM、BACE-MM等用于分子性质预测,MOSES-Multi用于分子生成,QM9-Multi用于量子力学属性学习。数据集还提供了Function文件夹中的工具函数,便于在外部分子上生成二维图与三维结构,从而无缝集成到自定义工作流中。
背景与挑战
背景概述
在人工智能驱动的药物设计与发现领域,数据的规模与模态多样性是制约模型性能的关键瓶颈。由同济大学与复旦大学的郭思远、王乐萱、金畅等研究人员于2024年联合发布的M³-20M数据集,旨在突破这一局限,首次提供了涵盖超过2000万个分子的多模态数据,其规模是现有最大数据集的71倍。该数据集整合了SMILES一维序列、分子图二维结构、三维构象、理化性质及文本描述,为分子生成、性质预测、先导化合物优化等下游任务提供了前所未有的训练资源。其发布不仅填补了大规模多模态分子数据的空白,更推动了药物研发领域大模型训练与微调的性能跃升,成为连接计算化学与人工智能的重要桥梁。
当前挑战
M³-20M数据集所应对的核心挑战在于传统分子数据集规模有限且模态单一,难以支撑复杂药物设计任务中对分子结构-性质-功能关系的全面建模。具体而言,现有数据集如QM9或MOSES仅包含数万至百万分子,且缺乏多模态信息融合,导致模型泛化能力不足。在构建过程中,团队面临从PubChem等多源异构数据中提取并对齐SMILES、图结构、3D坐标及文本描述的难题,需解决数据清洗、格式统一与跨模态一致性校验等技术障碍。此外,利用GPT-3.5生成高质量文本描述时,如何平衡自动化效率与化学语义准确性,以及处理超过2000万分子带来的存储与计算资源开销,均是构建该数据集时亟待突破的瓶颈。
常用场景
经典使用场景
在人工智能驱动的药物设计与发现领域,M³-20M数据集凭借其超过2000万分子的庞大规模,成为多模态分子表征学习与生成建模的基石。该数据集整合了一维SMILES序列、二维分子图、三维空间构象、理化性质及文本描述等丰富模态,研究者可基于此训练或微调大型预训练模型,以完成分子生成、性质预测及先导化合物优化等经典任务。其跨模态对齐特性尤为适用于构建统一分子表示框架,从而提升下游分子建模的泛化能力与准确性。
解决学术问题
M³-20M数据集有效攻克了传统分子数据集规模有限、模态单一的关键瓶颈,为药物研发中的多任务学习与少样本场景提供了数据支撑。它解决了分子性质预测中数据稀疏性导致的模型过拟合问题,并支持虚拟筛选与药代动力学建模等复杂学术课题。通过融合多源异构数据,该数据集推动了多模态分子理解的理论发展,显著提升了AI模型在药物-靶标相互作用预测中的鲁棒性与可解释性,对加速候选药物发现具有深远学术影响。
实际应用
在实际药物研发流程中,M³-20M数据集可赋能虚拟筛选系统,通过多模态特征融合快速识别高活性先导化合物,降低实验试错成本。它还能用于构建智能药代动力学预测工具,辅助评估候选分子的吸收、分布、代谢与排泄特性。此外,该数据集支持生成式AI模型定向设计具有目标理化性质的新分子,应用于苗头化合物发现与结构优化,从而缩短新药从研发到临床的周期,提升制药工业的研发效率。
数据集最近研究
最新研究方向
在人工智能驱动的药物设计与发现领域,多模态分子数据的整合正成为突破传统计算瓶颈的关键路径。M³-20M数据集以其超过2000万分子的大规模覆盖和包含SMILES序列、二维分子图、三维结构、理化性质及文本描述的全方位模态信息,为训练和微调大型生成模型提供了前所未有的数据基础。当前前沿研究聚焦于利用该数据集实现更精准的分子性质预测、高效先导化合物优化以及药物-靶标相互作用建模,尤其在大语言模型与分子表征学习深度融合的交叉方向上展现出巨大潜力。该数据集的发布不仅显著提升了现有模型在分子生成和虚拟筛选任务中的泛化能力,也为探索分子结构与功能之间的复杂语义关联开辟了新途径,对加速创新药物研发进程具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务