遇见数据集

MassSpecGym

收藏
arXiv2025-09-30 收录
官方服务:

资源简介:

该数据集是迄今为止最大的公开标记质谱数据集,它汇集了来自多个公共参考光谱数据库的资源。此外,该数据集还提供了一个基于最大公共边缘子结构(MCES)的建议分割方式,以便对模型进行评估。在三个数据集中,它的规模是最大的。该数据集的任务是对分子生成模型进行基准测试和评估。

This dataset is the largest publicly labeled mass spectrometry dataset to date, aggregating resources from multiple public reference spectral databases. Furthermore, it provides a proposed data splitting strategy based on the Maximum Common Edge Substructure (MCES) to support model evaluation. It is the largest in scale among the three datasets. The core task of this dataset is to benchmark and evaluate molecular generative models.

搜集汇总
数据集介绍
MassSpecGym 数据集图片
构建方式
在生物与化学样品中实现分子的发现与鉴定,是推动生物医学与化学科学进步的关键环节。串联质谱法作为高通量解析分子结构的主流技术,其产生的海量数据却因缺乏标准化基准而难以被充分挖掘。MassSpecGym数据集的构建正是为了填补这一空白。研究团队从MoNA、MassBank、GNPS等最大规模的公开质谱库以及自有的MSnLib内部数据中,系统性地收集了串联质谱数据。随后,应用matchms工具包执行了一套严格的过滤与清洗流程,包括去除噪声信号、标准化元数据、剔除质量存疑的图谱,并通过SIRIUS软件确保超过50%的信号强度可被分子式分解所解释。最终,该数据集汇集了231,104张高质量质谱图,对应29,000种独特的分子结构,成为当前规模最大的公开标注质谱数据集。
特点
MassSpecGym数据集的核心特点在于其卓越的标准化程度与严格的数据划分策略。不同于以往数据集的异构与杂乱,该数据集对所有图谱进行了相对强度归一化,并统一了电离加合物、仪器类型与碰撞能量等关键元数据,确保数据的高度可比性。尤为突出的是,其采用基于最大公共边子图距离的凝聚聚类方法进行数据划分,确保训练集与测试集之间任意分子的边编辑距离不小于10,从而彻底避免了因结构相似性导致的数据泄露问题。此外,数据集涵盖了丰富的化学类别与分子质量范围,并提供了三个定义清晰的基准任务:从头分子结构生成、分子检索与质谱模拟,为模型评估提供了多维度的标准化框架。
使用方法
MassSpecGym旨在降低质谱数据应用的门槛,使机器学习研究者无需深厚的质谱学背景即可开展研究。数据集通过Hugging Face平台发布,并基于PyTorch Lightning构建了用户友好的接口。使用者可轻松加载预定义的数据划分,利用提供的基线模型或自定义模型完成前向传播。每个基准任务均配套了标准化评估指标:从头生成任务采用Top-k准确率、MCES距离与Tanimoto相似度;分子检索任务基于命中率与MCES距离进行评估;质谱模拟任务则通过余弦相似度衡量预测谱图与真实谱图的一致性。研究结果可通过Papers With Code排行榜进行提交与比较,从而促进可复现的研究与方法的持续迭代。
背景与挑战
背景概述
在生物与环境样本中,分子的发现与鉴定是推动生物医学与化学科学进步的核心驱动力。串联质谱(MS/MS)作为高通量解析分子结构的主流技术,在药物研发、疾病诊断及环境监测等领域发挥着不可替代的作用。然而,从质谱数据中准确解码分子结构即便对于人类专家而言也极具挑战性,导致绝大多数获取的MS/MS谱图未能被有效解读,严重制约了我们对潜在(生物)化学过程的理解。为应对这一困境,由捷克科学院、捷克理工大学、瓦赫宁根大学及多伦多大学等国际顶尖机构的科研人员于2024年共同创建了MassSpecGym数据集。该数据集旨在解决该领域长期缺乏标准化数据集与评估协议的核心问题,作为首个针对MS/MS数据分子发现与鉴定的综合基准,它整合了公开可用的最大规模高质量标记谱图集合,涵盖23.1万张谱图及2.9万个独特分子结构,为机器学习社区提供了统一的研究平台。
当前挑战
MassSpecGym所面临的挑战具有双重性。首先,在领域问题层面,从MS/MS谱图中进行分子结构解析是一个极具难度的逆问题:谱图仅提供碎片离子的质荷比与丰度信息,而分子结构空间呈组合爆炸特性,且不同仪器参数、电离加合物及碰撞能量导致的谱图异质性使得有效学习异常困难;当前最先进方法在典型样本中仅能注释不到10%的谱图,大量天然化学空间仍处于未探索状态。其次,在数据集构建过程中,团队遭遇了多重技术壁垒:来自GNPS、MassBank等公共仓库的原始数据存在大量噪声、缺失元数据及错误标注,需通过复杂的匹配与过滤流程剔除低质量谱图;不同来源的数据在仪器类型、碰撞能量标准化及分子结构表示上缺乏一致性;此外,传统基于二维InChIKey的数据划分方法会导致严重的数据泄露,需要创新性地基于分子编辑距离(MCES)开发泛化要求更高的分割策略,以确保评估的公正性与模型的真实泛化能力。
常用场景
经典使用场景
在计算质谱学领域,从串联质谱(MS/MS)数据中解析分子结构是一项长期存在的核心挑战。MassSpecGym 作为首个综合性基准数据集,其经典使用场景聚焦于三大核心任务:从头分子结构生成、分子检索以及谱图模拟。从头生成任务要求模型仅凭质谱数据直接预测分子的二维图结构,类似于蛋白质结构预测中的 AlphaFold 范式;分子检索任务则模拟在实际数据库中对已知化合物的匹配与筛选;谱图模拟则作为逆问题,从分子图出发预测其碎裂谱图。这些场景共同构成了一个标准化、可复现的评估框架,为机器学习模型在质谱解析中的性能提供了统一的度量标准。
衍生相关工作
MassSpecGym 的发布催生了一系列具有深远影响的衍生研究工作。在基准模型方面,MIST(基于化学公式变换器的谱图注释方法)与 FraGNNet(基于图神经网络的概率碎裂模型)在该数据集上得到了系统评估与优化,揭示了当前方法的性能边界与改进空间。在方法论层面,基于该基准发展出的 DeepSets 与傅里叶特征增强架构,为处理非结构化质谱数据提供了新的建模思路。此外,该数据集还推动了自监督学习(如 GeMS-A10 的大规模预训练)与生成式模型(如扩散模型用于分子图生成)在质谱领域的探索,为跨学科协作构建了桥梁,促进了质谱专家与人工智能研究者之间的知识融合与技术创新。
数据集最近研究
最新研究方向
在计算代谢组学与机器学习交叉领域,MassSpecGym的发布标志着质谱数据标准化基准的里程碑式突破。该数据集聚焦于串联质谱(MS/MS)图谱中分子结构与光谱信号的映射关系,开创性地定义了三大前沿挑战:从头分子结构生成、分子检索与光谱模拟。通过构建包含23万张高质量标注光谱及2.9万种独特分子结构的最大公开数据集,并引入基于分子编辑距离的泛化性数据划分策略,MassSpecGym有效解决了传统数据泄露问题。当前,该基准正推动深度学习模型在未知代谢物鉴定、天然产物发现及环境污染物追踪等热点方向取得突破,其提供的标准化评估协议为克服质谱领域长期存在的模型复现性差、数据异质性高等瓶颈提供了关键基础设施,有望加速算法创新与生物医学应用转化。
相关研究论文
  • 1
    MassSpecGym: A benchmark for the discovery and identification of molecules捷克科学院有机化学与生物化学研究所, 捷克技术大学信息学、机器人与网络研究所, 瓦赫宁根大学与研究中心生物信息学组, 多伦多大学计算机科学系, 耶拿弗里德里希·席勒大学计算机科学研究所生物信息学主席, 安特卫普大学计算机科学系, 阿尔伯塔大学计算机科学系, 阿尔伯塔机器智能研究所, 多伦多大学分子遗传学系, Bright Giant GmbH, 塔夫茨大学计算机科学系, 阿尔伯塔大学生物科学系, 阿尔托大学计算机科学系, 国家标准与技术研究院质谱数据中心, 塔夫茨大学化学与生物工程系, 杜塞尔多夫应用科学大学数字化与数字中心, 约翰内斯堡大学生物化学系, 瑞士联邦水科学与技术研究所 · 2024年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务