~500k MS2 spectra with 70k SMILES, InChIKey, NPC & ClassyFire annotations
收藏资源简介:
This dataset is a zstd-compressed MGF containing a harmonized subset of GNPS public library and MassSpecGym MS/MS spectra. Each spectrum includes: - RDKit tautomer-canonical `SMILES`- RDKit-derived `INCHIKEY`- `FORMULA` derived from the canonical SMILES using `smiles-parser`- NPClassifier.rs Faithful CUDA f32 predictions at pathway, superclass, and class levels- ClassyFire/ChemOnt labels, including hierarchy path and direct parent- Source provenance fields for GNPS or MassSpecGym Filtering applied: - Removed spectra without usable SMILES- Removed spectra with zero precursor m/z or zero charge- Kept spectra with at least 3 peaks- Retained at most the top 60 peaks per spectrum before SPLASH collision handling- Removed all spectra involved in duplicate or conflicting post-top60 SPLASH groups- Kept only spectra with all three NPC layers populated and usable ChemOnt labels Final contents: - Spectra: 522,678- Unique canonical SMILES: 48,689- Unique NPC labels: 595- Unique ChemOnt labels: 1,942
本数据集为经zstd压缩的MGF格式文件,包含GNPS公共质谱库与MassSpecGym的MS/MS质谱谱图的标准化子集。 每条质谱谱图涵盖以下信息: - 基于RDKit互变异构体归一化的`SMILES`、RDKit生成的`INCHIKEY`; - 通过`smiles-parser`从归一化SMILES推导得到的`FORMULA`; - NPClassifier.rs在通路、超类及类层级上的保真CUDA f32预测结果; - ClassyFire/ChemOnt标签,包含层级路径与直接父类信息; - 用于溯源GNPS或MassSpecGym来源的字段。 本次数据集应用的过滤规则如下: - 剔除未包含可用SMILES的谱图; - 剔除前体质荷比(m/z)为0或电荷数为0的谱图; - 保留至少包含3个峰的谱图; - 在进行SPLASH碰撞处理前,每条谱图仅保留强度排名前60的峰; - 剔除所有在完成前60峰筛选后,属于重复或冲突SPLASH分组的谱图; - 仅保留覆盖全部三层NPC分类且带有可用ChemOnt标签的谱图。 数据集最终包含: - 质谱谱图:522,678条 - 唯一归一化SMILES:48,689个 - 唯一NPC标签:595个 - 唯一ChemOnt标签:1,942个



