遇见数据集

M-mazei

收藏
Hugging Face2026-06-01 更新2026-06-02 收录
官方服务:

资源简介:

本数据集是TopRepo(一个自上而下质谱谱图库)中关于物种Methanosarcina mazei的子集。TopRepo包含来自12个物种的超过1200万张MS/MS谱图。数据生成遵循标准流程:原始质谱文件通过msconvert转换为质心化的mzML文件,使用TopFD进行去卷积生成msalign文件和特征文件,然后通过TopPIC与蛋白质组序列数据库比对完成谱图鉴定,结果存储在TSV文件中。利用Python脚本进一步处理这些文件,生成包含全面谱图信息的TSV文件、注释的msalign文件和注释的mgf文件。数据集具体包括两个TSV文件(元数据表和谱图表)和一个注释的.msalign文件,提供实验级别和谱图级别的数据,适用于蛋白质组学研究,如蛋白质鉴定、蛋白质形式分析和质谱数据分析方法开发。

This dataset is a subset targeting the species *Methanosarcina mazei* from TopRepo, a top-down mass spectral library. TopRepo contains over 12 million MS/MS spectra derived from 12 species. The data generation follows a standard workflow: raw mass spectrometry files are converted to centroided mzML files via msconvert, then deconvoluted using TopFD to generate msalign and feature files. Subsequently, spectral identification is completed by aligning against a proteome sequence database via TopPIC, with the results stored in TSV files. These files are further processed using Python scripts to generate comprehensive TSV files containing full spectral information, annotated msalign files, and annotated MGF files. This dataset specifically includes two TSV files (metadata table and spectra table) and one annotated .msalign file, which provides experimental-level and spectrum-level data, and is applicable to proteomics research such as protein identification, proteoform analysis, and the development of mass spectrometry data analysis methods.

创建时间:
2026-05-29
原始信息汇总

数据集概述

数据集名称:M. Mazei Dataset(Methanosarcina mazei 数据集)

数据集类型:自上而下(top-down)质谱谱库

数据规模:属于 TopRepo 项目的一部分,该项目包含来自 12 个物种的超过 1200 万个 MS/MS 质谱图。

许可协议:Apache-2.0

语言:英语

标签:蛋白质组学、生物信息学、质谱、液相色谱-质谱联用、谱库、蛋白质、蛋白质鉴定


数据来源与论文

  • 项目官网:https://toprepo.org/
  • 相关论文:https://www.biorxiv.org/content/10.64898/2026.02.20.707032v1
  • GitHub 仓库:https://github.com/toppic-suite/toprepo

数据处理流程

  1. 原始 MS 文件经 msconvert 转换为质心化 mzML 文件。
  2. 使用 TopFD 对质心化 mzML 文件进行解卷积,生成 msalign 文件和蛋白质形式特征文件。
  3. 使用 TopPIC 搜索 msalign 文件对应的蛋白质组序列数据库,进行谱图鉴定,结果存储为 TSV 文件。
  4. 利用 Python 脚本从 mzML、msalign、特征文件和鉴定结果(TSV)中生成综合谱图信息的 TSV 文件、注释后的 msalign 文件和注释后的 mgf 文件。

数据集结构

该数据集包含 Methanosarcina mazei 物种的以下文件:

  1. 元数据表toprepo_m_mazei_meta_table_v1.2.0.tsv

    • 包含实验层面元数据:数据集标识符、物种信息、仪器元数据、解离方法、谱图数量、蛋白质数量、蛋白质形式数量。
  2. 谱图表toprepo_m_mazei_spectrum_table_ms2_v1.2.0.tsv

    • 包含谱图层面 MS/MS 分析数据:扫描标识符、前体离子信息、碎裂测量值、蛋白质形式注释、蛋白质鉴定结果、统计置信度指标。
  3. 注释后的 msalign 文件


联系信息

  • 邮箱:xwliu@tulane.edu、kli7@tulane.edu
  • 版权:2025 - 2026, Tulane University
搜集汇总
数据集介绍
M-mazei 数据集图片
构建方式
M-mazei 数据集源自 TopRepo 顶级质谱谱图库,该库整合了来自12个物种的超过1200万张 MS/MS 谱图。针对 Methanosarcina mazei 物种,原始 MS 文件首先通过 msconvert 转换为中心化的 mzML 格式,随后利用 TopFD 软件进行解卷积处理,生成 msalign 文件与蛋白质形态特征文件。这些处理后的数据通过 TopPIC 算法与其对应蛋白质组序列数据库进行比对,实现谱图鉴定,鉴定结果以 TSV 格式存储。最终,借助 Python 脚本从 mzML、msalign、特征文件及鉴定结果中提取综合谱图信息,生成注释后的 msalign 文件和 MGF 文件,确保数据集具备完整的可溯源性与分析一致性。
特点
该数据集具有多层次、高丰度的数据特征。结构上包含元数据表与谱图表两个核心 TSV 文件:元数据表记录实验级别信息,涵盖数据集标识符、物种详情、仪器参数、解离方法以及谱图、蛋白质和蛋白质形态的计数;谱图表则聚焦于 MS/MS 分析层面的扫描标识符、前体离子信息、碎裂测量结果、蛋白质形态注释、蛋白质鉴定及统计置信度指标。此外,数据集还提供注释后的 msalign 文件,进一步丰富了下游分析的可读性和复用价值。这些属性使其特别适用于蛋白质组学中的深度鉴定与比较研究。
使用方法
用户可通过 TopRepo 官方网站(toprepo.org)直接获取该数据集的完整压缩包。下载后,TSV 元数据表与谱图表可利用常见数据处理库(如 pandas)进行解析和过滤,以提取特定实验条件下的谱图或蛋白质信息。注释后的 msalign 文件可加载至 TopPIC 或 TopFD 等工具中,进行个性化的蛋白质形态鉴定或定量分析。对于机器学习或大规模比较研究,推荐利用 Python 脚本批量读取 MGF 文件,实现谱图特征向量化或模型训练。具体使用细节与代码示例可参考 GitHub 仓库(github.com/toppic-suite/toprepo)及配套论文。
背景与挑战
背景概述
在蛋白质组学研究中,自上而下的质谱分析能够直接表征完整蛋白质及其翻译后修饰,为理解蛋白质功能与疾病机制提供关键信息。由杜兰大学刘先伟和李凯研究团队于2025年创建并持续维护的M-mazei数据集,源自TopRepo项目——一个涵盖12个物种、超过1200万张串联质谱谱图的全面存储库。该数据集聚焦于模式古菌Methanosarcina mazei,旨在通过公开标准化的质谱谱图与注释数据,推动自上而下蛋白质组学的数据共享与分析方法的开发。其影响力体现在提供了物种特异性、经过深度注释的谱图库,支持蛋白质鉴定、转录后修饰解析以及生物标志物发现等研究,填补了微生物蛋白质组学领域高质量参考数据的空白。
当前挑战
数据集所解决的领域核心挑战在于自上而下蛋白质组学中完整蛋白鉴定的复杂性,包括前体离子电荷状态高度不均、质谱谱图解析困难以及修饰位点定位的不确定性,这些问题严重制约了蛋白质组的全面表征。构建过程中面临的技术难题包括:来自不同类型质谱仪产生的数据格式转换与标准化,需将原始文件统一转换为mzML格式;谱图去卷积算法的优化,以从高分辩率数据中准确提取单同位素峰并形成msalign文件;以及大规模并行化的数据库搜索流程设计,确保对上百万谱图进行可靠的身份匹配,同时控制假阳性率。此外,多维度注释信息的整合(如保留时间、碎裂行为和统计置信度)也对数据处理管线提出了严苛要求。
常用场景
经典使用场景
作为自上而下蛋白质组学领域的重要数据资源,M-mazei数据集聚焦于模式古菌Methanosarcina mazei的质谱分析。其经典使用场景包括基于全局谱图库的蛋白质鉴定,研究者可利用该数据集中的二级质谱(MS/MS)数据,进行全蛋白或蛋白形式的精准匹配与识别。此外,该数据集常用于开发与验证谱图解卷积算法、评估不同碎裂方法对蛋白鉴定覆盖率的影响,以及构建用于跨物种蛋白质组比对的标准化参考谱库。
解决学术问题
该数据集有效解决了自上而下蛋白质组学中蛋白质形式(proteoform)大规模鉴定的技术瓶颈,尤其是针对古菌等非模式生物的高通量数据缺乏问题。通过提供超过1200万张MS/MS谱图及配套的元数据表格,它支持研究者系统性地评估谱图搜索算法(如TopPIC)的灵敏度与假阳性控制能力。其对统计置信指标(如FDR)的详细标注,进一步推动了蛋白鉴定结果标准化评估方法的发展,为比较不同实验条件下的鉴定流程奠定了数据基础。
衍生相关工作
围绕该数据集衍生了一系列重要的方法论工作。核心工具包括TopFD谱图解卷积算法和TopPIC鉴定引擎,它们构成了从原始质谱数据到蛋白形式注释的全流程分析管线。基于此,研究者进一步开发了批量处理脚本,将原始mzML文件转化为带注释的MGF格式文件,促进了跨平台数据分析的互通性。近年来,该数据集也被用于验证深度学习方法(如基于神经网络的谱图预测模型)在古菌蛋白鉴定中的适用性,推动了自上而下蛋白质组学数据分析范式的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务