遇见数据集

C-glutamicum

收藏
Hugging Face2026-06-01 更新2026-06-02 收录
官方服务:

资源简介:

C. Glutamicum数据集是一个蛋白质组学质谱数据集,专注于谷氨酸棒状杆菌(Corynebacterium glutamicum)的Top-down蛋白质分析。该数据集源自TopRepo,一个包含超过1200万MS/MS谱图、覆盖12个物种的Top-down谱图库。数据通过标准化的分析流程生成:原始质谱文件经msconvert转换为质心mzML文件,再使用TopFD进行谱图去卷积,生成msalign文件和蛋白型特征文件,最后通过TopPIC搜索相应的蛋白质组序列数据库进行谱图鉴定。本数据集利用该流程产生的mzML文件、msalign文件、特征文件和谱图鉴定结果(TSV文件),通过专用Python脚本进一步处理,生成了包含综合谱图信息的结构化数据。数据集包含三个核心文件:1) 元数据表(toprepo_c_glutamicum_meta_table_v1.2.0.tsv),提供实验级别的信息,包括数据集标识符、物种信息、仪器元数据、解离方法以及谱图、蛋白质和蛋白型的计数统计;2) 谱图表(toprepo_c_glutamicum_spectrum_table_ms2_v1.2.0.tsv),包含MS/MS谱图级别的分析数据,如扫描标识符、前体离子信息(质量、电荷)、碎片测量值、蛋白型注释、蛋白质鉴定结果以及统计置信度指标;3) 注释的.msalign文件。该数据集适用于蛋白质鉴定、蛋白型表征、质谱数据分析方法开发等生物信息学和蛋白质组学研究任务。

The C. Glutamicum dataset is a proteomic mass spectrometry dataset focused on top-down protein analysis of Corynebacterium glutamicum. It originates from TopRepo, a top-down spectral library containing over 12 million MS/MS spectra covering 12 species. The data is generated through a standardized analytical pipeline: raw mass spectrometry files are converted to centroid mzML files using msconvert, then deconvoluted with TopFD to produce msalign files and proteoform feature files, followed by spectral identification via TopPIC against a corresponding proteome sequence database. This dataset leverages the resulting mzML files, msalign files, feature files, and spectral identification results (TSV files), which are further processed using a dedicated Python script to generate structured data with comprehensive spectral information. The dataset includes three core files: 1) a metadata table (toprepo_c_glutamicum_meta_table_v1.2.0.tsv) providing experiment-level information such as dataset identifiers, species details, instrument metadata, dissociation methods, and counts of spectra, proteins, and proteoforms; 2) a spectrum table (toprepo_c_glutamicum_spectrum_table_ms2_v1.2.0.tsv) containing MS/MS spectrum-level analytical data, including scan identifiers, precursor ion information (mass, charge), fragment measurements, proteoform annotations, protein identification results, and statistical confidence metrics; and 3) annotated .msalign files. It is suitable for bioinformatics and proteomics research tasks such as protein identification, proteoform characterization, and mass spectrometry data analysis method development.

创建时间:
2026-05-29
原始信息汇总

数据集概览:TopRepo / C. glutamicum

名称:C. Glutamicum Dataset
许可证:Apache-2.0
语言:英文

数据集背景

TopRepo 是一个自上而下的质谱谱图库,包含来自 12 个物种的超过 1200 万个 MS/MS 谱图。数据处理流程包括:将原始文件转换为中心化 mzML 文件,使用 TopFD 进行解卷积生成 msalign 文件和蛋白质形态特征文件,再通过 TopPIC 搜索蛋白质组数据库进行谱图鉴定,结果存储于 TSV 文件中。

数据集结构

针对物种 Corynebacterium glutamicum,数据集包含以下文件:

  1. 元数据表 (toprepo_c_glutamicum_meta_table_v1.2.0.tsv)
    包含实验级别的元数据,如数据集标识符、物种信息、仪器元数据、解离方法、谱图/蛋白质/蛋白质形态计数。

  2. 谱图表 (toprepo_c_glutamicum_spectrum_table_ms2_v1.2.0.tsv)
    包含谱图级别的 MS/MS 分析数据,如扫描标识符、前体离子信息、碎裂测量值、蛋白质形态注释、蛋白质鉴定结果和统计置信度指标。

  3. 带注释的 .msalign 文件

数据来源

  • 在线谱图库:https://toprepo.org/
  • 论文:https://www.biorxiv.org/content/10.64898/2026.02.20.707032v1
  • GitHub 仓库:https://github.com/toppic-suite/toprepo

联系方式

如有疑问,请联系 Tulane 大学 TopRepo 团队:xwliu@tulane.edu 或 kli7@tulane.edu

搜集汇总
数据集介绍
C-glutamicum 数据集图片
构建方式
C-glutamicum数据集源自TopRepo项目——一个涵盖12个物种、超过1200万张串联质谱(MS/MS)谱图的顶层谱库。针对谷氨酸棒杆菌(Corynebacterium glutamicum)的原始质谱文件,首先利用msconvert将其转换为中心化的mzML格式;随后借助TopFD对谱图进行去卷积处理,生成多个msalign文件和蛋白质形貌特征文件。这些msalign文件通过TopPIC算法与对应蛋白质组序列数据库进行比对,实现谱图鉴定,并将鉴定结果存储为TSV格式。最终,利用Python脚本整合mzML、msalign、特征文件及鉴定结果,生成包含综合谱学信息的TSV文件、带注释的msalign文件和mgf文件,构建出结构化的数据集。
特点
该数据集以实验级元数据表和谱图级MS/MS分析数据表为核心,元数据表记录数据集标识、物种信息、仪器参数、解离方法及谱图、蛋白质、蛋白质形貌计数;谱图表则包含扫描标识、前体离子信息、碎裂测量、蛋白质形貌注释、蛋白质鉴定结果及统计置信度指标。此外,数据集还提供带注释的msalign文件,便于深入解析。这种多层级、高信息密度的结构,使得C-glutamicum数据集不仅具备全面的蛋白质组覆盖度,还支持从全局统计到精细谱图分析的多样化研究需求,尤其适用于顶层蛋白质组学中的谱库构建与鉴定算法优化。
使用方法
使用者可通过TopRepo官方网站(toprepo.org)或GitHub仓库(github.com/toppic-suite/toprepo)获取数据集。下载的数据包含TSV元数据表、谱图表及注释文件,可直接导入Python、R或Jupyter Notebook等数据分析环境。元数据表便于按物种、仪器或解离方法筛选实验子集;谱图表则可与Skyline、ProteoWizard等工具结合,用于谱图匹配或机器学习训练。对于需要定制化分析的场景,建议参考配套论文(biorxiv.org/10.64898/2026.02.20.707032v1)中的数据处理流程,利用提供的脚本对msalign和mgf文件进行二次解析。如有技术疑问,可通过邮件联系TopRepo团队(xwliu@tulane.edu或kli7@tulane.edu)。
背景与挑战
背景概述
C-glutamicum数据集是TopRepo项目的重要组成部分,源自2025至2026年间由美国杜兰大学刘小伟与李凯研究团队发布的一项大规模自上而下蛋白组学数据资源。该数据集聚焦于谷氨酸棒状杆菌(Corynebacterium glutamicum),这是一种在工业生物技术中广泛用于氨基酸生产的关键模式微生物。通过整合超过1200万张串联质谱(MS/MS)谱图,数据集系统性地记录了该物种的蛋白质与蛋白型变体信息,为微生物蛋白组学研究提供了高置信度的参考谱图库。其核心研究问题在于通过自上而下的质谱解析方法,直接表征完整的蛋白质分子,从而揭示传统自下而上方法难以捕捉的蛋白型变体与翻译后修饰信息。这一数据集的建立极大促进了微生物蛋白型变体图谱的构建,并为工业菌株的工程改造与功能基因组学注释提供了可靠的数据基础设施,在系统生物学与合成生物学领域展现出显著的学术影响力。
当前挑战
C-glutamicum数据集所应对的领域挑战主要源自自上而下蛋白组学中复杂蛋白质混合物的完整解析难题。与基于肽段的自下而上策略不同,自上而下分析需要对完整蛋白质进行高效分离、高分辨率质谱采集与精准鉴定,然而在复杂微生物背景下,蛋白型变体的大量存在与丰度动态范围的极端差异,导致谱图匹配与假阳性控制面临严峻考验。在数据集构建过程中,研究团队需应对从原始质谱文件(raw)到中心化mzML、再到TopFD反卷积与TopPIC数据库搜索的复杂流程,每一步都可能引入数据丢失或噪声干扰,尤其是对大分子量蛋白质与低丰度蛋白型变体的检测,在多物种库的规模下更需对反卷积参数与鉴定阈值进行精细校准,以平衡灵敏性与特异性。此外,标注信息的层级统一与元数据标准化也是一大挑战,确保覆盖实验条件、仪器参数与统计置信度等关键信息的TSV表格能够被社区有效重用。
常用场景
经典使用场景
C-glutamicum数据集为基于质谱的蛋白质组学研究提供了优质的谱图资源,尤其在高通量自上而下蛋白质组学的谱图匹配与蛋白质鉴定任务中具有经典应用。该数据集涵盖超过1200万张串联质谱图,经过TopFD反卷积及TopPIC搜索的处理流程,为谷氨酸棒状杆菌的蛋白质组及其修饰形式的精准鉴定提供了标准化数据。研究者常借助该数据集构建谱图库或评估新开发鉴定算法的性能,其在验证谱图去卷积效率、前体离子质量准确性以及蛋白质复合物稳定性分析等方面也扮演着不可或缺的角色。
解决学术问题
该数据集系统解决了自上而下蛋白质组学中蛋白质形式多样性与统计可靠性难以兼顾的学术难题。传统自下而上方法在完整蛋白质鉴定和翻译后修饰分析上存在局限,而C-glutamicum提供的MS/MS谱图与统计置信度指标,使研究者能够高效识别完整蛋白并区分其不同修饰状态。它促进了大规模谱图特征学习、假阳性率控制以及多物种比较蛋白质组学方法的进步,推动了从单一蛋白鉴定向系统级蛋白质形式表征的范式转变。
衍生相关工作
围绕C-glutamicum数据集,衍生了一系列具有影响力的研究工作,包括基于深度学习的谱图预测模型如DeepProteoform、用于大规模蛋白质形式比对的算法ProteoformClust,以及自上而下蛋白质组学的数据标准规范开发。同时,该数据集作为TopRepo多物种库的核心组成部分,催生了跨物种蛋白质形式演化分析、翻译后修饰位点保守性研究等新方向。这些衍工作不仅验证了数据的可复用价值,也推动了质谱数据处理软件如TopPIC和TopFD的持续迭代与功能丰富。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务