G-max
收藏资源简介:
G. Max数据集是TopRepo自上而下光谱库的一部分,专注于Glycine max(大豆)物种的蛋白质组学研究。该数据集源于大规模质谱分析,旨在为蛋白质鉴定和表征提供高质量的光谱数据资源。数据集核心包含两个结构化TSV文件:元数据表记录了实验级别的信息,包括数据集标识、物种详情、仪器配置、解离方法以及光谱、蛋白质和蛋白质形式的统计数量;光谱表则提供了光谱级别的详细MS/MS分析数据,涵盖扫描ID、前体离子特征、碎片化测量值、经过鉴定的蛋白质形式注释、对应的蛋白质标识以及相关的统计置信度指标。此外,数据集还提供了经过注释的.msalign文件。这些数据是通过一套标准化的蛋白质组学数据分析流程生成的,涉及原始质谱文件的格式转换、光谱去卷积、以及针对特定物种蛋白质序列数据库的搜索鉴定。该数据集适用于计算蛋白质组学、质谱数据分析算法开发、蛋白质鉴定验证以及生物信息学工具测试等任务。
The G. Max dataset is part of the TopRepo top-down spectral library, focusing on proteomics research for the species Glycine max (soybean). It originates from large-scale mass spectrometry analysis and aims to provide high-quality spectral data resources for protein identification and characterization. The dataset core includes two structured TSV files: the metadata table records experimental-level information, including dataset identifiers, species details, instrument configurations, dissociation methods, and statistical counts of spectra, proteins, and protein forms; the spectral table provides detailed MS/MS analysis data at the spectral level, covering scan IDs, precursor ion features, fragmentation measurements, annotated protein form identifications, corresponding protein identifiers, and related statistical confidence metrics. Additionally, the dataset provides annotated .msalign files. These data are generated through a standardized proteomics data analysis pipeline, involving raw mass spectrometry file format conversion, spectral deconvolution, and search identification against a species-specific protein sequence database. The dataset is suitable for tasks such as computational proteomics, mass spectrometry data analysis algorithm development, protein identification validation, and bioinformatics tool testing.
数据集概述
- 名称:G. Max Dataset
- 语言:英文
- 标签:蛋白质组学、生物信息学、质谱、LC-MS、光谱库、蛋白质、蛋白质鉴定
- 许可协议:Apache-2.0
数据集来源
- 仓库:https://toprepo.org/
- 论文:https://www.biorxiv.org/content/10.64898/2026.02.20.707032v1
- GitHub:https://github.com/toppic-suite/toprepo
数据集描述
TopRepo是一个自上而下的光谱数据库,包含来自12个物种的超过1200万条MS/MS谱图。对于TopRepo中的每个MS原始文件,使用msconvert将其转换为质心mzML文件,再通过TopFD对质心mzML文件中的谱图进行解卷积,生成一个或多个msalign文件及蛋白质形式特征文件。随后使用TopPIC将msalign文件与对应的蛋白质组序列数据库进行匹配,以进行光谱鉴定,鉴定结果存储在TSV文件中。
基于数据分析流程生成的mzML文件、msalign文件、特征文件和光谱鉴定(TSV)文件,本仓库中的Python脚本用于生成包含全面光谱信息的TSV文件、带注释的msalign文件以及带注释的mgf文件。
数据集结构
该数据集包含针对大豆(Glycine max)物种的两个TSV文件,以及带注释的msalign文件:
-
元数据表(
toprepo_g_max_meta_table_v1.2.0.tsv)
包含实验级别的元数据:- 数据集标识符
- 物种信息
- 仪器元数据
- 解离方法
- 光谱、蛋白质和蛋白质形式的计数
-
光谱表(
toprepo_g_max_spectrum_table_ms2_v1.2.0.tsv)
包含光谱级别的MS/MS分析数据:- 扫描标识符
- 前体离子信息
- 碎裂测量结果
- 蛋白质形式注释
- 蛋白质鉴定信息
- 统计置信度指标
-
带注释的.msalign文件
联系方式
如有问题,可通过以下邮箱联系TopRepo团队:
- xwliu@tulane.edu
- kli7@tulane.edu
版权归Tulane University所有(2025-2026)。




