遇见数据集

E-coli

收藏
Hugging Face2026-06-01 更新2026-06-02 收录
官方服务:

资源简介:

E. Coli数据集是TopRepo自上而下谱图库的一部分,专注于大肠杆菌物种的质谱分析数据。该数据集通过标准化的蛋白质组学数据处理流程生成:原始质谱文件首先转换为centroided mzML格式,随后使用TopFD进行去卷积处理,生成msalign文件和蛋白形态特征文件,最后通过TopPIC对谱图进行鉴定。数据集包含三个核心组成部分:1)元数据表(toprepo_e_coli_meta_table_v1.2.0.tsv),提供实验级别的元信息,包括数据集标识符、物种分类、仪器参数、解离方法以及谱图、蛋白质和蛋白形态的数量统计;2)谱图表(toprepo_e_coli_spectrum_table_ms2_v1.2.0.tsv),包含谱图级别的MS/MS分析数据,涵盖扫描标识符、前体离子信息、碎片化测量值、蛋白形态注释、蛋白质鉴定结果和统计置信度指标;3)注释的.msalign文件。该数据集适用于蛋白质组学研究、质谱数据分析算法开发、蛋白质鉴定方法评估等生物信息学任务,为研究人员提供了经过系统处理的、包含丰富注释信息的质谱数据集。

The E. coli Dataset is a component of the TopRepo top-down spectral library, focusing on mass spectrometry data for the Escherichia coli species. This dataset is generated through a standardized proteomics data processing workflow: raw mass spectrometry files are first converted to centroided mzML format, then undergo deconvolution processing using TopFD to generate msalign files and protein isoform feature files, and finally undergo spectrum identification via TopPIC. The dataset consists of three core components: 1) Metadata table (toprepo_e_coli_meta_table_v1.2.0.tsv), which provides experiment-level metadata including dataset identifier, species classification, instrument parameters, dissociation method, and statistical counts of spectra, proteins and protein isoforms; 2) Spectrum table (toprepo_e_coli_spectrum_table_ms2_v1.2.0.tsv), which contains spectrum-level MS/MS analysis data covering scan identifiers, precursor ion information, fragmentation measurements, protein isoform annotations, protein identification results and statistical confidence metrics; 3) Annotated .msalign files. This dataset is suitable for bioinformatics tasks such as proteomics research, mass spectrometry data analysis algorithm development, and protein identification method evaluation, providing researchers with a systematically processed mass spectrometry dataset rich in annotation information.

创建时间:
2026-05-29
原始信息汇总

数据集概述:E. Coli Dataset

该数据集是 TopRepo 项目的一部分,是一个自上而下的质谱谱图库,包含超过1200万条MS/MS谱图,覆盖12个物种。本数据集专门针对 大肠杆菌(Escherichia coli) 构建,提供完整的自上而下蛋白质组学分析结果。

数据集内容与格式

数据集包含两个主要的TSV文件和一个注释后的msalign文件:

  1. 元数据表(Metadata Table)

    • 文件名:toprepo_e_coli_meta_table_v1.2.0.tsv
    • 包含实验级别的元数据信息:
      • 数据集标识符
      • 物种信息
      • 仪器信息
      • 解离方法
      • 谱图、蛋白质和蛋白型(proteoforms)的数量统计
  2. 谱图表(Spectrum Table)

    • 文件名:toprepo_e_coli_spectrum_table_ms2_v1.2.0.tsv
    • 包含谱图级别的MS/MS分析数据:
      • 扫描标识符
      • 前体离子信息
      • 碎裂测量数据
      • 蛋白型注释
      • 蛋白质鉴定结果
      • 统计置信度指标
  3. 注释后的msalign文件

    • 提供谱图水平的详细注释信息。

数据处理流程

每个MS原始文件经以下步骤处理生成最终数据:

  • 使用 msconvert 将原始文件转换为质心化的mzML文件
  • 使用 TopFD 对mzML文件进行解卷积,生成一个或多个msalign文件及蛋白型特征文件
  • 使用 TopPIC 搜索对应蛋白质组序列数据库,进行谱图鉴定
  • 鉴定结果存储为TSV文件
  • 通过Python脚本生成综合谱图信息、注释后的msalign文件和mgf文件

相关资源

  • 数据仓库:https://toprepo.org/
  • 研究论文:https://www.biorxiv.org/content/10.64898/2026.02.20.707032v1
  • 代码仓库:https://github.com/toppic-suite/toprepo

许可与联系

  • 许可证:Apache-2.0
  • 联系方式:xwliu@tulane.edu 或 kli7@tulane.edu
  • 版权:2025 - 2026, Tulane University
搜集汇总
数据集介绍
E-coli 数据集图片
构建方式
E-coli数据集源自TopRepo自上而下蛋白质组学谱库,收录了大肠杆菌物种的超过1200万张串联质谱(MS/MS)谱图。其构建流程严谨:首先利用msconvert将原始质谱文件转换为质心化的mzML格式,随后借助TopFD对谱图进行去卷积处理,生成msalign文件与蛋白质形态特征文件。最后,通过TopPIC搜索引擎将msalign文件与对应蛋白质组序列数据库比对,实现谱图鉴定,结果以TSV格式存储。基于上述中间文件,Python脚本进一步整合生成包含全面谱图信息的TSV文件、注释后的msalign文件及mgf文件,形成结构化、可复用的数据集。
特点
该数据集以双表结构呈现:元数据表(toprepo_e_coli_meta_table_v1.2.0.tsv)涵盖实验级别标识符、物种信息、仪器参数、解离方法及谱图、蛋白质、蛋白质形态计数;谱图表(toprepo_e_coli_spectrum_table_ms2_v1.2.0.tsv)则聚焦于谱图级别,包含扫描标识、前体离子信息、碎片测量值、蛋白质形态注释、蛋白质鉴定结果及统计置信度指标。此外,数据集还提供注释后的msalign文件,为蛋白质组学深层解析提供丰富且标准化的数据资源。
使用方法
用户可直接加载TSV元数据表与谱图表,利用其结构化字段进行实验条件筛选、鉴定结果统计或机器学习模型训练。注释后的msalign文件适用于TopPIC等专用软件开展蛋白质形态从头测序或同源性搜索。mgf文件兼容主流质谱分析工具(如Mascot、MaxQuant),便于跨平台比对。通过GitHub仓库(github.com/toppic-suite/toprepo)中的Python脚本,用户可重现数据生成流程或自定义下游分析,实现从原始谱图到生物学解释的全链路探索。
背景与挑战
背景概述
蛋白质组学作为后基因组时代的关键研究领域,致力于解析生物体内蛋白质的全貌及其动态变化。自上而下(top-down)质谱技术的兴起,为直接分析完整蛋白质形式(proteoforms)提供了强大的工具,然而其数据分析的复杂性仍然对计算方法和高质量参考数据集的构建提出了严苛的挑战。在此背景下,由杜兰大学刘向前(xwliu@tulane.edu)和李凯(kli7@tulane.edu)团队于2025年至2026年间打造的TopRepo项目应运而生,它是一个涵盖12个物种、超过1200万条串联质谱(MS/MS)谱图的自上而下谱图存储库。E-coli数据集作为TopRepo的子集,专门聚焦于模式生物大肠杆菌(Escherichia coli),为自上而下蛋白质组学中的蛋白质鉴定、蛋白质形式注释及统计分析提供了标准化的数据基准。该数据集通过系统的流程处理(msconvert转换、TopFD解卷积、TopPIC搜索)生成,并收录了实验元数据与谱图级分析数据,在提升蛋白质组学数据可重复性与促进算法开发方面具有重要影响力。
当前挑战
E-coli数据集构建与应用的核心挑战可归纳为两个方面。在领域问题层面,自上而下质谱数据分析需解决完整蛋白质形式的高复杂度解析难题,包括前体离子电荷状态不确定、多同位素峰的准确分配以及翻译后修饰的精准定位;传统数据库搜索策略往往难以有效处理这些信息,导致鉴定假阳性率高。在构建过程层面,原始质谱数据需经过多个计算步骤(从原始文件转换到谱图去卷积、再到数据库搜索)的串联处理,每一步的误差会累积放大,例如去卷积或e-value估计的参数选择可能直接影响最终鉴定结果;此外,涵盖12个物种的庞大数据体量对存储与索引效率提出了挑战,而确保不同仪器平台(不同解离方式)下元数据的完整性与可比性,亦是构建过程不得不面对的难题。
常用场景
经典使用场景
E-coli数据集作为TopRepo项目中一个关键组件,专为自上而下蛋白质组学(Top-Down Proteomics)研究设计。该数据集收录了大肠杆菌(Escherichia coli)样本的超过12百万个MS/MS谱图,并提供了从原始质谱数据到谱图注释、蛋白质与蛋白形式(proteoform)鉴定的全流程分析结果。研究人员利用此数据集进行质谱数据分析流程验证、谱图匹配算法评估以及蛋白形式识别精度的基准测试。其结构化元数据表和谱图表,包含实验条件、仪器参数、碎裂方式及统计置信度指标,使其成为开发与优化自上而下蛋白质组学数据解析管线的理想测试集。
解决学术问题
该数据集解决了自上而下蛋白质组学领域中长期存在的关键学术问题,即如何从复杂质谱数据中精确识别蛋白形式并评估其统计显著性。传统自下而上方法难以捕捉蛋白质的完整翻译后修饰组合,而E-coli数据集通过提供注释完整的msalign文件和置信度指标,为验证蛋白形式鉴定算法、探索碎裂机制以及开发统计模型提供了标准化参考。其发布填补了公开可用的大规模自上而下谱图库空白,推动了蛋白质组学从肽段层面走向完整蛋白质层面的研究范式转变,对理解蛋白质功能调控具有深远意义。
衍生相关工作
基于E-coli数据集衍生出一系列重要工作,包括TopPIC谱图识别算法的持续优化和TopFD解卷积工具的改进。研究者利用该数据集验证了多种新型碎裂技术(如EThcD和UVPD)在蛋白形式结构解析中的效果。在计算生物学领域,该数据集催生了针对大规模谱图库的高效搜索算法和基于深度神经网络的谱图预测模型。此外,该数据集作为TopRepo多物种谱图库的代表成员,推动了跨物种蛋白形式注释比较研究,为进化蛋白质组学提供了数据基础,并促进了开源质谱数据分析平台(如OpenMS)的集成与标准化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务