遇见数据集

Zebrafish

收藏
Hugging Face2026-06-01 更新2026-06-02 收录
官方服务:

资源简介:

该数据集是TopRepo(一个自上而下质谱图库)中针对斑马鱼物种的子集。TopRepo整体包含来自12个物种的超过1200万个MS/MS质谱图。本数据集通过一套标准分析流程生成:原始质谱文件经msconvert转换为centroided mzML文件,再通过TopFD进行谱图去卷积,生成msalign文件和proteoform特征文件。随后,使用TopPIC将msalign文件与斑马鱼蛋白质组序列数据库比对,实现谱图鉴定,结果存储在TSV文件中。基于此流程,Python脚本进一步生成了包含全面谱图信息的TSV文件、注释后的msalign文件以及注释后的mgf文件。数据集核心由两个TSV文件构成:元数据表(包含实验级别元数据如数据集标识符、物种信息、仪器元数据等)和质谱图表(包含谱图级别MS/MS分析数据如扫描标识符、前体离子信息、碎片离子测量值等)。此外,数据集还包含一个注释后的.msalign文件。该数据集适用于蛋白质组学、生物信息学领域的研究,特别是基于质谱的蛋白质鉴定、蛋白质形态分析、谱图库构建及相关算法开发与验证任务。

This dataset is a subset of TopRepo (a top-down mass spectral library) for the Zebrafish species. TopRepo overall contains over 12 million MS/MS spectra from 12 species. The dataset is generated through a standard analysis pipeline: raw mass spectrometry files are converted to centroided mzML files via msconvert, then deconvoluted using TopFD to produce msalign files and proteoform feature files. Subsequently, TopPIC is used to align the msalign files with the corresponding Zebrafish proteome sequence database for spectral identification, with results stored in TSV files. Based on this pipeline, Python scripts further generate TSV files with comprehensive spectral information, annotated msalign files, and annotated mgf files. The core of the dataset consists of two TSV files: a metadata table (containing experiment-level metadata such as dataset identifiers, species information, instrument metadata, etc.) and a mass spectrum table (containing spectrum-level MS/MS analysis data such as scan identifiers, precursor ion information, fragment ion measurements, etc.). Additionally, the dataset includes an annotated .msalign file. It is suitable for research in proteomics and bioinformatics, particularly for protein identification, proteoform analysis, spectral library construction, and related algorithm development and validation based on mass spectrometry (especially top-down mass spectrometry and LC-MS).

创建时间:
2026-05-29
原始信息汇总

数据集概述

  • 数据集名称:Zebrafish Dataset (TopRepo 子集)
  • 语言:英语
  • 许可证:Apache-2.0
  • 标签:蛋白质组学、生物信息学、质谱分析、液相色谱-质谱联用、谱库、蛋白质、蛋白质鉴定
  • 来源:TopRepo,一个包含12个物种、超过1200万张串联质谱(MS/MS)光谱的顶级质谱库。

数据来源与处理流程

  1. 原始数据转换:每个质谱原始文件(.raw)通过 msconvert 转换为中心化的 mzML 文件。
  2. 谱图解卷积:使用 TopFD 将 mzML 文件中的光谱解卷积为一个或多个 msalign 文件及蛋白质形式特征文件。
  3. 谱图鉴定:使用 TopPICmsalign 文件与其对应的蛋白质组序列数据库进行比对搜索,鉴定结果存储在 TSV 文件中。
  4. 结果生成:基于上述流程产生的 mzML、msalign、特征文件和鉴定结果(TSV),通过 Python 脚本生成包含全面光谱信息的 TSV 文件、注释后的 msalign 文件以及注释后的 mgf 文件。

数据集结构

该数据集包含针对斑马鱼(Zebrafish)物种的以下文件:

  1. 元数据表 (toprepo_zebrafish_meta_table_v1.2.0.tsv):包含实验级别元数据。
    • 数据集标识符
    • 物种信息
    • 仪器元数据
    • 解离方法
    • 光谱、蛋白质和蛋白质形式的数量统计
  2. 光谱表 (toprepo_zebrafish_spectrum_table_ms2_v1.2.0.tsv):包含光谱级别(MS/MS)的分析数据。
    • 扫描标识符
    • 前体离子信息
    • 碎裂测量数据
    • 蛋白质形式注释
    • 蛋白质鉴定结果
    • 统计置信度指标
  3. 注释后的 .msalign 文件

相关资源

联系方式

  • 如有疑问,可联系 TopRepo 团队:xwliu@tulane.edu 或 kli7@tulane.edu。

版权信息

  • 版权所有 (c) 2025 - 2026, 杜兰大学 (Tulane University)。
搜集汇总
数据集介绍
Zebrafish 数据集图片
构建方式
斑马鱼数据集源自TopRepo自上而下的质谱光谱库,涵盖超过1200万张MS/MS谱图。原始质谱原始文件通过msconvert工具转化为质心化的mzML文件,随后借助TopFD算法对谱图进行去卷积处理,生成msalign文件与蛋白质形态特征文件。这些msalign文件利用TopPIC软件与对应蛋白质组序列数据库进行比对,以实现谱图鉴定,最终鉴定结果存储于TSV文件中。数据分析管线还通过Python脚本整合mzML、msalign、特征与鉴定文件,生成具有全面谱图信息的TSV表、注释后的msalign文件与MGF文件,从而构建了多层次的斑马鱼蛋白质组数据集。
特点
该数据集以实验级与谱图级双层结构组织,展现出高度的系统性与完整性。元数据表格包含数据集标识符、物种信息、仪器类型、解离方法及谱图、蛋白质和蛋白质形态的统计计数,便于宏观层面的实验信息检索。光谱表格则聚焦于MS/MS分析结果,涵盖扫描标识符、前体离子信息、碎裂测量、蛋白质形态注释、蛋白质鉴定及统计置信度指标,为深入解析蛋白质结构提供了精细的数据支撑。注释后的msalign文件进一步增强了谱图的解读能力,使数据集兼具广度和深度。
使用方法
使用该数据集时,可直接从TopRepo平台下载斑马鱼物种对应的两个TSV文件及注释msalign文件。研究人员可利用元数据表筛选特定实验条件的子集,例如根据仪器类型或解离方法进行分组分析。光谱表可用于鉴定蛋白质及蛋白质形态,通过统计置信度指标筛选高可信度的鉴定结果。注释后的msalign文件适用于更精细的谱图质量评估与定制化数据分析。建议结合TopPIC等软件工具进行深入搜索,或基于Python脚本开发自定义分析流程,以挖掘蛋白质组学领域的潜在生物学发现。
背景与挑战
背景概述
蛋白质组学作为揭示生命活动分子基础的核心领域,依赖于质谱技术实现对蛋白质及其修饰形式的全面解析。Zebrafish数据集源自TopRepo项目,由美国杜兰大学刘小伟研究团队于2025年创建,专注于斑马鱼蛋白质组的自顶向下(Top-Down)质谱分析。该数据集整合了超过1200万张串联质谱(MS/MS)谱图,通过TopFD、TopPIC等专用工具对原始数据进行去卷积、特征提取和蛋白质鉴定,构建了覆盖完整蛋白质及其翻译后修饰的谱图库。作为TopRepo多物种计划的一部分,Zebrafish数据集填补了模式生物蛋白质组资源的重要空白,为发育生物学、毒理学和疾病机制研究提供了关键的数据支撑,推动了自顶向下蛋白质组学在非模式生物中的标准化应用。
当前挑战
Zebrafish数据集主要应对自顶向下蛋白质组学中复合物鉴定率低和蛋白质异质性表征困难的领域挑战。斑马鱼蛋白质组因其复杂的翻译后修饰和可变剪切事件,导致前体离子去卷积效率不足,传统自底向上方法难以区分完整蛋白质的细微质量变化。在数据集构建中,研究人员面临多个技术难关:海量高分辨率质谱数据的处理需要高效的计算管线,原始mzML文件的中峰检测与同位素群识别易受噪声干扰,且不同碎裂模式(如HCD、ETD)下的谱图质量差异显著。此外,从超过12万张谱图中准确匹配蛋白质序列数据库,需克服假阳性控制与修饰位点定位误差,同时保证数据可重复性和跨平台可比性,这对算法鲁棒性提出了极高要求。
常用场景
经典使用场景
在蛋白质组学研究中,Zebrafish数据集以其涵盖超过1200万张MS/MS谱图的庞大规模,成为自上而下蛋白质组学分析中的经典资源。该数据集通过完整的质谱数据处理流程——从原始文件转换到谱图解卷积、数据库搜索与鉴定——为斑马鱼这一模式生物的蛋白质和蛋白质形态鉴定提供了高置信度的谱图库。研究者常利用该数据集进行自上而下蛋白质组学的基准测试,评估不同解卷积与鉴定算法的性能,或作为训练集开发深度学习模型以提升谱图预测与蛋白质形态识别精度。其详尽的前体离子信息、碎片测量数据及统计置信度指标,为复杂蛋白质混合物的解析构筑了坚实的数据基础。
解决学术问题
Zebrafish数据集着力攻克了自上而下蛋白质组学领域长期面临的规模化鉴定瓶颈。传统自下而上方法难以全面捕获蛋白质形态多样性,而该数据集通过提供超过1200万张串联质谱图,解决了斑马鱼全蛋白质组范围内完整蛋白质形态的大规模鉴定难题。它显著填补了非模式生物在自上而下谱图库构建中的空白,推动了蛋白质异构体、翻译后修饰联合分析与剪切变体鉴别等复杂问题的深入探索。该数据集的发布对提升蛋白质鉴定统计学方法、降低假阳性率以及优化碎片谱图特征解释精度具有深远意义,为从全局视角理解斑马鱼的蛋白质表达调控网络奠定了关键资源支撑。
衍生相关工作
基于Zebrafish数据集,衍生出了一系列卓有影响的学术工作与技术工具。TopRepo团队依托该数据集优化了TopFD与TopPIC算法的谱图解卷积与鉴定效能,推动了自上而下蛋白质组学软件生态的迭代升级。研究人员利用其谱图注释信息开发了针对蛋白质形态特异性碎片离子的机器学习预测模型,显著提高了对未知修饰的识别能力。在数据库构建领域,该数据集催生了多物种自上而下谱图库的统一标准格式,促成了跨物种蛋白质形态比较分析平台的设计。同时,围绕该数据集的统计置信度指标,衍生出面向大规模谱图鉴定结果的质量控制框架,为后续自上而下蛋白质组学研究范式的可信度评估奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务