遇见数据集

Yeast

收藏
Hugging Face2026-06-01 更新2026-06-02 收录
官方服务:

资源简介:

Yeast数据集是TopRepo自上而下谱图库的一部分,专注于酵母物种的质谱数据分析。TopRepo是一个包含来自12个物种超过1200万张MS/MS谱图的资源库。该数据集通过标准化的分析流程生成:原始质谱文件被转换为质心mzML格式,随后使用TopFD进行谱图去卷积,产生msalign文件和蛋白质形式特征文件。这些文件通过TopPIC针对相应的蛋白质组序列数据库进行搜索,以实现谱图鉴定,结果存储在TSV文件中。进一步地,利用这些中间文件,通过专用Python脚本生成了包含综合谱图信息的TSV文件、带注释的msalign文件以及带注释的mgf文件。数据集结构主要包括两个核心TSV文件:1) 元数据表,提供实验级别的信息,如数据集标识符、物种详情、仪器元数据、解离方法以及谱图、蛋白质和蛋白质形式的计数;2) 谱图表,包含谱图级别的MS/MS分析数据,涵盖扫描标识符、前体离子信息、碎片测量值、蛋白质形式注释、蛋白质鉴定结果和统计置信度指标。此外,数据集还包含带注释的.msalign文件。该数据集适用于蛋白质组学研究、蛋白质鉴定、质谱数据分析以及生物信息学工具的开发与验证。

The Yeast dataset is part of the TopRepo top-down spectral library, focusing on mass spectrometry data analysis of yeast species. TopRepo is a resource library containing over 12 million MS/MS spectra from 12 species. The dataset is generated through a standardized analysis pipeline: raw mass spectrometry files are converted to centroid mzML format, followed by spectral deconvolution using TopFD, producing msalign files and proteoform feature files. These files are searched against corresponding proteome sequence databases using TopPIC for spectral identification, with results stored in TSV files. Furthermore, using these intermediate files, comprehensive spectral information TSV files, annotated msalign files, and annotated mgf files are generated via dedicated Python scripts. The dataset structure primarily includes two core TSV files: 1) a metadata table providing experiment-level information such as dataset identifiers, species details, instrument metadata, dissociation methods, and counts of spectra, proteins, and proteoforms; 2) a spectral table containing spectrum-level MS/MS analysis data, covering scan identifiers, precursor ion information, fragment measurements, proteoform annotations, protein identification results, and statistical confidence metrics. Additionally, the dataset includes annotated .msalign files. It is suitable for proteomics research, protein identification, mass spectrometry data analysis, and the development and validation of bioinformatics tools.

创建时间:
2026-05-29
原始信息汇总

数据集概述

数据集名称:TopRepo Yeast Dataset(酵母数据集)

语言:英语

许可证:Apache 2.0

标签:蛋白质组学、生物信息学、质谱分析、液相色谱-质谱联用(LC-MS)、谱库、蛋白质、蛋白质鉴定

数据集来源

数据集简介: TopRepo 是一个包含来自12个物种、超过1200万张 MS/MS 谱图的顶向下(top-down)谱图存储库。数据处理流程为:使用 msconvert 将原始质谱文件转换为质心化的 mzML 文件,然后利用 TopFD 将谱图解卷积为一个或多个 msalign 文件及蛋白质形式特征文件。最后,通过 TopPIC 将 msalign 文件与相应的蛋白质组序列数据库进行比对,实现谱图鉴定,鉴定结果存储于 TSV 文件中。

基于上述流程生成的 mzML、msalign、特征文件和鉴定 TSV 文件,本仓库中的 Python 脚本进一步生成包含综合谱图信息的 TSV 文件、注释后的 msalign 文件及注释后的 mgf 文件。


数据集结构

该数据集针对 酵母(Yeast) 物种,包含以下三类文件:

  1. 元数据表toprepo_yeast_meta_table_v1.2.0.tsv
    包含实验级别的元数据:

    • 数据集标识符
    • 物种信息
    • 仪器元数据
    • 解离方法
    • 谱图、蛋白质和蛋白质形式数量统计
  2. 谱图表toprepo_yeast_spectrum_table_ms2_v1.2.0.tsv
    包含谱图级别的 MS/MS 分析数据:

    • 扫描标识符
    • 前体离子信息
    • 碎裂测量结果
    • 蛋白质形式注释
    • 蛋白质鉴定结果
    • 统计置信度指标
  3. 注释后的 msalign 文件(Annotated .msalign file)


联系方式

如有疑问,可通过以下邮箱联系 TopRepo 团队:

  • xwliu@tulane.edu
  • kli7@tulane.edu

版权信息:© 2025 - 2026, Tulane University.

搜集汇总
数据集介绍
Yeast 数据集图片
构建方式
Yeast数据集源自TopRepo项目,一个涵盖12个物种、包含超过1200万条MS/MS谱图的顶部-down谱库。该数据集的构建从原始质谱文件出发,首先利用msconvert将其转换为质心化的mzML格式,随后通过TopFD进行谱图解卷积,生成msalign文件与蛋白质形态特征文件。这些msalign文件借助TopPIC工具,与对应的蛋白质组序列数据库进行比对,以实现谱图的鉴定,鉴定结果被存储为TSV文件。最终,通过Python脚本整合mzML、msalign、特征文件及鉴定结果,生成包含全面谱图信息的TSV文件、注释后的msalign文件及mgf文件,为后续分析提供了标准化数据基础。
特点
该数据集的突出特点在于其结构化的元数据与谱图信息组织方式。它包含两个核心TSV文件:元数据表(toprepo_yeast_meta_table_v1.2.0.tsv)记录了实验级别信息,如数据集标识符、物种、仪器类型、解离方法及谱图、蛋白质和蛋白质形态的数量统计;谱图表(toprepo_yeast_spectrum_table_ms2_v1.2.0.tsv)则聚焦于MS/MS分析层面,涵盖扫描标识符、前体离子信息、碎裂测量结果、蛋白质形态注释及统计置信度指标。此外,数据集还提供注释后的msalign文件,极大地方便了用户对谱图鉴定结果的深入理解与再利用。
使用方法
用户可直接从TopRepo官方网站或HuggingFace页面下载Yeast数据集中的TSV和msalign文件。元数据表适用于宏观实验设计与质量控制的评估,而谱图表则支持对单个谱图级别的详细分析,如前体离子质量、碎裂模式及蛋白质形态分布。注释后的msalign文件可直接输入至TopPIC等蛋白质组学工具中进行后续检索或验证。对于编程分析,推荐使用Pandas等库加载TSV文件进行数据筛选与统计,或结合Python脚本批量处理msalign文件。相关代码示例与工作流程已在TopRepo的GitHub仓库中公开,便于复现研究。
背景与挑战
背景概述
蛋白质组学研究中,自上而下(top-down)质谱分析技术能够直接解析完整蛋白质及其翻译后修饰,为理解生物系统复杂性提供了独特视角。Yeast数据集源自TopRepo项目,该项目由Tulane大学团队构建并于2026年发布,旨在构建涵盖12个物种、超过1200万张串联质谱谱图的顶层光谱库。该数据集聚焦于酵母(Yeast)这一模式生物,通过整合msconvert、TopFD和TopPIC等工具,从原始质谱文件中提取并注释了实验级元数据与谱图级分析结果,包括前体离子信息、碎裂测量及蛋白质鉴定统计指标,为自上而下蛋白质组学数据的标准化与共享奠定了重要基础,显著推动了质谱谱图库在生物信息学领域的应用与发展。
当前挑战
Yeast数据集所解决的领域问题在于自上而下质谱分析中谱图解释与蛋白质鉴定的高复杂性,特别是面对完整蛋白质的多变碎裂模式与大量未知修饰时,传统数据库搜索方法常因缺少高质量谱图库而受限。构建过程中面临的挑战包括:从多种仪器平台与解离方法生成的大规模原始质谱数据中,需通过去卷积算法精确处理电荷态叠加与噪声干扰;跨物种谱图的一致性注释要求统一元数据标准,而酵母中蛋白质及其变体的多样性进一步增加了序列数据库搜索与错误发现率控制的难度,需要统计置信度指标来平衡鉴定灵敏度与假阳性率。
常用场景
经典使用场景
Yeast数据集源自TopRepo顶层质谱图谱库,是蛋白质组学研究中用于自上而下质谱数据分析的经典资源。该数据集以酿酒酵母为模式生物,提供了超过12百万张MS/MS二级质谱图,涵盖了实验元数据、谱图解析信息及蛋白质与蛋白质形态的鉴定结果。研究人员常利用该数据集进行质谱谱库构建、蛋白质形态鉴定算法验证以及质谱数据标准化处理流程的评估,其丰富的注释信息为开发与测试新型蛋白质鉴定工具提供了黄金标准基准。
解决学术问题
该数据集解决了自上而下蛋白质组学领域长期缺乏高质量标准参考数据集的核心难题。在蛋白质形态鉴定过程中,传统自下而上方法无法保留完整蛋白质信息,而Yeast数据集通过提供多维度、大规模的真实质谱数据,使研究者能够系统评估去卷积算法、数据库搜索策略及统计置信度评估方法的性能。其意义在于推动了蛋白质形态及其翻译后修饰的全面表征,为理解蛋白质异构体在细胞功能中的角色奠定了数据基础,加速了蛋白质组学从序列鉴定向结构功能解析的跨越。
衍生相关工作
Yeast数据集的发布催生了一系列经典衍生工作,最突出的是TopPIC系列软件及TopFD去卷积算法的持续优化与扩展。后续研究者基于该数据集提出了深度学习驱动的蛋白质形态鉴定模型,将质谱图谱特征与蛋白质序列信息深度融合,显著提升了低丰度蛋白质形态的检出率。还有工作利用该数据集构建了跨物种质谱图谱结构预测框架,将酵母中获得的蛋白质碎裂规律推广至人类样本,为精准医学中完整蛋白质分析技术的临床应用提供了方法论支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务