遇见数据集

Mouse

收藏
Hugging Face2026-06-01 更新2026-06-02 收录
官方服务:

资源简介:

TopRepo Mouse数据集是TopRepo顶层谱图库中针对小鼠物种的蛋白质组学质谱数据子集,涵盖来自12个物种的超过1200万MS/MS谱图。该数据集通过标准化流程生成:首先将原始质谱文件转换为centroided mzML格式,接着进行谱图去卷积处理生成msalign文件和蛋白质形式特征文件,最后通过比对蛋白质组序列数据库实现谱图鉴定。数据集包含三个核心部分:1) 元数据表(toprepo_mouse_meta_table_v1.2.0.tsv),记录实验级别的元信息,如数据集标识符、物种、仪器数据、解离方法及谱图、蛋白质和蛋白质形式的数量统计;2) 谱图表(toprepo_mouse_spectrum_table_ms2_v1.2.0.tsv),包含谱图级别的MS/MS分析数据,如扫描标识符、前体离子信息、碎片测量数据、蛋白质形式注释和鉴定结果;3) 注释的.msalign文件。该数据集适用于蛋白质鉴定、蛋白质形式分析、质谱数据处理方法开发等蛋白质组学和生物信息学研究。

The TopRepo Mouse dataset is a subset of proteomics mass spectrometry data for the mouse species within the TopRepo top-down spectral library. TopRepo is a comprehensive top-down spectral library containing over 12 million MS/MS spectra from 12 species. The dataset is generated through a standardized data processing pipeline: raw mass spectrometry files are first converted to centroided mzML format using msconvert, then mzML files are deconvoluted using TopFD to produce msalign files and proteoform feature files, and finally TopPIC is used to match msalign files against corresponding proteome sequence databases for spectrum identification. The Mouse dataset specifically consists of three core components: 1) A metadata table (toprepo_mouse_meta_table_v1.2.0.tsv) recording experiment-level metadata, including dataset identifiers, species information, instrument metadata, dissociation methods, and counts of spectra, proteins, and proteoforms; 2) A spectrum table (toprepo_mouse_spectrum_table_ms2_v1.2.0.tsv) containing spectrum-level MS/MS analysis data, such as scan identifiers, precursor ion information, fragment measurements, proteoform annotations, protein identification results, and statistical confidence metrics; 3) Annotated .msalign files. The dataset is suitable for proteomics and bioinformatics research tasks such as protein identification, proteoform analysis, and mass spectrometry data processing method development.

创建时间:
2026-05-29
原始信息汇总

数据集概述

名称:Mouse Dataset(小鼠数据集),属于 TopRepo 项目的一部分。

语言:英文。

许可证:Apache-2.0。

数据集描述

TopRepo 是一个自上而下的质谱谱图库,包含来自12个物种的超过1200万个 MS/MS 谱图。针对小鼠物种,数据集提供了通过标准化数据分析流程生成的多种文件。数据处理流程为:将原始 MS 文件转换为质心化的 mzML 文件,使用 TopFD 进行去卷积生成 msalign 文件和蛋白质形式特征文件,再利用 TopPIC 进行谱图鉴定,鉴定结果存储于 TSV 文件中。

数据集结构

小鼠数据集包含以下文件:

  1. 元数据表toprepo_mouse_meta_table_v1.2.0.tsv

    • 实验级别的元数据,包括:
      • 数据集标识符
      • 物种信息
      • 仪器元数据
      • 解离方法
      • 谱图、蛋白质和蛋白质形式的计数
  2. 谱图表toprepo_mouse_spectrum_table_ms2_v1.2.0.tsv

    • 谱图级别的 MS/MS 分析数据,包括:
      • 扫描标识符
      • 前体离子信息
      • 碎裂测量值
      • 蛋白质形式注释
      • 蛋白质鉴定结果
      • 统计置信度指标
  3. 带注释的 .msalign 文件

数据来源

  • 仓库网站:https://toprepo.org/
  • 论文:https://www.biorxiv.org/content/10.64898/2026.02.20.707032v1
  • GitHub 仓库:https://github.com/toppic-suite/toprepo

联系方式

如有问题,可联系 TopRepo 团队:xwliu@tulane.edu 或 kli7@tulane.edu。版权归杜兰大学所有(2025-2026)。

搜集汇总
数据集介绍
Mouse 数据集图片
构建方式
Mouse数据集源自TopRepo数据库,这是一个涵盖12个物种、包含超过1200万条MS/MS谱图的蛋白质组学自上而下谱图库。数据构建遵循严格的分析流程:首先利用msconvert将原始质谱文件转换为质心化的mzML格式,随后通过TopFD进行谱图解卷积,生成msalign文件与蛋白质形态特征文件。最后,采用TopPIC搜索引擎对msalign文件进行数据库比对,以完成谱图鉴定,并将结果存储于TSV文件中。在此基础上,借助Python脚本整合mzML、msalign、特征文件及鉴定结果,生成包含全面谱图信息的TSV文件、带注释的msalign文件和mgf文件。
特点
该数据集专为小鼠物种设计,结构清晰,包含三大核心文件:元数据表、谱图表及带注释的msalign文件。元数据表收录了实验级别的详细信息,涵盖数据集标识、物种信息、仪器参数、解离方法以及谱图、蛋白质和蛋白质形态的数量统计。谱图表则聚焦于MS/MS分析层面的数据,包括扫描标识、前体离子信息、碎片化测量结果、蛋白质形态注释、蛋白质鉴定结果以及统计置信度指标。这种多层次的结构设计确保了从实验条件到谱图解析的完整数据链条,为蛋白质组学研究提供了丰富且标准化的数据资源。
使用方法
用户可通过TopRepo官方网站(toprepo.org)直接访问并下载该数据集。下载得到的TSV文件可用于后续的生物信息学分析,谱图数据支持在Python等编程环境中进行深度挖掘。研究人员可以结合论文(biorxiv.org)中的方法学描述,利用GitHub仓库(github.com/toppic-suite/toprepo)提供的脚本对数据进行自定义处理。对于数据使用中的具体问题,可通过电子邮件联系xwliu@tulane.edu或kli7@tulane.edu获取支持。该数据集适用于蛋白质组学领域的谱图库构建、鉴定算法评估及生物学发现研究。
背景与挑战
背景概述
蛋白质组学中,自上而下(top-down)质谱分析能够完整表征蛋白质及其翻译后修饰,但其数据分析依赖于高质量的光谱库。TopRepo数据集由美国杜兰大学团队于2025至2026年间创建,涵盖12个物种、超过1200万张MS/MS谱图。Mouse子集作为该仓库的重要组成部分,聚焦于小鼠蛋白质组,提供从原始质谱文件到注释谱图的完整处理管线,包括元数据表、谱图表及注释文件。该数据集解决了自上而下蛋白质组学中谱图资源匮乏的核心问题,为大规模蛋白鉴定、翻译后修饰解析及蛋白质异形体研究提供了标准化基准,显著推动了蛋白质组学数据共享与分析流程的进步。
当前挑战
该数据集面临的核心挑战包括:1)自上而下蛋白质组学中完整蛋白质鉴定的复杂性远高于肽段水平分析,需要处理多电荷前体离子、复杂碎片谱图及多种翻译后修饰组合,对解卷积算法和搜索效率要求极高;2)在构建过程中,从原始质谱文件至msalign文件的转换依赖多步串行管线,数据量大(超千万谱图)导致计算资源消耗大,批次效应和仪器变异增加了数据标准化难度;3)谱图注释的准确性高度依赖数据库搜索策略,同质异构体和低丰度蛋白的鉴定仍存在较高假阳性率,需要更严格的统计质量控制。
常用场景
经典使用场景
在小鼠蛋白质组学研究中,该数据集作为自上而下(top-down)质谱分析的基准资源,经典使用场景聚焦于完整蛋白质形式(proteoforms)的鉴定与表征。通过整合超过1200万张MS/MS谱图与实验元数据,研究者可系统分析小鼠组织或细胞系中蛋白质的翻译后修饰、异构体表达及降解产物。由于数据集包含了从原始谱图去卷积到蛋白质鉴定的完整流程链(mzML→msalign→TSV),其标准化的谱图索引与统计置信度指标使得大规模比较蛋白质组学成为可能,尤其适用于低丰度蛋白质或复杂修饰模式的发现。
解决学术问题
该数据集解决了自上而下蛋白质组学领域两大核心瓶颈:多物种谱图库的匮乏与重复实验间比较的标准化缺失。通过提供小鼠种类中千万级高置信度MS/MS谱图及对应蛋白质分配结果,研究机构得以构建更具普适性的蛋白质形式图谱,进而深入解析蛋白质多样性在诸如发育过程、疾病模型中的动态调控。此外,其统一的数据处理流水线(TopFD + TopPIC)为跨实验室可比性奠定了量化基础,推动了蛋白质异质性与修饰复杂性的系统生物学研究,加速了从基因到功能蛋白质的关键科学跨越。
衍生相关工作
基于该数据集及其上游TopRepo生态,衍生出多项关键性研究进展。典型工作包括开发针对自上而下数据的机器学习分类算法,用以预测蛋白质鉴定置信度或修饰位点;构建跨物种比对数据库,将小鼠谱图与人类疾病标志物相关联。同时,发布了集成TopFD、TopPIC与可视化的开源分析平台,降低非计算实验室的使用门槛。另有研究利用该数据集验证新去卷积算法对混合修饰谱的解析能力,以及优化谱图搜索中的评分函数,从而推动自上而下蛋白质组学在单细胞应用与时空动态分析中的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务