遇见数据集

C-elegans

收藏
Hugging Face2026-06-01 更新2026-06-02 收录
官方服务:

资源简介:

TopRepo是一个上游质谱谱图库,包含来自12个物种的超过1200万个MS/MS谱图。本数据集聚焦于其中的秀丽隐杆线虫(Caenorhabditis elegans)物种数据。数据通过标准分析流程生成:原始质谱文件经msconvert转换为质心mzML文件,再使用TopFD去卷积为msalign文件和蛋白形式特征文件,随后通过TopPIC对msalign文件进行谱图鉴定,结果存储在TSV文件中。基于此流程产生的文件(mzML、msalign、特征文件及鉴定TSV文件),本仓库的Python脚本进一步生成了包含全面谱图信息的TSV文件、注释的msalign文件和注释的mgf文件。数据集具体包含两个TSV文件:元数据表(toprepo_c_elegans_meta_table_v1.2.0.tsv),提供实验级元数据,如数据集标识符、物种信息、仪器元数据、解离方法以及谱图、蛋白质和蛋白形式的数量统计;谱图表(toprepo_c_elegans_spectrum_table_ms2_v1.2.0.tsv),提供谱图级MS/MS分析数据,包括扫描标识符、前体离子信息、碎片测量值、蛋白形式注释、蛋白质鉴定结果和统计置信度指标。此外,还包含一个注释的.msalign文件。该数据集适用于蛋白质组学、生物信息学、质谱分析等领域的研究,特别是用于蛋白质鉴定、谱图库构建和计算方法开发。

TopRepo is an upstream mass spectrometry spectral library containing over 12 million MS/MS spectra from 12 species. This dataset focuses on the Caenorhabditis elegans species data. The data is generated through a standard analysis pipeline: raw mass spectrometry files are converted to centroid mzML files using msconvert, then deconvoluted into msalign files and proteoform feature files using TopFD, followed by spectral identification of msalign files via TopPIC, with results stored in TSV files. Based on the files generated from this pipeline (mzML, msalign, feature files, and identification TSV files), Python scripts in this repository further produce TSV files containing comprehensive spectral information, annotated msalign files, and annotated mgf files. The dataset specifically includes two TSV files: a metadata table (toprepo_c_elegans_meta_table_v1.2.0.tsv), providing experiment-level metadata such as dataset identifiers, species information, instrument metadata, dissociation methods, and statistics on the number of spectra, proteins, and proteoforms; and a spectrum table (toprepo_c_elegans_spectrum_table_ms2_v1.2.0.tsv), providing spectrum-level MS/MS analysis data, including scan identifiers, precursor ion information, fragment measurements, proteoform annotations, protein identification results, and statistical confidence metrics. Additionally, it includes an annotated .msalign file. This dataset is suitable for research in proteomics, bioinformatics, mass spectrometry analysis, and other related fields, particularly for protein identification, spectral library construction, and computational method development.

创建时间:
2026-05-29
原始信息汇总

数据集概述

C. Elegans Dataset 是 TopRepo 项目的一部分,专注于线虫(Caenorhabditis elegans)的自顶向下蛋白质组学光谱数据。该数据集包含超过1200万张MS/MS光谱,来自12个物种,其中本数据集聚焦于线虫物种。

数据内容

数据集包含以下核心文件:

  • 元数据表 (toprepo_c_elegans_meta_table_v1.2.0.tsv):包含实验级别的元数据,如数据集标识符、物种信息、仪器元数据、解离方法,以及光谱、蛋白质和蛋白质形式的计数。
  • 光谱表 (toprepo_c_elegans_spectrum_table_ms2_v1.2.0.tsv):包含光谱级别的MS/MS分析数据,如扫描标识符、前体离子信息、碎裂测量值、蛋白质形式注释、蛋白质鉴定结果和统计置信度指标。
  • 注释后的.msalign文件:提供经过注释的自顶向下质谱数据。

数据处理流程

原始MS文件首先通过 msconvert 转换为质心化的mzML文件,随后使用 TopFD 进行解卷积,生成一个或多个msalign文件及蛋白质形式特征文件。最后,利用 TopPIC 在对应蛋白质组序列数据库中进行光谱鉴定,结果存储在TSV文件中。

适用领域

该数据集适用于蛋白质组学、生物信息学、质谱分析、蛋白质鉴定及光谱库构建等研究场景。

许可与联系

搜集汇总
数据集介绍
C-elegans 数据集图片
构建方式
C-elegans数据集源自TopRepo项目,一个涵盖12个物种、包含超过1200万张串联质谱的顶级谱图库。数据构建始于原始质谱文件,经msconvert工具转化为中心化的mzML文件后,利用TopFD算法进行去卷积处理,生成msalign文件与蛋白质形态特征文件。随后,通过TopPIC软件将msalign文件与对应物种的蛋白质组序列数据库进行比对,完成谱图的鉴定,结果存储于TSV格式文件中。最终,结合Python脚本整合上述流程生成的各类文件,产出包含详尽谱图信息、注释后的msalign文件及mgf文件,从而构建出本数据集的最终形态。
特点
本数据集专为模式生物秀丽隐杆线虫设计,包含实验元数据表与谱图数据表两大核心组件。元数据表详尽记录了数据集标识符、物种信息、仪器参数、解离方法以及谱图、蛋白质和蛋白质形态的数量统计。谱图数据表则聚焦于MS/MS级别的分析数据,涵盖扫描标识符、前体离子信息、裂解测量值、蛋白质形态注释、蛋白质鉴定结果及统计置信度指标。此种双表结构既提供了高层次的实验概览,又保留了深层的谱图细节,便于研究者进行多维度数据挖掘与统计分析。
使用方法
用户可直接从HuggingFace数据集页面或TopRepo官方仓库获取C-elegans数据集中的TSV文件、注释后的msalign文件及mgf文件。对于蛋白质组学分析,建议利用谱图数据表进行蛋白质形态的鉴定与定量研究,结合元数据表中的实验参数筛选符合条件的子集。高阶应用可调用Python脚本,基于注释文件进行定制化的谱图解析与比对。此外,数据集依托TopPIC工具链,支持与下游生物信息学流程无缝集成,适用于质谱数据解析、蛋白质组学数据库构建以及机器学习模型训练等多种研究场景。
背景与挑战
背景概述
C-elegans数据集由美国杜兰大学(Tulane University)的TopRepo团队于2025至2026年间创建,其核心研究问题是通过自上而下的质谱(Top-Down MS)技术系统解析秀丽隐杆线虫(Caenorhabditis elegans)的蛋白及蛋白形(proteoform)组成。该数据集是TopRepo项目的一部分,后者整合了来自12个物种超过1200万张MS/MS谱图,旨在构建全面的自上而下质谱谱图库。在蛋白质组学领域,蛋白质的翻译后修饰与异构体多样性对功能研究至关重要,而C-elegans作为经典模式生物,其蛋白组参考数据长期缺失。该数据集填补了这一空白,提供了高置信度的蛋白鉴定与注释信息,推动了蛋白形层面的生物标志物发现与意义解析,对系统生物学和精准医学具有基础性价值。
当前挑战
该数据集所应对的领域挑战在于自上而下蛋白质组学中蛋白形鉴定与表征的复杂性,包括完整蛋白的碎片模式解析、多电荷前体离子的解卷积以及序列变异与修饰的准确归属。传统自下而上方法丢失了蛋白形信息,而自上而下方法则面临谱图覆盖率低、自动化分析精度不足等问题。构建过程中,团队需应对质谱原始数据格式多样、解卷积算法对噪声敏感以及跨实验室仪器参数差异带来的一致性问题。此外,将自动化管道生成的msalign文件与物种特异性蛋白数据库进行大规模比对时,伪阳性率的控制与统计置信度的统一至关重要。最终,数据集的标准化注释使其可复用性增强,但谱图质量的异质性与未鉴定谱图的持续存在仍是未来改进的主要障碍。
常用场景
经典使用场景
在蛋白质组学研究中,C-elegans数据集作为秀丽隐杆线虫物种的顶层质谱谱图存储库,是蛋白质鉴定的经典工具。研究者常利用其超过1200万张MS/MS谱图,结合TopPIC等搜索引擎进行自上而下的蛋白鉴定分析。该数据集提供从原始质谱文件到特征提取、谱图去卷积、蛋白鉴定的一站式数据处理流程,尤其适用于线虫这一模式生物中蛋白质和蛋白质形态的精准识别,为比较蛋白质组学、发育生物学中的蛋白表达谱研究奠定了数据基础。
解决学术问题
该数据集解决了自上而下蛋白质组学研究中长期存在的标准数据缺失问题。传统数据库多以肽段为中心的串联质谱数据为主,缺乏对完整蛋白质形态的全面覆盖。C-elegans数据集通过提供高置信度的蛋白质和蛋白质形态标注信息,以及包含前体离子信息、碎裂测量值、统计置信度等详细谱图级元数据,使得研究者能够在模式生物中开展蛋白质剪接变体、翻译后修饰等复杂生物学机制的精确解析,显著推动了蛋白质动态变化和功能注释研究的发展。
衍生相关工作
基于C-elegans数据集衍生了一系列重要的学术工作。TopRepo团队在发布该数据时公开了完整的分析管线(从msconvert转换到TopFD去卷积、TopPIC鉴定),并开发了Python脚本用于生成包含全面谱图信息的TSV文件及注释后的msalign和mgf文件。后续研究以该数据集为基准,开发了基于深度学习的谱图匹配模型和蛋白质形态量化方法。收录该数据的TopRepo存储库(toprepo.org)及其配套GitHub代码库为全球蛋白质组学社区提供了标准化分析模板和数据共享范例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务