遇见数据集

Human

收藏
Hugging Face2026-05-29 更新2026-05-30 收录
官方服务:

资源简介:

TopRepo是一个自上而下的质谱谱图库,包含超过1200万张来自12个物种的MS/MS谱图。本数据集是其人类物种(Human)数据子集,通过标准分析流程生成:原始质谱文件经msconvert转换为mzML文件,再通过TopFD进行谱图去卷积,生成msalign文件和蛋白质形式特征文件,然后使用TopPIC将msalign文件与蛋白质组序列数据库比对进行谱图鉴定,结果存储在TSV文件中。数据集包含两个核心TSV文件:元数据表(提供实验级别的元信息,如数据集标识符、物种信息、仪器元数据、解离方法及统计计数)和谱图表(提供谱图级别的MS/MS分析数据,如扫描标识符、前体离子信息、碎片离子测量值、蛋白质形式注释、蛋白质鉴定结果和统计置信度指标),还提供经过注释的.mgf和.msalign文件。适用于自上而下蛋白质组学、生物信息学、质谱分析(如LC-MS)、谱图库构建、蛋白质鉴定及蛋白质形式分析等研究任务。

TopRepo is a top-down mass spectrometry spectral library containing over 12 million MS/MS spectra from 12 species. This dataset is its human species subset. Data is generated through a standard analysis pipeline: raw mass spectrometry files are converted to centroid mzML files via msconvert, then deconvoluted using TopFD to produce one or more msalign files and proteoform feature files. Subsequently, TopPIC is used to align msalign files with corresponding proteome sequence databases for spectral identification, with results stored in TSV files. The dataset structure includes two core TSV files: 1) a metadata table (toprepo_human_meta_table_v1.2.0.tsv) providing experiment-level metadata, such as dataset identifiers, species information, instrument metadata, dissociation methods, and counts of spectra, proteins, and proteoforms; 2) a spectrum table (toprepo_human_spectrum_table_ms2_v1.2.0.tsv) providing spectrum-level MS/MS analysis data, including scan identifiers, precursor ion information, fragment ion measurements, proteoform annotations, protein identification results, and statistical confidence metrics. Additionally, the dataset provides annotated .mgf and .msalign files. It is suitable for research tasks in top-down proteomics, bioinformatics, mass spectrometry analysis (particularly LC-MS), spectral library construction, protein identification, and proteoform analysis.

创建时间:
2026-05-29
原始信息汇总

数据集概述

Human Dataset 是 TopRepo 项目中的一个子数据集,专注于人类物种的蛋白质组学数据。该数据集包含超过 1,200 万条 MS/MS 质谱谱图,源自 TopRepo 整体存储库(涵盖 12 个物种)。数据已通过标准化流程处理:原始文件经 msconvert 转换为质心 mzML 文件,随后使用 TopFD 进行解卷积处理生成 msalign 文件和蛋白质特征文件,最后通过 TopPIC 进行谱图鉴定,结果以 TSV 格式存储。

数据集文件结构

  • 元数据表 (toprepo_human_meta_table_v1.2.0.tsv):包含实验级别元数据,具体包括:

    • 数据集标识符
    • 物种信息
    • 仪器元数据
    • 解离方法
    • 谱图、蛋白质和蛋白质型计数
  • 谱图表 (toprepo_human_spectrum_table_ms2_v1.2.0.tsv):包含谱图级别的 MS/MS 分析数据,具体包括:

    • 扫描标识符
    • 前体离子信息
    • 碎片化测量数据
    • 蛋白质型注释
    • 蛋白质鉴定结果
    • 统计置信度指标
  • 多个带注释的 .mgf 文件:提供详细谱图信息。

  • 带注释的 .msalign 文件:包含对齐后的谱图数据。

数据来源与许可

  • 存储库: https://toprepo.org/
  • 论文: https://www.biorxiv.org/content/10.64898/2026.02.20.707032v1
  • GitHub: https://github.com/toppic-suite/toprepo
  • 许可协议: Apache-2.0

适用领域:蛋白质组学、生物信息学、质谱分析、液相色谱-质谱联用(LC-MS)以及蛋白质鉴定研究。数据集以英文呈现,适合人类与啮齿类相关蛋白质组学分析。

搜集汇总
数据集介绍
Human 数据集图片
构建方式
Human数据集源自TopRepo自上而下的光谱储存库,涵盖了超过1200万条MS/MS谱图。在构建过程中,原始质谱文件首先经由msconvert工具转换为质心化的mzML格式,随后通过TopFD软件对谱图进行去卷积处理,生成若干msalign文件和蛋白质形态特征文件。接着,利用TopPIC搜索引擎将这些msalign文件与对应的蛋白质序列数据库进行比对,以实现谱图的鉴定,鉴定结果以TSV文件形式存储。基于上述分析流程生成的mzML、msalign、特征文件及鉴定文件,通过Python脚本进一步整合,产出包含全面光谱信息的TSV文件、注释后的msalign文件以及注释后的mgf文件。
特点
该数据集以人类样本为核心,提供了层次分明的数据结构,包括实验级元数据表(如toprepo_human_meta_table_v1.2.0.tsv)和谱图级数据表(如toprepo_human_spectrum_table_ms2_v1.2.0.tsv),前者涵盖数据集标识、物种信息、仪器类型、解离方法及谱图、蛋白质与蛋白质形态的计数;后者则包含扫描标识、前体离子信息、碎裂测量值、蛋白质形态注释、蛋白质鉴定结果及统计置信度指标。此外,数据集还附带了多个注释后的mgf文件和msalign文件,为自上而下蛋白质组学的研究提供了丰富且精细的谱图与鉴定信息。
使用方法
使用Human数据集时,用户可直接从TopRepo官网或HuggingFace页面获取TSV元数据表与谱图表,以及注释后的mgf和msalign文件。这些文件适用于自上而下蛋白质组学数据分析流程,例如利用TSV文件中的统计置信度指标筛选高可信度的蛋白质形态鉴定结果,或加载mgf文件至质谱分析软件(如Toppic Suite)进行进一步的谱图解析与验证。研究人员也可通过Python脚本自定义解析数据,以支持特定生物学问题(如蛋白质异构体表征)的分析。相关资源与引用信息可在TopRepo仓库及配套文献中找到,技术支持可联系开发团队。
背景与挑战
背景概述
蛋白质组学作为后基因组时代解析生命活动分子基础的核心领域,其技术发展深刻依赖于高精度质谱数据的积累与解析。TopRepo人类数据集由美国杜兰大学刘小龙团队于2026年发布,依托top-down蛋白质组学分析框架,整合超过1200万张MS/MS图谱,构建了迄今规模最大的人类自上而下质谱谱图库。该数据集通过标准化流程(msconvert、TopFD、TopPIC)实现从原始质谱文件到蛋白形式鉴定的全链条处理,并收录了实验元数据与谱图级注释信息。其发布不仅为蛋白形式组学研究提供了基准参考,更推动了质谱数据共享标准的确立,对蛋白质翻译后修饰解析、疾病标志物发现等领域具有深远影响。
当前挑战
该数据集所解决的领域核心挑战在于自上而下蛋白质组学中大规模谱图匹配的低效率与鉴定通量瓶颈——TopRepo通过整合多物种数据与统一计算流程,显著提升了蛋白形式鉴定的覆盖率与可信度。构建过程中面临的技术挑战包括:异构质谱仪器数据格式的标准化(需针对不同平台输出进行mzML转换),复杂谱图中前体离子重叠与电荷状态解卷积的算法优化(采用TopFD以确保msalign文件质量),以及跨越12个物种、超过1200万张图谱的元数据一致性维护(如通过TSV表结构实现实验信息与谱图属性的系统化关联)。
常用场景
经典使用场景
在蛋白质组学领域,Human数据集作为TopRepo项目中人类物种的高质量自上而下(top-down)质谱(MS/MS)光谱库,为蛋白质及蛋白形貌的鉴定提供了系统性的数据基础。研究者通常利用该数据集中的元数据表和光谱表,结合物种信息、仪器参数和解离方法,开展全蛋白质水平的鉴定与定量分析。通过获取前体离子信息、碎裂测量数据以及蛋白形貌注释,经典使用场景涵盖从原始质谱文件到蛋白序列数据库搜索的完整流程,最终实现高置信度的蛋白质鉴定结果输出。该数据集广泛用于验证和开发自上而下蛋白质组学数据分析算法,特别是在处理复杂样品中完整蛋白形貌的识别任务时展现出无可替代的价值。
衍生相关工作
围绕Human数据集,衍生了一系列具有影响力的相关工作。基于该数据集的TopPIC算法得到了持续优化,形成了针对自上而下蛋白质组学的高效鉴定流程。进一步地,研究者利用该数据集建立了TopDiff等差分分析工具,专门用于比较不同条件下蛋白质形貌的丰度变化。此外,数据集中丰富的注释信息催生了多项关于蛋白质形貌可视化与数据库构建的研究,推动了TopRepo主题仓库成为大规模自上而下光谱数据的核心共享平台。这些工作不仅促进了蛋白质组学数据标准的统一,也为人源蛋白形貌的深度解析和生物医学应用奠定了坚实的数据与算法基础,从而引发了更多关于疾病特异性蛋白形貌的针对性探索。
数据集最近研究
最新研究方向
Human数据集作为TopRepo项目中涵盖超过1200万条MS/MS谱图的顶级蛋白质组学资源,近期研究聚焦于利用自上而下的质谱技术进行完整蛋白质形式的深度鉴定与表征。该数据集整合了来自人类样本的高分辨率LC-MS数据,并通过TopPIC等算法实现蛋白质及其翻译后修饰的精准匹配,为精准医学与生物标志物发现提供了关键参考谱库。随着单细胞蛋白质组学与空间蛋白质组学的兴起,Human数据集在推动组学交叉研究中扮演基础性角色,尤其在大规模数据处理与质谱数据库标准化方面具有引领意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务