遇见数据集

Dayhoff-MMseqs2

收藏
Hugging Face2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

该数据集包含原始Dayhoff Atlas中的GigaRef和UniRef50数据集,并将其转换为适合MMseqs2 CPU和GPU工具使用的格式。原始Atlas的训练集、验证集和测试集被合并,提供以下数据集:GigaRef No Singletons(无单例簇的GigaRef数据集)、GigaRef Singletons(仅含单例簇的GigaRef数据集)、GigaRef Full(包含所有序列的完整GigaRef数据集)以及UniRef50(在50%序列同一性水平上聚类的UniProt数据集)。每个数据集提供以下格式:FASTA(标准序列存储格式,适用于多种生物信息学工具)、MMseqs2-CPU(转换后的未索引数据库文件夹,兼容MMseqs2-CPU,搜索可通过分割适应系统内存)和MMseqs2-GPU(转换后的填充序列数据库,用于MMseqs2-GPU搜索,需要至少一个GPU)。数据集文件组织在fastas/、mmseqs-cpu/和mmseqs-gpu/目录下。FASTA文件为压缩格式(.fasta.gz),MMseqs数据库文件也以压缩形式提供。各数据集的下载大小和提取后所需磁盘空间、内存建议及GPU要求已在README中详细列出。该数据集适用于蛋白质序列搜索、聚类和分析等生物信息学任务。

This dataset contains the GigaRef and UniRef50 datasets from the original Dayhoff Atlas, converted into formats suitable for MMseqs2 CPU and GPU tools. The training, validation, and test sets of the original Atlas are merged to provide the following datasets: GigaRef No Singletons (GigaRef dataset without singleton clusters), GigaRef Singletons (GigaRef dataset containing only singleton clusters), GigaRef Full (complete GigaRef dataset containing all sequences), and UniRef50 (UniProt dataset clustered at 50% sequence identity). Each dataset is available in the following formats: FASTA (standard sequence storage format, suitable for various bioinformatics tools), MMseqs2-CPU (converted unindexed database folder, compatible with MMseqs2-CPU, search can be adapted to system memory by splitting), and MMseqs2-GPU (converted padded sequence database for MMseqs2-GPU search, requiring at least one GPU). Dataset files are organized into fastas/, mmseqs-cpu/, and mmseqs-gpu/ directories. FASTA files are in compressed format (.fasta.gz), and MMseqs database files are also provided in compressed form. The download size, required disk space, memory recommendations, and GPU requirements for each dataset are detailed in the README. This dataset is suitable for bioinformatics tasks such as protein sequence search, clustering, and analysis.

提供机构:
Microsoft
创建时间:
2026-08-25
原始信息汇总

Dayhoff FASTA 和 MMseqs2 数据库数据集概述

数据集简介

该数据集包含原始 Dayhoff Atlas 中的 GigaRef 和 UniRef50 数据集,并以适合 MMseqs2 CPU 和 GPU 工具使用的格式提供。原始数据集的训练集、验证集和测试集被合并,形成以下可用数据子集:

  • GigaRef No Singletons:不含单例聚类的 GigaRef 数据集
  • GigaRef Singletons:仅含单例聚类的 GigaRef 数据集
  • GigaRef Full:包含上述两个子集中所有序列的完整集合
  • UniRef50:UniProt 按 50% 序列一致性聚类得到的数据集

每个数据集提供三种格式:

  1. FASTA:标准序列存储格式,兼容多种生物信息学工具
  2. MMseqs2-CPU:经转换的未索引数据库文件,适用于 MMseqs2-CPU,可调整拆分以适应系统内存
  3. MMseqs2-GPU:经填充的序列数据库,适用于 MMseqs2-GPU 搜索,需要至少 1 个 GPU

仓库结构

fastas/ ├── gigaref-full.fasta.gz ├── gigaref-singletons.fasta.gz ├── gigaref-no-singletons.fasta.gz └── uniref50.fasta.gz

mmseqs-cpu/ ├── gigaref-singletons/db/ ├── gigaref-no-singletons/db/ └── uniref50/db/

mmseqs-gpu/ ├── gigaref-singletons/db_gpu/ ├── gigaref-no-singletons/db_gpu/ └── uniref50/db_gpu/

资源需求表

制品 下载大小 工作磁盘 主机内存 GPU
GigaRef full FASTA 358.90 GB 358.90 GB(压缩态) 不适用
GigaRef singleton FASTA 147.28 GB 147.28 GB(压缩态) 不适用
GigaRef no-singleton FASTA 211.62 GB 211.62 GB(压缩态) 不适用
UniRef50 FASTA 13.27 GB 13.27 GB(压缩态) 不适用
UniRef50 CPU MMseqs 14.97 GB 约 28 GB 解压后 建议 32 GB;更低内存可通过拆分实现
UniRef50 GPU MMseqs 15.29 GB 约 28 GB 解压后 建议 32 GB;更低内存可通过拆分实现 至少一个兼容 MMseqs2-GPU 的 NVIDIA GPU
GigaRef singleton CPU MMseqs 182.49 GB 约 387 GB 解压后 64 GB 起点(配合拆分);400+ GB 可获得最大吞吐
GigaRef singleton GPU MMseqs 189.12 GB 约 395 GB 解压后 64 GB 起点(配合拆分);400+ GB 可获得最大吞吐 至少一个兼容 MMseqs2-GPU 的 NVIDIA GPU;数据库无需适配 VRAM
GigaRef no-singleton CPU MMseqs 279.08 GB 解压后 572.73 GB;解压时预留 647 GB 64 GB 起点(配合拆分);600+ GB 可获得最大吞吐
GigaRef no-singleton GPU MMseqs 292.13 GB 解压后 586.94 GB;解压时预留 660 GB 64 GB 起点(配合拆分);600+ GB 可获得最大吞吐 至少一个兼容 MMseqs2-GPU 的 NVIDIA GPU;数据库无需适配 VRAM

使用说明

  • 建议将解压后的 MMseqs 数据库及临时搜索目录放在最快的本地 SSD 或 NVMe 上;I/O 速度、内存和 GPU 可提升吞吐,较慢的存储会显著增加搜索时间。
  • FASTA 文件可直接被 MMseqs 读取(.fasta.gz 格式),无需解压即可使用。
  • 解压 FASTA 可使用 pigz -dc "fastas/$TARGET.fasta.gz" > "fastas/$TARGET.fasta"
  • 解压 MMseqs CPU/GPU 数据库需对其中的 .gz 文件逐一解压。
  • 搜索时可通过 --split-mode 0--split-memory-limit 参数调整内存使用,GPU 搜索需添加 --gpu 1

关键说明

  • 有效的 FASTA 目标包括:gigaref-fullgigaref-singletonsgigaref-no-singletonsuniref50;CPU 和 GPU MMseqs 目标包括:gigaref-singletonsgigaref-no-singletonsuniref50
  • UniRef50 和单例数据库直接基于已发布的合并 FASTA 构建,序列标识符一致;no-singletons FASTA 与 MMseqs 数据库包含相同的 18 亿序列语料,但 FASTA 使用 gr_<source-index> 标识符,而现有 MMseqs 数据库保留较旧的 g<part>_<row> 标识符,该差异不影响推理结果。
搜集汇总
数据集介绍
Dayhoff-MMseqs2 数据集图片
构建方式
Dayhoff-MMseqs2数据集源自Dayhoff Atlas项目,对其中的GigaRef和UniRef50数据集进行了格式转换与整合。原始数据集的训练、验证和测试划分被合并,形成了GigaRef的三种子集(无单例、仅单例及全部序列)以及UniRef50。这些数据被存储为FASTA格式,并转换为MMseqs2的CPU与GPU兼容数据库,以满足不同计算环境下的大规模序列比对需求。
使用方法
用户可通过Hugging Face下载功能获取所需子集及格式。FASTA文件无需额外解压即可用于MMseqs搜索,而MMseqs数据库需先解压。搜索过程支持通过--split-memory-limit参数调整内存使用,以适应不同RAM大小的主机,同时可利用GPU加速。对于GigaRef等大型数据库,建议使用高速SSD存储并合理配置计算资源以优化吞吐量。
背景与挑战
背景概述
Dayhoff-MMseqs2数据集由微软研究院于2024年创建,旨在为蛋白质序列比对提供高效、可扩展的数据库格式。该数据集基于Dayhoff Atlas中的GigaRef和UniRef50数据集,重新组织为FASTA、MMseqs2-CPU和MMseqs2-GPU三种格式,以支持大规模序列搜索。其核心研究问题在于解决现有蛋白质数据库在存储、索引和搜索效率上的瓶颈,特别是在处理数十亿条序列时的计算资源需求。该数据集对生物信息学领域具有重要影响力,为研究人员提供了标准化、灵活的工具,促进了蛋白质进化、结构预测和功能注释等研究的发展。
当前挑战
该数据集面临多重挑战。首先,GigaRef规模庞大,包含约18亿条序列,存储和压缩后体积达数百GB,对下载、解压和索引提出了极高的硬件要求,尤其在高内存消耗和I/O性能方面。其次,构建过程中需将原始FASTA转换为MMseqs2格式,涉及数据分割、填充和索引,需处理序列标识符不一致等问题,如FASTA与MMseqs数据库间ID差异可能影响数据整合。此外,MMseqs2-GPU版本虽加速搜索,但需兼容的NVIDIA GPU及足够显存,而CPU版本则需平衡内存与吞吐量,不同硬件配置下优化参数选择复杂,限制了数据集的易用性和普适性。
常用场景
经典使用场景
该数据集为蛋白质序列分析领域提供了标准化的序列资源,主要应用于基于MMseqs2的同源检索与序列聚类。其FASTA格式便于直接用于各类生物信息学工具,而预构建的MMseqs2-CPU和GPU数据库则使得大规模序列比对任务能够高效执行,是蛋白质功能注释、进化分析和宏基因组研究的基石性数据支撑。
解决学术问题
该数据集解决了大规模蛋白质序列数据库中序列冗余度高、存储格式不统一、检索效率低下等核心问题。通过提供去冗余的GigaRef和UniRef50子集,并优化为MMseqs2专用格式,大幅降低了序列搜索的计算资源需求,使得在普通服务器上即可开展全基因组或宏基因组的深度同源分析,推动了蛋白质家族分类、系统发育重建和功能预测等研究的发展。
实际应用
在实际应用中,该数据集可直接用于药物靶点发现、病原微生物快速鉴定和酶工程改造等场景。研究人员可利用其FASTA文件快速建立本地序列库,或借助MMseqs2数据库加速大规模虚拟筛选和序列比对,从而在疫苗设计、耐药性监测和生物技术产品开发中缩短研发周期,提高工作效率。
数据集最近研究
最新研究方向
Dayhoff-MMseqs2数据集顺应了生物信息学领域对大规模蛋白质序列数据库高效检索的迫切需求,通过整合GigaRef与UniRef50数据,并转化为MMseqs2的CPU与GPU友好格式,为高通量序列比对和同源搜索提供了前所未有的便利。其多格式设计不仅提升了存储与计算资源的利用效率,更促进了深度学习模型在蛋白质结构预测与功能注释中的应用,加速了宏基因组学、进化生物学及药物靶点发现等前沿研究的进程。该数据集的发布标志着蛋白质序列数据库向规模化、标准化和可计算化方向迈出了关键一步,对推动计算生物学基础设施建设和开源科学文化具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务