Dayhoff-MMseqs2
收藏资源简介:
该数据集包含原始Dayhoff Atlas中的GigaRef和UniRef50数据集,并将其转换为适合MMseqs2 CPU和GPU工具使用的格式。原始Atlas的训练集、验证集和测试集被合并,提供以下数据集:GigaRef No Singletons(无单例簇的GigaRef数据集)、GigaRef Singletons(仅含单例簇的GigaRef数据集)、GigaRef Full(包含所有序列的完整GigaRef数据集)以及UniRef50(在50%序列同一性水平上聚类的UniProt数据集)。每个数据集提供以下格式:FASTA(标准序列存储格式,适用于多种生物信息学工具)、MMseqs2-CPU(转换后的未索引数据库文件夹,兼容MMseqs2-CPU,搜索可通过分割适应系统内存)和MMseqs2-GPU(转换后的填充序列数据库,用于MMseqs2-GPU搜索,需要至少一个GPU)。数据集文件组织在fastas/、mmseqs-cpu/和mmseqs-gpu/目录下。FASTA文件为压缩格式(.fasta.gz),MMseqs数据库文件也以压缩形式提供。各数据集的下载大小和提取后所需磁盘空间、内存建议及GPU要求已在README中详细列出。该数据集适用于蛋白质序列搜索、聚类和分析等生物信息学任务。
This dataset contains the GigaRef and UniRef50 datasets from the original Dayhoff Atlas, converted into formats suitable for MMseqs2 CPU and GPU tools. The training, validation, and test sets of the original Atlas are merged to provide the following datasets: GigaRef No Singletons (GigaRef dataset without singleton clusters), GigaRef Singletons (GigaRef dataset containing only singleton clusters), GigaRef Full (complete GigaRef dataset containing all sequences), and UniRef50 (UniProt dataset clustered at 50% sequence identity). Each dataset is available in the following formats: FASTA (standard sequence storage format, suitable for various bioinformatics tools), MMseqs2-CPU (converted unindexed database folder, compatible with MMseqs2-CPU, search can be adapted to system memory by splitting), and MMseqs2-GPU (converted padded sequence database for MMseqs2-GPU search, requiring at least one GPU). Dataset files are organized into fastas/, mmseqs-cpu/, and mmseqs-gpu/ directories. FASTA files are in compressed format (.fasta.gz), and MMseqs database files are also provided in compressed form. The download size, required disk space, memory recommendations, and GPU requirements for each dataset are detailed in the README. This dataset is suitable for bioinformatics tasks such as protein sequence search, clustering, and analysis.
Dayhoff FASTA 和 MMseqs2 数据库数据集概述
数据集简介
该数据集包含原始 Dayhoff Atlas 中的 GigaRef 和 UniRef50 数据集,并以适合 MMseqs2 CPU 和 GPU 工具使用的格式提供。原始数据集的训练集、验证集和测试集被合并,形成以下可用数据子集:
- GigaRef No Singletons:不含单例聚类的 GigaRef 数据集
- GigaRef Singletons:仅含单例聚类的 GigaRef 数据集
- GigaRef Full:包含上述两个子集中所有序列的完整集合
- UniRef50:UniProt 按 50% 序列一致性聚类得到的数据集
每个数据集提供三种格式:
- FASTA:标准序列存储格式,兼容多种生物信息学工具
- MMseqs2-CPU:经转换的未索引数据库文件,适用于 MMseqs2-CPU,可调整拆分以适应系统内存
- MMseqs2-GPU:经填充的序列数据库,适用于 MMseqs2-GPU 搜索,需要至少 1 个 GPU
仓库结构
fastas/ ├── gigaref-full.fasta.gz ├── gigaref-singletons.fasta.gz ├── gigaref-no-singletons.fasta.gz └── uniref50.fasta.gz
mmseqs-cpu/ ├── gigaref-singletons/db/ ├── gigaref-no-singletons/db/ └── uniref50/db/
mmseqs-gpu/ ├── gigaref-singletons/db_gpu/ ├── gigaref-no-singletons/db_gpu/ └── uniref50/db_gpu/
资源需求表
| 制品 | 下载大小 | 工作磁盘 | 主机内存 | GPU |
|---|---|---|---|---|
| GigaRef full FASTA | 358.90 GB | 358.90 GB(压缩态) | 不适用 | 无 |
| GigaRef singleton FASTA | 147.28 GB | 147.28 GB(压缩态) | 不适用 | 无 |
| GigaRef no-singleton FASTA | 211.62 GB | 211.62 GB(压缩态) | 不适用 | 无 |
| UniRef50 FASTA | 13.27 GB | 13.27 GB(压缩态) | 不适用 | 无 |
| UniRef50 CPU MMseqs | 14.97 GB | 约 28 GB 解压后 | 建议 32 GB;更低内存可通过拆分实现 | 无 |
| UniRef50 GPU MMseqs | 15.29 GB | 约 28 GB 解压后 | 建议 32 GB;更低内存可通过拆分实现 | 至少一个兼容 MMseqs2-GPU 的 NVIDIA GPU |
| GigaRef singleton CPU MMseqs | 182.49 GB | 约 387 GB 解压后 | 64 GB 起点(配合拆分);400+ GB 可获得最大吞吐 | 无 |
| GigaRef singleton GPU MMseqs | 189.12 GB | 约 395 GB 解压后 | 64 GB 起点(配合拆分);400+ GB 可获得最大吞吐 | 至少一个兼容 MMseqs2-GPU 的 NVIDIA GPU;数据库无需适配 VRAM |
| GigaRef no-singleton CPU MMseqs | 279.08 GB | 解压后 572.73 GB;解压时预留 647 GB | 64 GB 起点(配合拆分);600+ GB 可获得最大吞吐 | 无 |
| GigaRef no-singleton GPU MMseqs | 292.13 GB | 解压后 586.94 GB;解压时预留 660 GB | 64 GB 起点(配合拆分);600+ GB 可获得最大吞吐 | 至少一个兼容 MMseqs2-GPU 的 NVIDIA GPU;数据库无需适配 VRAM |
使用说明
- 建议将解压后的 MMseqs 数据库及临时搜索目录放在最快的本地 SSD 或 NVMe 上;I/O 速度、内存和 GPU 可提升吞吐,较慢的存储会显著增加搜索时间。
- FASTA 文件可直接被 MMseqs 读取(
.fasta.gz格式),无需解压即可使用。 - 解压 FASTA 可使用
pigz -dc "fastas/$TARGET.fasta.gz" > "fastas/$TARGET.fasta"。 - 解压 MMseqs CPU/GPU 数据库需对其中的
.gz文件逐一解压。 - 搜索时可通过
--split-mode 0和--split-memory-limit参数调整内存使用,GPU 搜索需添加--gpu 1。
关键说明
- 有效的 FASTA 目标包括:
gigaref-full、gigaref-singletons、gigaref-no-singletons、uniref50;CPU 和 GPU MMseqs 目标包括:gigaref-singletons、gigaref-no-singletons、uniref50。 - UniRef50 和单例数据库直接基于已发布的合并 FASTA 构建,序列标识符一致;no-singletons FASTA 与 MMseqs 数据库包含相同的 18 亿序列语料,但 FASTA 使用
gr_<source-index>标识符,而现有 MMseqs 数据库保留较旧的g<part>_<row>标识符,该差异不影响推理结果。




