遇见数据集

Thal-Kak_local_db

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

Thal-Kak 本地多序列比对(MSA)和模板数据库是专为蛋白质结构预测工具 Thal-Kak 设计的本地搜索数据库集合。该数据集支持 Thal-Kak 的本地 MSA 模式(如 --msa mmseqs_local、--msa hhblits_local 等)以及本地模板搜索。数据集包含三个主要部分:mmseqs/(5 个 MMseqs2 可扩展轮廓数据库,用于预过滤和扩展比对)、hhblits/(6 个 HH-suite 格式数据库,用于 hhblits 本地搜索)、template/(1 个本地模板搜索快照,包含来自 wwPDB/RCSB PDB 的蛋白质序列、MMseqs2 搜索数据库、mmCIF 结构文件、链元数据表和沉积日期表)。数据规模:总共 12 个归档文件,下载大小约 664 GiB,解压后约 2.31 TiB,加上本地构建的 MMseqs2 搜索索引约 0.97 TiB。适用任务:主要用于蛋白质结构预测中的同源建模和模板搜索,特别是通过 Thal-Kak 管道进行蛋白质结构预测时的本地 MSA 构建和模板识别。许可证:每个档案的许可证不同,包括 CC0 1.0、CC BY 4.0、CC BY-SA 4.0,而 Logan 相关的档案不提供任何许可。

Thal-Kak Local Multiple Sequence Alignment (MSA) and Template Database is a collection of local search databases designed for the protein structure prediction tool Thal-Kak. This dataset supports Thal-Kaks local MSA modes (e.g., --msa mmseqs_local, --msa hhblits_local) and local template search. It consists of three main parts: mmseqs/ (5 MMseqs2 expandable profile databases for pre-filtering and expanded alignment), hhblits/ (6 HH-suite format databases for hhblits local search), and template/ (a snapshot of local template search containing protein sequences from wwPDB/RCSB PDB, MMseqs2 search database, mmCIF structure files, chain metadata table, and deposition date table). Data size: 12 archive files in total, download size ~664 GiB, decompressed ~2.31 TiB, plus locally built MMseqs2 search indices ~0.97 TiB. Applicable tasks: mainly used for homology modeling and template search in protein structure prediction, particularly for local MSA construction and template recognition within the Thal-Kak pipeline. License: Licenses vary per archive, including CC0 1.0, CC BY 4.0, CC BY-SA 4.0, while Logan-related archives are provided without any license.

创建时间:
2026-08-13
原始信息汇总

Thal-Kak 本地 MSA 与模板数据库

数据集概览

该数据集为 Thal-Kak 蛋白质结构预测管道的本地 MSA(多序列比对)搜索模式提供序列与模板数据库,支持 --msa mmseqs_local--msa hhblits_local--msa mmseqs_hhblits_local 以及本地模板搜索功能。

核心信息:

项目 详情
归档数量 12 个(mmseqs 5 个、hhblits 6 个、template 1 个)
总下载量 664 GiB
解压后大小 2.31 TiB,另需在本地构建约 0.97 TiB 的 MMseqs2 搜索索引
压缩格式 zstd(需 zstd 解压)
许可证 按归档混合许可:CC0 1.0 / CC BY 4.0 / CC BY-SA 4.0 / 无授权(Logan)
语言 英语

数据集内容

注意:这些是衍生数据库而非上游镜像。每个归档均经过重新聚类和/或重新格式化,具体变更记录在 LICENSE.txtChanges 部分。

mmseqs/ — MMseqs2 可扩展 profile 数据库

--msa mmseqs_local 搜索。含两层结构:representatives(预过滤扫描目标)与 membersexpandaln 可拉入比对的序列)。.idx 搜索索引不随包分发,需由 install_db.sh 在本地构建。

归档 下载大小 解压大小 本地索引 Representatives Members
uniref100_2026_01.tar.zst 130.3 GiB 211.4 GiB 277.8 GiB 39,312,380 475,217,233
mgnify_clusters.tar.zst 126.9 GiB 202.3 GiB 470.8 GiB 313,067,917 717,738,164
envhog_std.tar.zst 20.7 GiB 36.7 GiB 53.6 GiB 11,742,979 129,896,064
bfd_reduced.tar.zst 18.6 GiB 27.6 GiB 114.7 GiB 51,652,611 65,984,053
logan_human.tar.zst 12.0 GiB 28.1 GiB 73.9 GiB 61,657,544 71,364,503

hhblits/ — HH-suite(FFindex)数据库

--msa hhblits_local 搜索。除 envhog 外,均从对应 MMseqs2 数据库转换而来(cs219 与 hhm profile 本地计算);envhog 为上游自带的 HH-suite 构建。

归档 下载大小 解压大小 聚类数 (cs219) 成员序列数
uniref100.tar.zst 157.2 GiB 1,301.5 GiB 39,312,371 475,217,228
uniref30_2023_02.tar.zst 54.8 GiB 261.2 GiB 36,293,491 330,676,110
mgnify_clusters.tar.zst 33.7 GiB 150.3 GiB 31,779,642 278,185,288
logan_nonhuman.tar.zst 24.2 GiB 55.9 GiB 28,702,814 130,348,747
envhog.tar.zst 4.7 GiB 11.5 GiB 2,203,457 25,550,069
logan_human.tar.zst 0.8 GiB 2.0 GiB 1,645,263 7,385,713

template/ — 本地模板搜索快照

用于 MSA 配置中 template.enable: true 时(两个本地引擎的默认设置)。为 wwPDB/RCSB 快照的重打包版本,包含蛋白质-only seqres FASTA、MMseqs2 搜索数据库、按条目的 gzip mmCIF、链元数据表及沉积日期表。

归档 下载大小 解压大小 截止日期 PDB 条目 蛋白质链 唯一序列
BioMolDB_20260224.tar.zst 80.5 GiB 81.2 GiB 2026-02-24 244,541 1,025,280 178,610

未包含的内容

install_db.sh 还可安装 4 个数据库,这些数据库直接从上游获取,不在本仓库重新分发:

安装命令 获取来源
--family mmseqs uniref30_2302 opendata.mmseqs.org(ColabFold 构建)
--family hhblits bfd storage.googleapis.com/alphafold-databases(完整 BFD)
--family rna rfam EMBL-EBI
--family rna rnacentral EMBL-EBI

需要注意的三种情形:

  • hhblits_local 上的异源多聚体也需要 MMseqs2 uniref30_2302:HH-suite UniRef100 不含分类学信息,多聚体配对委托给 mmseqs,需要该数据库的 db_mapping / db_taxonomy 附属文件。
  • logan_nonhuman 仅以 HH-suite 格式存在:其 MMseqs2 构建解压后达 1.4 TB,未在任何地方发布,此不对称是有意为之。
  • RNA 和 RNP 目标需要 rna 家族:本仓库完全不包含该家族,需从 Rfam 和 RNAcentral 本地构建。

安装说明

使用 install_db.sh(推荐)

安装器会解析归档、下载、验证 SHA-256(对照 install/manifest/databases.tsv)、原子解压、将文件重命名为 db_paths.yaml 期望的布局,并在需要时构建 MMseqs2 .idx。该过程幂等且可断点续传。

bash git clone https://github.com/CSSB-SNU/Thal-Kak.git cd Thal-Kak

先创建并激活项目环境——提供 zstd、aria2c 和 mmseqs

./install_db.sh --family mmseqs # 所有 mmseqs 归档 ./install_db.sh --family mmseqs uniref100_2026_01 # 仅此一个 ./install_db.sh --family hhblits envhog logan_human # 按名称指定多个 ./install_db.sh --family template ./install_db.sh --family all # 全部四个家族 ./install_db.sh --family mmseqs --status # 查看已安装内容

若安装到 <repo>/db 以外的位置,需在运行安装器前编辑 db_paths.yaml——安装器只读取该文件,从不写入。

手动安装

bash pip install -U "huggingface_hub[cli]"

hf download cssbsnu/Thal-Kak_local_db --repo-type dataset --include "hhblits/envhog.tar.zst" "LICENSE.txt" --local-dir ./dl

--include 过滤整个仓库,需将 LICENSE.txt 与归档并列指定,否则下载内容的许可条款会留在 Hub 上。直接使用 hf download <repo> --repo-type dataset 会下载全部内容,无需如此操作。

手动解压可行(zstd -dc <archive> | tar -x -C <dir>),但需自行复现目录布局:每个数据库位于 <family root>/<key>/,内部所有文件从构建时命名重命名为 db(如 UniRef30_2023_02_a3m.ffdatadb_a3m.ffdata)。install_db.sh 会完成重命名,建议优先使用。


磁盘预算

峰值用量高于最终数值,因为归档在解压期间与目标目录并存于磁盘。一次安装一个家族可将额外开销限制为单个归档。

家族 本仓库归档数 安装后大小
hhblits 6 / 7 1.74 TiB(含完整 BFD 为 3.47 TiB)
mmseqs 5 / 6 1.46 TiB(含 uniref30_2302 为 1.82 TiB)
template 1 / 1 81.2 GiB
rna 0 / 2 27.9 GiB(本地构建)

全部四个家族合计:5.40 TiB 安装大小,逐家族安装时峰值约 5.7 TiB。


许可证与署名

Thal-Kak 源代码的 Apache-2.0 许可证不适用于本仓库中的任何内容。 每个归档继承其来源的许可证,不混合来源。权威记录(上游许可证、本仓库授权、署名、引用及具体变更)见 LICENSE.txt

归档 授权许可 来源
mmseqs/uniref100_2026_01hhblits/uniref100 CC BY 4.0 UniProt UniRef100,2026_01 版
hhblits/uniref30_2023_02 CC BY-SA 4.0 UniRef30 2023_02,ColabFold 构建
mmseqs/bfd_reduced CC BY-SA 4.0 BFD 精简子集(经 AlphaFold databases)
mmseqs/mgnify_clustershhblits/mgnify_clusters CC0 1.0 MGnify 蛋白质数据库,2024_04 版
mmseqs/envhog_stdhhblits/envhog CC BY 4.0 EnVhogDB
mmseqs/logan_humanhhblits/logan_humanhhblits/logan_nonhuman 无授权 Logan v1(SRA 截止 2023-12-10)
template/BioMolDB_20260224 CC0 1.0 wwPDB / RCSB PDB,2026-02-24 快照

三个容易忽略的要点:

  • Logan 归档无任何许可授权:其分发方未施加任何许可工具,故本仓库不授予任何权利,也不对您使用或再分发该数据的权利做任何陈述,仅按 LICENSE.txt 第 6 条所复制的 NCBI 通知传递。
  • 不授权管道的输出:运行产生的比对或模板文件包含所搜索数据库的材料,本仓库对此不主张任何权利。
  • 两个上游许可主张存在争议uniref30_2302bfd_reduced):争议详情已写入 LICENSE.txt,本仓库对再分发内容遵循更严格的许可主张。

本仓库所有内容均按 "AS IS,无任何担保" 提供,无论上游提供方还是本仓库均不作任何适用性声明。


引用

引用您所用归档对应的上游数据库,各条目在 LICENSE.txt 中带有 Cite 行。管道本身的引用请见 Thal-Kak 仓库

搜集汇总
数据集介绍
Thal-Kak_local_db 数据集图片
构建方式
在生物分子结构预测领域,本地多序列比对与模板搜索依赖于高质量序列库的预处理与整合。Thal-Kak_local_db 由 Thal-Kak 流水线维护团队构建,将 UniRef100、MGnify、EnVhog、BFD 还原子集、Logan 以及 BioMolDB 等上游资源重新聚类、重格式化并打包为十二个压缩归档。每个归档均经 zstd 压缩,并配套提供 install_db.sh 安装脚本,由其完成校验、原子化解压、文件重命名及 MMseqs2 索引本地构建,确保与 db_paths.yaml 约定的目录布局严格一致。
特点
该资源库面向蛋白与核酸结构预测,涵盖 MMseqs2 可扩展 profile 数据库、HH-suite FFindex 数据库及本地模板搜索快照。全部归档下载体积达 664 GiB,解压后占用 2.31 TiB,并需在本地额外构建约 0.99 TiB 的 MMseqs2 搜索索引。各归档独立承载来源许可证,涵盖 CC0 1.0、CC BY 4.0、CC BY-SA 4.0 及无授权授予的 Logan 数据,且保存了每项来源的变更记录与引用信息,便于合规使用与学术溯源。
使用方法
使用者应通过 Thal-Kak 仓库提供的 install_db.sh 脚本获取数据库,而非手动下载解压。克隆仓库并激活项目环境后,可依 --family mmseqs、--family hhblits、--family template 或 --family all 选择性安装,亦可指定具体归档名称。安装前若需变更存储位置,应预先编辑 db_paths.yaml。运行本地 MSA 时,分别以 --msa mmseqs_local、--msa hhblits_local 或 --msa mmseqs_hhblits_local 指定搜索模式,并在配置中启用 template.enable 以调用模板搜索。
背景与挑战
背景概述
蛋白质与核酸序列的多重比对及结构模板检索,历来是计算生物学与生物大分子结构预测流程中的基础性环节,其覆盖广度与序列深度直接决定了下游建模的成败。Thal-Kak_local_db 由首尔国立大学计算结构生物学研究团队(CSSB-SNU)于 2026 年前后构建,旨在为 Thal-Kak 结构预测流水线的本地 MSA 模式提供可离线部署的序列与模板检索数据库。该数据集汇聚 UniRef100、UniRef30、MGnify、EnVhogDB、BFD 及 Logan 等多源序列资源,并纳入以 2026 年 2 月快照为准的 BioMolDB 模板库,以跨源整合与再聚类的方式回应本地化、大规模比对数据库的可用性需求。其发布为生物分子结构预测中的数据检索一致性、可复现性与数据主权问题提供了可资借鉴的实践范式。
当前挑战
该数据集所回应的核心问题,在于生物分子结构预测中多重序列比对与模板检索对数据库覆盖度与计算可及性的双重依赖。具体挑战体现于三个层面:数据库来源高度异质,不同档案在许可条款、序列冗余度与分类信息完整度上参差不齐,其中 Logan 档案未获明确授权,UniRef30 与 BFD 子集存在上游许可争议,给数据的合法传播与整合带来不确定性;构建过程采取本地重建与再聚类策略,需在数百 GiB 压缩档案与逾二 TiB 解压容量之间平衡存储开销,并依赖本地构建 MMseqs2 索引以弥补检索效率损失;HH-suite 与 MMseqs2 格式间的信息不对称,使同源多聚体配对与 RNA 类靶标检索需跨库协作或本地另行构建,进一步加剧了流程配置的复杂度。
常用场景
经典使用场景
在生物分子结构预测领域,多序列比对与模板搜索构成同源建模与深度学习方法的关键前置环节。Thal-Kak_local_db正是为Thal-Kak流水线的本地搜索模式量身定制的序列与模板数据库集合,涵盖MMseqs2可扩展轮廓数据库、HH-suite的FFindex数据库以及本地模板检索快照。研究者可通过`--msa mmseqs_local`、`--msa hhblits_local`等指令,在本地环境中对目标蛋白序列执行高效的同源序列检索与模板匹配,从而为后续的结构预测任务提供稳健的进化信息与结构参照。
解决学术问题
该数据集有效缓解了结构生物信息学中长期存在的几类研究困境:其一,依赖远程在线数据库检索常受网络带宽与服务器负载制约,难以支撑大规模批量计算;其二,不同来源数据库在版本与格式上的异质性增加了流水线集成的复杂度;其三,本地部署时数据库的坐标系、索引构建与文件命名规范往往缺乏统一标准。Thal-Kak_local_db通过预聚类、格式重整以及配套安装脚本,实现了数据库的一致化封装与原子化部署,为可重复、可扩展的结构预测研究奠定了数据基础。
衍生相关工作
围绕该数据集衍生的经典工作主要体现在Thal-Kak流水线本身及其所整合的数据库生态之中。Bae等人提出的Thal-Kak框架揭示了生物分子结构预测器中的采样-选择鸿沟,而该数据库为其本地搜索模式提供了核心数据支撑。此外,ColabFold所构建的UniRef30、AlphaFold数据库中的BFD缩减子集、以及MGnify、EnVhogDB等来源的整合,均构成了该数据集在方法学演进中的重要脉络,推动了本地化结构预测工具的持续发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务