ELF-NET: 15M Dark and Annotated Protein Sequences for GPLM Training
收藏官方服务:
资源简介:
Curated protein sequence subsets from the TARA-Oceans (+ other datasets) algaGPT-filtered sequence project for training Genomic Protein Language Models (GPLMs). Contains ~15M dark proteins (no Pfam-A domain annotation) and ~15M annotated proteins (with Pfam-A hits), each split 90/10 into train and holdout sets. Pfam-A hmmsearch result tables are included for annotated sequences. Dark/annotated classification is based on hmmsearch against Pfam-A 36.0 across 2,044 TARA-Oceans eukaryotic metagenome-assembled assemblies.
提供机构:
Zenodo创建时间:
2026-02-28



