遇见数据集

ELF-NET: 15M Dark and Annotated Protein Sequences for GPLM Training

收藏
Zenodo2026-02-28 更新2026-05-26 收录
官方服务:

资源简介:

Curated protein sequence subsets from the TARA-Oceans (+ other datasets) algaGPT-filtered sequence project for training Genomic Protein Language Models (GPLMs). Contains ~15M dark proteins (no Pfam-A domain annotation) and ~15M annotated proteins (with Pfam-A hits), each split 90/10 into train and holdout sets. Pfam-A hmmsearch result tables are included for annotated sequences. Dark/annotated classification is based on hmmsearch against Pfam-A 36.0 across 2,044 TARA-Oceans eukaryotic metagenome-assembled assemblies.

提供机构:
Zenodo
创建时间:
2026-02-28
二维码
社区交流群
二维码
科研交流群
商业服务