extHomFam-mix-sep v37.0: structural benchmark for protein multiple sequence alignments (downsampled the largest 121 families)
收藏资源简介:
This dataset contains a selection of the 121 largest families (all with 100k+ sequences) from https://zenodo.org/records/15883613. Each family is downsampled to 100, 200, 300, 400, 500, 700, 1k, 1.5k, 2k, 3k, 5k, 7k, 10k, 15k, 20k, 30k, 50k, 70k, 100k sequences. Directory structure 0: families – 121 families with only reference sequences. mix.faa – mix of all the sequences in families directory. 100: families – 121 families, each composed of reference sequences and 100 randomly selected sequences from the whole family. mix.faa – mix of all the sequences in families directory. 200: families – 121 families, each composed of reference sequences and 200 randomly selected sequences from the whole family. mix.faa – mix of all the sequences in families directory. ... 100000: families – 121 families, each composed of reference sequences and 100000 randomly selected sequences from the whole family. mix.faa – mix of all the sequences in families directory. references – reference sequences for 121 families.



