EVA: Benchmark and Experiment Data for RNA Generation and Codon Optimization
收藏资源简介:
This dataset accompanies the EVA (Evolutionary Versatile Architect) paper and contains all benchmark and experiment data for RNA sequence generation and codon optimization tasks. EVA is a 1.4-billion-parameter RNA foundation model capable of species-conditioned, RNA-type-conditioned, and unconditional RNA generation, as well as codon optimization via directed evolution. The dataset is organized into four archives: 1. mrna_codon_optimization.tar.gz mRNA and circular RNA (circRNA) codon optimization results from EVA and baseline models (CodonFM-1B, Evo2-1B, GemoRNA, random synonymous substitution). mRNA targets: linear mRNA (8 CDS variants), HIV-1 gp160, PR8 HA, RABV-G, VZV gE circRNA targets: CAR-T, RABV-G, SARS-CoV-2 (Group-I intron), SARS-CoV-2 (T4 ligase) Each target contains input wild-type sequences, EVA-optimized sequences (with and without Homo sapiens lineage conditioning), and baseline model outputs. All in FASTA format. 2. mrna_6species.tar.gz EVA-generated and natural mRNA sequences for 6 species, benchmarking species-conditioned generation. Species: Homo sapiens, Mus musculus, Rattus norvegicus, Cricetulus griseus, Drosophila melanogaster, Caenorhabditis elegans 1,000 generated mRNA sequences per species (FASTA) and natural reference sequences Metrics: MFE, GC content, k-mer frequency profiles, loop/helix proportions, base-pairing percentages 3. generrna_generation.tar.gz EVA-generated rRNA sequences benchmarked against the GenerRNA database (unconditional generation). 100,000 natural rRNA sequences from GenerRNA (reference) and 1,000-sequence subsample EVA-generated rRNA-like sequences Metrics: k-mer frequency profiles, MFE, GC content, loop/helix proportions, base-pairing percentages 4. generated_rna_sequences.tar.gz EVA-generated RNA sequences spanning 15 RNA biotypes with matched natural controls, benchmarking multi-type controllable generation. RNA biotypes (11): mRNA, lncRNA, circRNA, tRNA, rRNA, miRNA, piRNA, sRNA, snRNA, snoRNA, viral RNA ~200 generated sequences per type (FASTA) and up to 5,000 natural reference sequences per type Metrics: MFE, GC content, k-mer frequency profiles, loop/helix proportions, base-pairing percentages All sequence files are in FASTA format. Metric files are in CSV or NumPy .npz format. This dataset is associated with the EVA paper (preprint forthcoming).Code: https://github.com/yanjiehuang/EVA1



