Tiny OG2 Dataset
收藏资源简介:
这是OpenGenome2数据集的一个经过策划的子集,包含超过100万个DNA样本,涵盖16个类别,拥有超过1850亿个碱基对(BP)标记,覆盖了广泛的生物生命谱系。它旨在复制用于训练Evo2模型的样本分布,但训练示例数量显著减少,适用于知识蒸馏、快速迭代和学术用途。该数据集分为pretrain和midtrain子集,分别适用于短上下文和长上下文训练。
This is a curated subset of the OpenGenome2 dataset, containing over 1 million DNA samples across 16 categories and more than 185 billion base pair (BP) markers, covering a broad spectrum of biological life lineages. It aims to replicate the sample distribution used for training the Evo2 model, albeit with a significantly reduced number of training examples, making it suitable for knowledge distillation, rapid iteration, and academic research. This dataset is divided into pretrain and midtrain subsets, which are respectively tailored for short-context and long-context training.
数据集概述:Tiny OG2
Tiny OG2 是 OpenGenome2 数据集的一个精心挑选的子集,专为知识蒸馏、快速迭代和学术研究设计。
核心特征
- 样本规模:包含超过 100 万个 DNA 样本。
- 数据量:总计超过 1850 亿碱基对(BP)令牌,约 185B BP tokens。
- 类别覆盖:涵盖 16 个类别,代表广泛的生物生命领域。
- 设计目的:旨在复现用于训练 Evo2 模型的样本分布,但训练样本量显著减少。
数据集划分
数据集分为两个子集,适用于不同的训练场景:
- Pretrain (预训练子集)
- 包含约 1060 亿(106B)BP tokens。
- 适用于短上下文训练。
- 包含以下 9 个类别:
| 类别 | 令牌数 | 样本权重 | 备注 |
|---|---|---|---|
| eukaryotic_genic_windows | 90B | 35% | 5K BP 拼接的令牌窗口。 |
| gtdb_v220_imgpr | 3.5B | 18% | 基因组分类数据库 (GTDB) + IMG/PR 数据。 |
| imgvr_untagged | 468M | 3% | IMG/VR 病毒序列。 |
| metagenomes | 11B | 24% | MGD 数据库宏基因组。 |
| mrna | 196M | 9% | 真核生物 mRNA (来自 Ensembl, NCBI)。 |
| mrna_splice_promoter | 312M | 9% | 拼接序列。 |
| ncrna | 17M | 2% | 非编码 RNA (来自 RNAcentral, Rfam, Ensembl, NCBI)。 |
| organelle | 422M | 0.5% | 多种细胞器基因组。 |
| promoters | 119K | 0.02% | 真核生物启动子数据库 (EPDnew)。 |
- Midtrain (中训练子集)
- 包含约 800 亿(80B)BP tokens。
- 适用于长上下文训练。
- 包含以下 7 个类别:
| 类别 | 令牌数 | 样本权重 | 备注 |
|---|---|---|---|
| gtdb_v220_stitched | 2B | 13% | GTDB 中标记为“长”的序列。 |
| imgpr_long | 18M | 13% | IMG/PR 中标记为“长”的样本。 |
| ncbi_genomes_animalia | 43B | 40% | 动物界完整基因组。 |
| ncbi_genomes_chromista | 630M | 0.9% | 色素界完整基因组。 |
| ncbi_genomes_fungi | 3.6B | 4% | 真菌界完整基因组。 |
| ncbi_genomes_plantae | 29B | 27% | 植物界完整基因组。 |
| ncbi_genomes_protista | 567M | 0.9% | 原生生物界完整基因组。 |
代码仓库
用于加载和处理该数据集的代码位于:https://github.com/andrewdalpino/TinyOG2




