geneb-tasks
收藏资源简介:
GENEB(基因组嵌入基准)是一个用于评估DNA序列编码器的多任务基准测试数据集,旨在通过预计算的表示和逻辑回归(无需在任务标签上对编码器进行微调)来评估模型在基因组功能预测任务上的性能。该数据集包含13个功能类别共计100个不同的分类任务,涵盖组蛋白修饰、启动子、增强子、DNA甲基化、剪接位点、长链非编码RNA、小鼠增强子、转录因子结合、物种分类、调控元件、病毒/噬菌体、编码/非编码区以及染色质可及性等多个基因组功能领域。每个数据样本包含一个DNA核苷酸序列(由A、C、G、T组成)和一个对应的离散类别标签。数据集严格按照基准测试协议组织,仅提供训练集和测试集划分,用于模型表示能力的离线和少样本评估,评估采用统一的协议,使用逻辑回归作为探针分类器,以马修斯相关系数(MCC)为主要评估指标,并报告准确率(Acc)和F1分数。
GENEB (Genomic Embedding Benchmark) is a multi-task benchmark dataset for evaluating DNA sequence encoders. It aims to assess model performance on genomic function prediction tasks through pre-computed representations and logistic regression (without fine-tuning the encoder on task labels). The dataset includes 100 distinct classification tasks across 13 functional categories, covering various genomic function domains such as histone modifications, promoters, enhancers, DNA methylation, splice sites, long non-coding RNAs, mouse enhancers, transcription factor binding, species classification, regulatory elements, viruses/phages, coding/non-coding regions, and chromatin accessibility. Each data sample consists of a DNA nucleotide sequence (composed of A, C, G, T) and a corresponding discrete class label. The dataset is strictly organized according to benchmark protocols, providing only training and test splits for offline and few-shot evaluation of model representation capabilities. Evaluation follows a unified protocol using logistic regression as a probe classifier, with Matthews Correlation Coefficient (MCC) as the primary metric, and reports accuracy (Acc) and F1 score.
数据集概述
GENEB (Genomic Embedding Benchmark) 是一个多任务基准数据集,用于评估DNA序列编码器。其核心评估协议基于预计算表示和逻辑回归(不对任务标签进行编码器微调),涵盖100个任务,分属13个功能类别。
基本信息
- 语言:英语
- 许可证:Apache-2.0
- 任务类别:文本分类
- 标签:生物学、基因组学、DNA、基准、DNA语言模型
数据记录结构
每条记录包含两个字段:
text:核苷酸序列(DNA,碱基为{A, C, G, T}),具体长度和窗口定义由源任务决定。label:对应检测或预测目标的离散类别标签。
每个任务的数据分为训练集和测试集,分别存储在 train.csv 和 test.csv 文件中。
评估协议
| 项目 | 规范 |
|---|---|
| 任务数量 | 100 |
| 功能类别 | 13 |
| 报告机制 | full(全样本)、10shot(10样本)、1shot(1样本) |
| 评估指标 | MCC(主要指标)、准确率(Acc)、F1分数 |
| 探针模型 | 逻辑回归(max_iter=1000) |
| 随机种子 | 13, 17, 42, 123, 997(取多次运行的平均值) |
参与者需直接使用已发布的数据集划分,不允许重新标注、重新划分或在测试集上进行训练。
任务类别与分布
| 类别 | 任务数 |
|---|---|
| 组蛋白修饰 (Histone Mod.) | 30 |
| 启动子 (Promoters) | 22 |
| 增强子 (Enhancers) | 8 |
| DNA甲基化 (DNA Methyl.) | 8 |
| 剪接位点 (Splice Sites) | 7 |
| 长链非编码RNA (lncRNA) | 6 |
| 小鼠增强子 (Mouse Enh.) | 5 |
| 转录因子结合 (TF Binding) | 5 |
| 物种分类 (Species Clf.) | 3 |
| 调控元件 (Regulatory) | 2 |
| 病毒/噬菌体 (Virus/Phage) | 2 |
| 编码/非编码 (Coding/NC) | 1 |
| 染色质可及性 (Chromatin Acc.) | 1 |
主要配置(子集)示例
数据集包含多个配置(config_name),以下为部分配置及其对应的任务标识符和类别:
| 配置名称 | 任务标识符 | 类别 |
|---|---|---|
NT_H3 |
InstaDeepAI_nucleotide_transformer_downstream_tasks_H3 |
组蛋白修饰 |
NT_promoter_all |
InstaDeepAI_nucleotide_transformer_downstream_tasks_promoter_all |
启动子 |
NT_enhancers |
InstaDeepAI_nucleotide_transformer_downstream_tasks_enhancers |
增强子 |
4mC_A.thaliana_4mC |
deep4mc_A.thaliana_4mC |
DNA甲基化 |
NT-rev_splice_sites_all |
InstaDeepAI_nucleotide_transformer_downstream_tasks_revised_splice_sites_all |
剪接位点 |
GB_human_ensembl_regulatory |
katarinagresova_Genomic_Benchmarks_human_ensembl_regulatory |
调控元件 |
GUE_human_tf_0 |
leannmlindsey_GUE_human_tf_0 |
转录因子结合 |
任务分类说明
数据集中的任务根据其生物学功能进行分类,例如:
- 组蛋白修饰:包括不同类型的组蛋白修饰任务,如
NT_H3、NT_H3K4me3等。 - 启动子:包括不同生物体或不同特征的启动子预测任务,如
NT_promoter_all、iPro_Arabidopsis_NonTATA等。 - 增强子:包括预测增强子及其类型的任务。
- DNA甲基化:包括预测不同位点(如4mC、5mC、6mA)甲基化状态的任务。
- 其他类别:还包括剪接位点、长链非编码RNA、转录因子结合位点、物种分类等多种基因调控相关任务。




