遇见数据集

OmniGenBench

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

OmniGenBench 是一个基因组学基准测试数据集集合,包含多个经过质量筛选的子数据集,每个子数据集针对特定的基因组学任务。这些任务包括长非编码RNA(lncRNA)预测、polyA 位点识别、启动子强度预测、剪接位点(供体和受体)预测、转座元件(TE)预测以及终止子强度预测。数据集中涉及的物种包括大豆(Glycine max)、木薯(Manihot esculenta)、高粱(Sorghum bicolor)、番茄(Solanum lycopersicum)、小麦(Triticum aestivum)、玉米(Zea mays)、拟南芥(Arabidopsis thaliana)、莱茵衣藻(Chlamydomonas reinhardtii)、蒺藜苜蓿(Medicago truncatula)、水稻(Oryza sativa indica 和 japonica 亚群)以及红三叶草(Trifolium pratense)。每个子数据集包含训练、验证和测试三个分割,数据以 CSV 格式(压缩为 .gz)提供。部分子数据集的验证集和测试集使用相同文件,而转座元件预测子数据集有独立的验证集。该数据集适用于开发和评估基因组序列分析相关的机器学习模型。

OmniGenBench is a collection of genomics benchmark datasets, containing multiple quality-filtered sub-datasets each targeting specific genomics tasks. These tasks include long non-coding RNA (lncRNA) prediction, polyA site recognition, promoter strength prediction, splice site (donor and acceptor) prediction, transposable element (TE) prediction, and terminator strength prediction. The species involved in the dataset include Glycine max, Manihot esculenta, Sorghum bicolor, Solanum lycopersicum, Triticum aestivum, Zea mays, Arabidopsis thaliana, Chlamydomonas reinhardtii, Medicago truncatula, Oryza sativa (indica and japonica subspecies), and Trifolium pratense. Each sub-dataset contains three splits: training, validation, and testing, with data provided in CSV format (compressed as .gz). Some sub-datasets share the same file for validation and testing sets, while the transposable element prediction sub-dataset has an independent validation set. This dataset is suitable for developing and evaluating machine learning models related to genomic sequence analysis.

创建时间:
2026-07-28
原始信息汇总

OmniGenBench 数据集概述

数据集简介

OmniGenBench 是一个基准测试套件集合,本仓库包含经过质量标准筛选的 OmniGenBench 数据集子集,用于高质量基因组基准数据集。

数据集配置

该数据集包含 21 个配置(config),每个配置对应一个独立的基因组学任务,涵盖三大类任务:

长链非编码RNA(lncRNA)预测

  • lncrna_g_maxlncrna_m_esculentalncrna_s_bicolorlncrna_s_lycopersicumlncrna_t_aestivumlncrna_z_mays(共 6 个物种)

多聚腺苷酸化(poly A)位点预测

  • poly_a_arabidopsis_thalianapoly_a_chlamydomonas_reinhardtiipoly_a_medicago_truncatulapoly_a_oryza_sativa_indica_grouppoly_a_oryza_sativa_japonica_grouppoly_a_trifolium_pratense(共 6 个物种)

启动子强度预测

  • promoter_strength_leafpromoter_strength_protoplast(共 2 个组织类型)

剪接位点预测

  • splicing_arabidopsis_thaliana_acceptorsplicing_arabidopsis_thaliana_donor(共 2 个剪接位点类型)

转座元件(TE)预测

  • te_prediction_arabidopsiste_prediction_rice(共 2 个物种)

终止子强度预测

  • terminator_strength_leafterminator_strength_protoplast(共 2 个组织类型)

数据划分

每个配置均包含三个数据划分:

  • 训练集(train):用于模型训练
  • 验证集(validation):用于模型调优,多数配置的验证集数据与测试集相同(共用 *_test.csv.gz 文件),但 te_prediction 系列配置使用独立的验证集文件(*_val.csv.gz
  • 测试集(test):用于模型评估

数据格式

数据以 CSV 压缩文件(.csv.gz) 格式存储,文件名模式为 {配置名}_{划分}.csv.gz

搜集汇总
数据集介绍
OmniGenBench 数据集图片
构建方式
OmniGenBench数据集源自一项综合性的基因组基准测试研究,其构建过程经过精心设计以确保数据的代表性与可靠性。该数据集整合了多类基因组学任务,涵盖长链非编码RNA预测、多聚腺苷酸化位点识别、启动子强度评估、剪接位点鉴定、转座元件预测及终止子强度分析等多个维度。每个子数据集均按照物种或组织类型进行划分,如拟南芥、水稻、玉米等,并采用统一的CSV格式存储,便于处理与分析。数据集的划分策略明确,每个任务均提供独立的训练集、验证集与测试集,以确保模型评估的公正性与可重复性。此外,数据集经过严格的质量筛选,仅保留符合既定标准的样本,从而提升了数据集的整体质量与应用价值。
特点
OmniGenBench数据集的核心特点在于其多任务与多物种的覆盖范围,为基因组学研究提供了全面的基准测试平台。数据集包含21个不同的配置,分别针对不同的基因组特征与物种,如lncRNA预测涵盖6个物种,poly_a位点识别涵盖6个物种,启动子与终止子强度评估则区分不同组织类型。这种多样性使得数据集能够支持广泛的生物学问题研究,从基因表达调控到剪接机制。此外,数据集注重质量把控,所有数据均经过精心筛选,确保标签的准确性与一致性。数据集的规模适中,每个任务的数据量足以训练有效的深度学习模型,同时也便于在计算资源有限的情况下进行快速迭代与验证。其结构化的划分方式与清晰的元数据进一步增强了数据集的可用性与可解释性。
使用方法
使用OmniGenBench数据集时,用户可根据研究目标选择相应的配置,并通过HuggingFace的datasets库轻松加载数据。每个配置对应一个特定的基因组任务,例如`lncrna_g_max`用于长链非编码RNA预测,`promoter_strength_leaf`用于启动子强度评估。加载后,用户可直接获取预划分的训练、验证与测试数据,进而构建与训练机器学习或深度学习模型。数据集格式为CSV,适合与pandas、scikit-learn、PyTorch或TensorFlow等常用工具结合使用。为便于模型评估,建议用户遵循标准的评估协议,例如在独立测试集上计算性能指标。此外,数据集的元数据文件提供了各配置的详细描述,帮助用户快速理解每个任务的具体目标与数据来源,从而更有效地进行实验设计与结果分析。
背景与挑战
背景概述
随着高通量测序技术的迅猛发展,基因组学领域积累了海量的序列数据,如何从这些数据中高效、准确地提取生物学功能信息成为计算生物学的一大挑战。深度学习方法凭借其强大的特征学习能力,在基因组功能预测中展现出巨大的潜力,但模型的性能很大程度上依赖于高质量的基准数据集。OmniGenBench数据集正是为此而生,它由研究团队构建并于近期发布(见arXiv论文2505.14402),旨在提供一个涵盖多种基因组功能预测任务的综合基准套件。该数据集整合了长链非编码RNA(lncRNA)识别、多聚腺苷酸化(poly-A)位点预测、启动子与终止子强度评估、剪接位点识别以及转座元件(TE)预测等多个子任务,跨越多个物种(如拟南芥、水稻、玉米等),为基因组功能预测模型的训练与评估提供了标准化、多任务、跨物种的数据支撑。其发布对于推动基因组深度学习模型的泛化能力研究及生物学机制解析具有重要意义。
当前挑战
OmniGenBench数据集所应对的挑战是多维度的。首先,从领域问题来看,基因组功能预测本身具有极高的复杂性,例如lncRNA的序列特征不显著、剪接位点存在大量假阳性、启动子/终止子强度受多种调控因素影响,这些都需要模型具备捕捉细微序列模式的能力。其次,数据集的构建面临多重困难:不同物种间基因组序列差异大,需要统一的数据处理流程和标注标准;部分任务(如TE预测)的正负样本不平衡、重复序列干扰等问题突出;此外,数据收集需整合多个来源,并确保质量可靠,数据清洗与筛选过程需耗费大量人力。该数据集的发布,为解决这些挑战提供了数据基础,但也对建模方法提出了更高要求,如跨物种泛化、小样本学习及多任务联合建模等。
常用场景
经典使用场景
OmniGenBench作为一个综合性的基因组学基准测试集合,其经典使用场景在于为长非编码RNA(lncRNA)识别、多聚腺苷酸化位点(poly-A)预测、启动子与终止子强度评估、剪接位点识别以及转座元件(TE)预测等核心任务提供标准化的数据支撑。该数据集涵盖多个植物物种,如拟南芥、水稻、玉米等,使研究者能够在统一的评估框架下训练和验证各类基因组学预测模型,从而推动基因组功能元件注释和调控机制解析的深入研究。
解决学术问题
该数据集有效解决了基因组学研究中数据碎片化和标准缺失的问题,为跨物种的基因组功能元件预测提供了统一的基准。通过整合来自不同实验和注释来源的数据,OmniGenBench使得研究者能够公平地比较不同算法的性能,从而推动模型泛化能力的提升。其高质量的数据筛选标准也缓解了噪声数据对模型训练的影响,为揭示基因调控的复杂规律和进化保守性提供了可靠的数据基础,对植物基因组学和计算生物学的发展具有重要意义。
衍生相关工作
基于OmniGenBench数据集,研究者已衍生出多个经典工作,如开发新型深度学习模型用于lncRNA识别和启动子强度预测,以及构建跨物种的基因组功能元件预测工具。这些工作不仅验证了数据集的适用性,还推动了基因组学与人工智能的交叉融合。此外,该数据集也被用于评估大型语言模型在基因组序列理解上的表现,促进了DNA语言模型的发展,为后续的可解释性研究和基因组设计奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务