遇见数据集

GUE_v2

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

GUE_v2 是一个多物种基因组分类数据集的集合,源自 GUE (v2) 并经过质量标准筛选,旨在提供高质量、精选的基因组基准数据集。该数据集包含多个子集(配置),每个子集对应一个特定的基因组分类任务,涵盖了表观遗传修饰预测(如 H3、H3K14ac、H3K36me3 等)、不同细胞系(如 GM12878、HUVEC、HeLa-S3、IMR90、K562、NHEK)的表观遗传状态分类、小鼠基因组分类(mouse_0 至 mouse_4)、启动子区域识别(包括 300bp 启动子和核心启动子,以及含 TATA 盒和不含 TATA 盒的变体)以及转录因子结合位点预测(tf_0 至 tf_4)等多种任务。每个子集的数据以 CSV 格式提供,并划分为训练集、验证集和测试集,便于机器学习模型的训练与评估。

GUE_v2 is a collection of multi-species genome classification datasets, derived from GUE (v2) and filtered by quality standards, aiming to provide a high-quality, curated genomic benchmark dataset. The dataset contains multiple subsets (configurations), each corresponding to a specific genome classification task, covering epigenetic modification prediction (e.g., H3, H3K14ac, H3K36me3, etc.), epigenetic state classification in different cell lines (e.g., GM12878, HUVEC, HeLa-S3, IMR90, K562, NHEK), mouse genome classification (mouse_0 to mouse_4), promoter region identification (including 300bp promoter and core promoter, as well as variants with and without TATA box), and transcription factor binding site prediction (tf_0 to tf_4). Data for each subset is provided in CSV format and divided into training, validation, and test sets, facilitating machine learning model training and evaluation.

创建时间:
2026-07-28
原始信息汇总

GUE_v2 数据集详情

数据集概述

GUE_v2 是一个多物种基因组分类数据集的集合,源自 GUE (v2),经过质量筛选后收录于高质量策展的基因组基准数据集中。

数据集结构

该数据集包含 32 个子配置(config),每个配置对应一个基因组分类任务,均包含 训练集(train)、验证集(validation)和测试集(test) 三个数据划分,文件格式为 CSV.GZ 压缩文件。

配置分类

  • 表观遗传标记(EMP_*,共10个):EMP_H3、EMP_H3K14ac、EMP_H3K36me3、EMP_H3K4me1、EMP_H3K4me2、EMP_H3K4me3、EMP_H3K79me3、EMP_H3K9ac、EMP_H4、EMP_H4ac。
  • 细胞系表观遗传(EPI_*,共6个):EPI_GM12878、EPI_HUVEC、EPI_HeLa-S3、EPI_IMR90、EPI_K562、EPI_NHEK。
  • 小鼠相关(mouse_*,共5个):mouse_0 至 mouse_4。
  • 启动子区域(prom_*,共6个):prom_300_all、prom_300_notata、prom_300_tata、prom_core_all、prom_core_notata、prom_core_tata。
  • 转录因子(tf_*,共5个):tf_0 至 tf_4。

文件组织

每个子配置下包含三个文件:

  • {配置名}_train.csv.gz:训练集
  • {配置名}_val.csv.gz:验证集
  • {配置名}_test.csv.gz:测试集

此外,仓库根目录还包含一个元数据文件 GUE_v2_metadata.json

搜集汇总
数据集介绍
GUE_v2 数据集图片
构建方式
GUE_v2数据集是在基因组学与深度学习交叉领域背景下构建的综合性多物种基因组分类基准。该数据集源于GUE(v2)的原始版本,并经过严格的质量筛选,以确保数据的高质量和代表性。其构建方式采用模块化设计,每个子数据集独立存储,且根据不同的基因组特征划分为训练集、验证集和测试集。具体涵盖表观遗传修饰(EMP)、细胞系特异性开放染色质(EPI)、小鼠基因组(mouse)、启动子区域(prom)及转录因子结合位点(tf)等类别,每个类别下又细分为多个具体任务,如针对不同组蛋白修饰位点或启动子类型的分类。这种结构便于研究者针对特定基因组问题进行专项训练与评估。
特点
GUE_v2数据集的特点鲜明,其多物种覆盖性尤为突出,不仅包含人类多种细胞系(如GM12878、HUVEC、K562等),还囊括了小鼠基因组数据,为跨物种的基因组功能研究提供了宝贵资源。数据集细分子任务丰富,例如启动子分类根据TATA盒的有无进行区分,表观遗传修饰任务则针对多种组蛋白修饰进行细化,这有助于深入探索不同调控元件的功能。此外,数据均以CSV格式存储,并经过压缩处理,便于使用与传输。每个子数据集都已预先划分好训练集、验证集和测试集,且划分比例合理,确保了模型评估的客观性和可复现性。
使用方法
使用GUE_v2数据集时,研究者可通过HuggingFace的datasets库直接加载不同配置的子数据集。首先,根据研究目标确定具体的config_name,例如使用'EMP_H3'或'prom_300_all',然后通过load_dataset函数指定路径和配置即可获取数据。每个配置对应独立的CSV文件,格式统一,易于解析。数据既可用于传统机器学习模型的训练与测试,也适用于基于深度学习的基因组序列分析任务。建议在使用前详细阅读数据集元数据(GUE_v2_metadata.json),以了解各子数据集的详细信息和推荐的使用方式。此外,数据集的模块化结构允许研究者灵活地组合不同子任务,进行多任务学习或迁移学习研究。
背景与挑战
背景概述
GUE_v2数据集由多物种基因组分类数据集构成,源自2023年发布的研究成果(arXiv:2306.15006),由致力于基因组基准测试质量筛选的研究团队创建。该数据集整合了人类与小鼠的多种表观遗传标记、启动子及转录因子相关序列,旨在为基因组功能元件的预测提供标准化基准。其构建初衷在于弥补现有基因组数据集在物种多样性、标注一致性及评估协议上的不足,为深度学习模型在基因组学中的应用提供可靠的大规模训练与验证资源,对推动基因组调控机制的解析及计算生物学方法的发展具有重要影响。
当前挑战
该数据集面临的挑战涉及多个层面。领域层面,基因组调控元件的精确识别(如启动子、增强子及组蛋白修饰位点)是计算生物学中的核心难题,其序列特征复杂、物种间差异显著,对模型的泛化能力提出严苛要求。构建过程中,需处理多源数据整合的异质性、跨物种标注的统一性,并确保训练/验证/测试集划分的严谨性,避免数据泄漏。此外,高维基因组数据的存储与高效加载,以及平衡各子任务(如不同组蛋白标记或细胞系)的数据分布,亦是设计者们必须克服的技术障碍。
常用场景
经典使用场景
GUE_v2数据集作为基因组学领域的大规模多物种基准,广泛用于评估和训练深度学习模型在DNA序列分类任务上的性能。该数据集涵盖了组蛋白修饰、染色质可及性、启动子识别及转录因子结合等多种基因组功能元件的预测任务,每个子集都提供了独立的训练、验证和测试划分,便于模型进行严格的性能验证和跨物种泛化测试,是基因组语言模型(如DNABERT、Genomic Transformer)进行预训练和微调的重要资源。
解决学术问题
该数据集系统性地解决了基因组序列功能注释中缺乏标准化、高质量基准的问题,尤其在多任务和多物种场景下。它提供了统一的数据划分和评价口径,使得不同模型间的性能比较变得公平可信,推动了基因组深度学习领域从孤立任务向综合能力评估的转变。通过涵盖表观遗传修饰和调控元件的多样任务,GUE_v2促进了模型对基因组语义深层理解的研究,显著增强了我们对非编码区域功能和调控机制的认识。
衍生相关工作
基于GUE_v2衍生了一系列重要的研究工作,包括开发更强大的基因组基础模型,如改进版的DNABERT-2和Nucleotide Transformer,这些模型利用该基准进行预训练和评估。同时,催生了针对长序列处理的架构创新,如引入状态空间模型或线性注意力机制来高效处理基因组级上下文。在方法层面,还涌现了多任务学习框架和可解释性分析工具,用于解析模型注意力与功能元件之间的关联,进一步深化了对基因组语言的理解,推动了该领域的持续演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务