遇见数据集

AIRI-Institute/genatator-gene-segmentation-dataset

收藏
Hugging Face2026-06-03 更新2026-06-14 收录
官方服务:

资源简介:

genatator-gene-segmentation-dataset 是一个核苷酸级别的基因分割数据集,专为训练和评估DNA语言模型及相关序列模型在转录本结构预测任务上而设计。该数据集旨在实现转录本架构的生物学详细重建,并支持在从头基因注释背景下的基准测试。每个样本代表一个注释的转录本,并提供核苷酸分辨率的标签,描述转录本的组织结构,包括5非翻译区(5 UTR)、外显子、内含子、3非翻译区(3 UTR)和编码序列(CDS)。数据集包含三个配置:train-human(人类训练数据)、train-multi-specie(多物种训练数据)和val-human(人类验证数据)。所有配置均保留所有基因的所有注释转录本,未应用转录本级别的截断,这支持转录本级别的分割研究,同时允许在多异构体设置中进行基因级别评估。每个样本包含四个字段:dna_sequence(DNA序列)、labels(标签)、metadata(元数据)和status(状态)。数据集适用于训练DNA语言模型、微调预训练的基因组基础模型、基准测试核苷酸级别和基因结构感知的分割方法、评估从仅人类到多物种训练的泛化能力、研究蛋白质编码和长非编码转录本的分割,以及在保留每个基因多个转录本异构体的设置中评估模型。

genatator-gene-segmentation-dataset is a nucleotide-level gene segmentation dataset designed for training and evaluating DNA language models and related sequence models on transcript structure prediction. The dataset targets biologically detailed reconstruction of transcript architecture and supports benchmarking in the context of ab initio gene annotation. Each example represents one annotated transcript and provides nucleotide-resolution labels describing transcript organization, including 5 untranslated region (5 UTR), exon, intron, 3 untranslated region (3 UTR), and coding sequence (CDS). The repository contains three configurations: train-human, train-multi-specie, and val-human. In the current version of the dataset, all configurations retain all annotated transcripts for all genes. No transcript-level truncation is applied. This design supports transcript-level segmentation studies while also enabling gene-level evaluation in multi-isoform settings. Each sample contains exactly four fields: dna_sequence, labels, metadata, and status. It is intended for training DNA language models for transcript segmentation, fine-tuning pretrained genomic foundation models, benchmarking nucleotide-level and gene-structure-aware segmentation methods, evaluating generalization from human-only to multispecies training, studying segmentation of both protein-coding and long non-coding transcripts, and evaluating models in settings where multiple transcript isoforms per gene are retained.

提供机构:
AIRI-Institute
搜集汇总
数据集介绍
AIRI-Institute/genatator-gene-segmentation-dataset 数据集图片
构建方式
该数据集以核苷酸分辨率构建,专为训练与评估DNA语言模型对转录本结构的预测能力而设计。数据来源涵盖人类及39种哺乳动物基因组组装,通过全长度保留所有基因的注释转录本,确保每条序列及其对应的标签(包括5'UTR、外显子、内含子、3'UTR及CDS)完整无截断。数据集划分为三个配置:人类训练集(排除第8、20、21号染色体)、多物种训练集(扩展至多种哺乳动物)以及人类验证集(包含第20号染色体用于最终评估)。每条样本包含DNA序列、核苷酸级标签、元数据字符串及代表转录本状态标识,其中状态字段通过最长编码区或最长外显子累积长度规则筛选代表性转录本。
使用方法
用户可通过Hugging Face的`datasets`库便捷加载数据,使用`load_dataset`函数指定配置名称(如'train-human')即可获取训练或验证集。每条样本以字典形式呈现,可直接访问`dna_sequence`、`labels`、`metadata`及`status`字段。对于需要单一代表性转录本的场景,可调用`filter(lambda x: x['status'] == 1)`进行过滤。推荐评估方案为使用验证集中的第20号染色体数据,并保留所有转录本以计算基因级别指标。数据集的标签为嵌套数值数组,形状为序列长度×5类(5UTR、exon、intron、3UTR、CDS),可直接用于逐核苷酸预测任务的监督学习。
背景与挑战
背景概述
该数据集由AIRI-Institute于近期创建,聚焦于核苷酸级别的基因分割任务,旨在为DNA语言模型及序列模型提供转录本结构预测的训练与评估基准。核心研究问题在于如何从原始DNA序列中精准重建转录本的完整结构,包括5'非翻译区、外显子、内含子、3'非翻译区以及编码序列。数据集提供了人类单物种及涵盖39种哺乳动物的多物种配置,特别保留了基因的所有注释转录本,支持多异构体场景下的基因级评估。其发布为基因组学领域引入了一个标准化、高分辨率的转录本分割基准,有望推动从头基因注释和长序列建模技术的进步。
当前挑战
数据集所解决的领域挑战在于,传统基因注释方法难以在核苷酸层面实现对转录本结构的精细分割,尤其是面对多异构体基因和长非编码RNA时。构建过程中,研究者需确保来自不同物种和组装的转录本数据在格式与注释上高度一致,同时平衡数据完整性与计算效率。此外,设计一个能够反映基因多样性的评估协议,如保留所有注释转录本进行基因级度量,而非仅依赖代表性转录本,对模型泛化能力提出了更高要求。这些挑战共同指向如何构建一个既生物学严谨又便于机器学习应用的标准化基准。
常用场景
经典使用场景
在基因组学与计算生物学的交汇处,genatator-gene-segmentation-dataset为核苷酸级别的基因分割任务提供了璀璨的舞台。这一数据集的核心价值在于,它被精心设计用于训练和评估DNA语言模型及序列模型,以精准预测转录本的精细结构。研究人员可将其作为基准,开展从头基因注释的深入研究,通过逐核苷酸的标签映射,揭示5'非翻译区、外显子、内含子、3'非翻译区以及编码序列等关键区域的组织模式。无论是推动长上下文建模的前沿探索,还是实现完整转录本结构的重构,该数据集都以其全面的转录本保留策略,为生物学意义上严谨的外显子-内含子架构分析奠定了坚实基础。
解决学术问题
该数据集直面转录本结构预测中的核心学术挑战,特别是针对多异构体基因的复杂性提供了解决方案。在以往的研究中,单个基因的多个转录变异体常被简化处理,导致对基因表达调控多样性的理解存在偏差。通过保留所有注释转录本并引入代表性转录本标识字段,该数据集有力支持了异构体感知的模型训练与评估,推动了基因层级度量指标的发展。其跨物种配置(涵盖39种哺乳动物)则消除了模型泛化能力不足的瓶颈,使得研究者能够探索从单一物种到多物种迁移学习范式下的分割方法,为理解进化保守性与物种特异性转录调控机制开辟了新路径。
实际应用
在现实世界的应用图景中,genatator-gene-segmentation-dataset推动了精准医学与功能基因组学的蓬勃发展。基于该数据集训练的模型可被部署于临床基因诊断流程中,自动化识别致病性变异所影响的转录本区域,例如在癌症基因组分析中精确界定外显子跳跃或非翻译区突变。在药物研发领域,它助力于长链非编码RNA的批量注释,揭示以往被忽视的调控元件在疾病通路中的角色。此外,该数据集还可服务于农业遗传改良项目,通过对经济物种(如牛、羊、猪)的全基因组转录本分割,加速优良性状相关基因的定位与功能解析。
数据集最近研究
最新研究方向
基因转录本结构预测与多物种泛基因组分割模型的跨物种泛化研究
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务