遇见数据集

AIRI-Institute/genatator-gene-finding-dataset

收藏
Hugging Face2026-06-03 更新2026-06-14 收录
官方服务:

资源简介:

genatator-gene-finding-dataset是一个核苷酸级别的数据集,用于训练和评估DNA语言模型进行从头基因发现。该数据集专为长上下文基因组建模设计:每个样本是一个连续的基因组块,每个核苷酸都有对齐的标签,描述转录本边界和基因内信号。数据集包含mRNA/蛋白质编码转录本异构体和lncRNA转录本异构体的注释,并保留了所有选定转录本异构体的信息,而不仅仅是每个基因的单个代表性转录本。这使得它适用于异构体感知的基因发现、转录本边界预测以及在多个转录本异构体重叠的基因组区域中的评估。每个样本包含三个字段:dna_sequence(DNA序列)、targets(目标矩阵)和metadata(元数据)。数据集分为训练集、验证集和测试集:训练集包含多物种训练数据(人类训练染色体和其他哺乳动物基因组),验证集包含人类保留验证染色体,测试集包含完整的T2T人类基因组测试分割。每个样本是一个基因组块,最大长度为10,000,000个核苷酸,目标矩阵包含12个核苷酸级别通道,前6个通道用于所有选定转录本异构体,后6个通道仅用于mRNA/蛋白质编码异构体。数据集还提供了详细的统计信息、多物种覆盖范围(包括39个哺乳动物组装)以及加载和使用示例。

genatator-gene-finding-dataset is a nucleotide-level dataset for training and evaluating DNA language models on ab initio gene finding. The dataset is designed for long-context genomic modeling: each example is a contiguous genomic block, and each nucleotide has aligned labels describing transcript boundary and intragenic signal. The dataset contains annotations for both mRNA/protein-coding transcript isoforms and lncRNA transcript isoforms. Importantly, it retains information about all selected transcript isoforms, not only a single representative transcript per gene. This makes it suitable for isoform-aware gene finding, transcript-boundary prediction, and evaluation in genomic regions where multiple transcript isoforms overlap. Each sample contains exactly three fields: dna_sequence, targets, and metadata. The dataset is organized into three splits: train (multispecies training data including human training chromosomes and additional mammalian genomes), validation (human held-out validation chromosomes), and test (complete T2T human genome test split). Each sample is a genomic block with a maximum length of 10,000,000 nucleotides. The target matrix includes 12 nucleotide-level channels: the first six channels are for all selected transcript isoforms (combined mRNA/protein-coding and lncRNA), and the last six channels are for mRNA/protein-coding isoforms only. The dataset also provides detailed statistics, multispecies coverage (including 39 mammalian assemblies), and examples for loading and usage.

提供机构:
AIRI-Institute
搜集汇总
数据集介绍
AIRI-Institute/genatator-gene-finding-dataset 数据集图片
构建方式
该数据集以染色体为单位进行构建,首先对每一条完整的参考染色体进行核苷酸级别的目标标注,进而将整条染色体切分为长度不超过10兆碱基对、互不重叠的连续基因组区块,每个区块作为一条独立样本存储为Parquet格式文件。训练集涵盖人类及38种哺乳动物的基因组,并严格划分出人类保留染色体作为验证集,独立的人类T2T完整基因组则构成测试集,从而在跨物种与跨参考基因组层面评估模型的外推能力。
使用方法
可通过Hugging Face datasets库的load_dataset函数直接加载,利用metadata字段中的genome与chrom信息按物种或染色体进行过滤筛选,基于start字段升序拼接同一染色体的连续区块即可重构完整染色体。训练时需将核苷酸级标签按token化器的偏移映射转换为token级标签,推荐使用每个token覆盖核苷酸的最大目标值作为该token的标签,以保持边界与基因内信号的真实性。
背景与挑战
背景概述
genatator-gene-finding-dataset是一个面向核苷酸级别基因预测的专用数据集,由相关研究机构构建,旨在为DNA语言模型提供长上下文基因组建模的训练与评估资源。该数据集创建于大规模基因组注释需求日益增长的背景下,核心研究问题聚焦于从头基因预测中转录本边界的精确识别以及基因内部信号的表征。数据集涵盖了39个哺乳动物物种的基因组信息,包括人类hg38和T2T完整基因组,保留了所有选定的转录本异构体注释,而非仅保留单一代表性转录本。这一设计使其在理解不同物种间基因结构保守性、异构体多样性以及长距离基因调控机制方面具有重要价值,为基因组学与人工智能交叉领域提供了关键的数据支撑,推动了从头基因预测方法从单物种向多物种、从单一转录本向异构体感知范式的演进。
当前挑战
该数据集面临的核心挑战在于解决从头基因预测领域长期存在的技术瓶颈,即如何从原始DNA序列中无参考地精确识别转录起始位点、多聚腺苷酸化信号及基因内部区域,尤其是在多个转录本异构体重叠的复杂基因组区间。此外,构建过程中亦遭遇多重困难:一是处理长度达千万碱基级别的基因组区块时,需保证核苷酸级标签与DNA序列的精确对齐;二是整合多物种基因组数据时,需统一异质的转录本注释标准并处理非标准核苷酸字符;三是设计能够同时建模mRNA与lncRNA异构体的多通道目标矩阵,以兼顾预测的全面性与特异性。数据集还要求模型具备对长程基因组依赖关系的建模能力,这在计算资源和模型架构层面构成了显著挑战。
常用场景
经典使用场景
该数据集专为核苷酸级别的从头基因发现任务而设计,是训练和评估DNA语言模型的核心资源。每个样本均以连续基因组区块的形式呈现,并附有与DNA序列精确对齐的12通道标签矩阵,涵盖转录起始位点、polyA信号及基因内区域信息。研究者可利用其进行全转录本异构体感知的基因预测,同时支持mRNA与lncRNA的联合或分离建模,为长上下文基因组建模提供了理想基准。
解决学术问题
该数据集有效解决了传统基因注释中依赖单一代表性转录本导致的异构体信息丢失问题,保留所有选定转录本的完整注释。其多物种训练数据与独立的人类T2T测试集,为评估跨物种泛化能力和长程基因结构预测提供了严谨基准。研究可深入探究基因组DNA序列与转录边界信号间的映射关系,推动对转录起始与终止调控机制的定量理解。
实际应用
在实际应用中,该数据集可用于开发直接从基因组序列预测全转录组注释的计算工具,辅助人类遗传病致病位点的功能解析,以及非编码RNA的精准鉴定。基于该数据训练的模型能应用于新测序物种的基因结构快速注释,尤其在缺乏高质量转录组数据的非模式生物中发挥关键作用,显著提升基因组解读效率。
数据集最近研究
最新研究方向
该数据集聚焦于从头基因预测领域的前沿探索,通过提供核苷酸级别的多物种基因组注释,支持长上下文DNA语言模型对转录起始位点、多聚腺苷酸化信号及基因内区域进行精准预测。其核心突破在于保留了所有选定转录本异构体(包括mRNA与lncRNA)的全量信息,而非仅依赖单一代表性转录本,从而赋能异构体感知的基因发现研究。数据集涵盖39个哺乳动物基因组,训练集规模达97.36Gbp,并完整包含T2T人类基因组作为独立测试集,为评估模型在复杂重复区域与跨参考基因组上的泛化能力提供了严苛基准。这一资源直接响应了当前基因组学中长序列建模与多转录本解析的迫切需求,有望推动DNA基础模型在疾病位点挖掘、非编码RNA功能注释等热点领域取得突破性进展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务