遇见数据集

Borzoi_Predictor_GAME

收藏
Hugging Face2026-07-02 更新2026-07-03 收录
官方服务:

资源简介:

Borzoi_Human_20260506-022639_PDT是一个基因组学数据集,遵循GAME Schema v1.0数据模式规范。该数据集与GitHub上的Genomic API for Model Evaluation项目相关联,旨在为基因组学模型的评估提供标准化数据支持。数据来源于Linder等人于2025年发表在《自然·遗传学》(Nature Genetics)上的相关研究,主要面向人类基因组分析任务,适用于机器学习模型在基因组学领域的性能评估与基准测试。

Borzoi_Human_20260506-022639_PDT is a genomics dataset that adheres to the GAME Schema v1.0 data model specification. It is associated with the Genomic API for Model Evaluation project on GitHub, aiming to provide standardized data support for the evaluation of genomics models. The data originates from related research by Linder et al. published in Nature Genetics in 2025, primarily focused on human genome analysis tasks, and is suitable for performance evaluation and benchmarking of machine learning models in the genomics field.

创建时间:
2026-07-01
原始信息汇总

数据集概述:Borzoi_Predictor_GAME

该数据集关联于 Borzoi 预测器,采用 GAME(Genomic API for Model Evaluation)模式,版本为 v1.0。更多信息可访问上述 GitHub 仓库,原始研究发表于 Linder 等人 2025 年的 Nature 论文。

搜集汇总
数据集介绍
Borzoi_Predictor_GAME 数据集图片
构建方式
Borzoi_Predictor_GAME数据集旨在为基因组学领域的深度学习模型评估提供标准化接口。该数据集基于Borzoi模型(一种预测基因表达与染色质状态的深度学习框架)构建,通过整合人类基因组注释与实验验证数据,形成了严格的评估基准。其构建遵循GAME(Genomic API for Model Evaluation)协议v1.0,确保数据格式与接口规范的统一性。开发者依托GitHub平台发布代码与示例,并引用Linder等人于2025年发表于《自然·遗传学》的原始研究作为参考,从而支持可复现的模型性能比较。
特点
该数据集的核心特性在于其标准化与可扩展性。通过GAME协议,Borzoi_Predictor_GAME定义了清晰的输入输出格式,允许研究人员快速集成不同模型并进行公平对比。数据集涵盖人类基因组的多模态特征,包括序列、表观遗传信号及表达谱,适用于评估模型在基因调控预测任务中的泛化能力。其版本命名(Borzoi_Human_20260506-022639_PDT)体现了时间戳与组织级别的细致标注,便于追踪数据迭代。此外,开源社区维护的GitHub仓库提供了完整文档与示例代码,降低了使用门槛。
使用方法
使用该数据集时,用户需通过GAME协议提供的API接口加载数据,并调用Borzoi模型进行预测。具体操作包括:从GitHub仓库下载最新的数据包,按照README中的版本说明配置环境(推荐Python 3.8+与PyTorch框架);利用预定义的DataLoader加载基因组坐标与特征矩阵;执行模型推理后,输出结果将自动与标准评估指标(如Pearson相关系数)对齐。示例代码和训练-测试划分方案已在仓库中开源,确保用户能复现Linder等人研究中的基准实验。
背景与挑战
背景概述
Borzoi_Predictor_GAME是一个面向基因组学领域的高性能预测模型基准数据集,创建于2025年,由de Boer实验室主导开发,依托于Linder等人在《自然·遗传学》上发表的研究成果。该数据集聚焦于从DNA序列中预测基因表达调控模式,旨在解决传统实验方法通量有限、成本高昂的瓶颈。其核心研究问题在于如何通过深度学习模型精确捕捉非编码区变异对转录活性的影响,从而推动精准医学与功能基因组学的交叉进展。作为GAME(Genomic API for Model Evaluation)计划的一部分,该数据集通过对大规模人类基因组数据的系统化标注与标准化评估流程,为模型的可重复性验证提供了权威基准,显著提升了计算基因组学在调控机制解析中的可靠性。
当前挑战
在领域问题层面,该数据集致力于应对基因调控预测中的高维非线性挑战,包括识别远端增强子与启动子间的长程互作,以及区分功能变异与非功能多态性,这些任务因基因组稀疏性和噪声干扰而尤为复杂。在构建过程中,面临三大技术挑战:其一,跨细胞类型和时间维度的数据异质性导致标签一致性难以保证,需要整合多组学数据并消除批次效应;其二,模型对长序列上下文依赖的建模需求对计算资源形成严峻压力,需设计高效的注意力机制或冗余压缩策略;其三,实验变异的功能验证通量低,使得金标准样本收集缓慢,迫使团队采用半监督学习与迁移学习来扩充训练池。
常用场景
经典使用场景
Borzoi_Predictor_GAME数据集专为基因组序列功能预测而设计,其经典使用场景在于评估和验证深度学习模型对基因表达调控机制的预测能力。研究人员可借助该数据集,输入DNA序列以预测组织特异性基因表达水平、染色质可及性以及转录因子结合位点等关键分子表型。该数据集整合了人类基因组的高通量实验数据,为模型训练提供了丰富且高质量的标签信息,从而支持对基因调控网络的精细刻画。在生物信息学与计算基因组学领域,Borzoi_Predictor_GAME已成为基准测试平台,广泛应用于比较不同模型架构的预测性能,推动对非编码区功能元件与疾病关联变异的功能解读。
解决学术问题
该数据集着力解决基因组学中序列到功能映射的预测瓶颈,传统实验手段难以大规模注释非编码区变异的功能效应。Borzoi_Preditor_GAME通过标准化接口将复杂的高通量测序数据转化为可供机器学习模型直接利用的训练样本,从而量化DNA序列如何通过染色质状态和转录调控影响基因表达。这一资源有效回应了从序列变异到表型差异的因果推断难题,为揭示基因调控中断与疾病发病机制之间的关联提供了计算工具。其科学意义在于加速了精准医学背景下非编码区致病突变的鉴定进程,并为构建全基因组功能图谱奠定了数据基础,深刻影响了调控基因组学的研究范式。
衍生相关工作
自Borzoi_Preditor_GAME发布以来,其催生了一系列衍生性学术工作。围绕该数据集,研究者开发了多种增强型预测模型,如引入注意力机制的深度架构以捕获长程调控相互作用,以及基于迁移学习的跨物种基因组功能注释方法。数据层面,后续工作扩展了其涵盖的细胞类型与实验条件,生成了更为多样的多组学对齐数据集。在评估基准方面,学者构建了针对不同变异类型(如SNP、indel、结构变异)的功能影响评测框架,直接衍生自GAME接口的设计理念。这些工作不仅提升了模型在罕见病基因发掘中的精度,还推动了可解释性人工智能在基因组学中的应用,使得深度学习预测与生物学机制解读之间的关联更加透明且可靠。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务