dnagpt/OmniGene-4-bio
收藏搜集汇总
数据集介绍

构建方式
OmniGene-4-bio数据集源自一项针对26B参数的混合专家模型(Gemma-4-26B-A4B)的持续预训练研究。研究者首先对该模型的指令微调基座进行生物学领域的持续预训练(BioCPT),随后通过监督微调(SFT)构建了完整的模型谱系。为探究数据混合对能力轮廓的因果影响,研究团队在固定训练配方下,通过调整生物学数据占比(0%、5%、20%、50%)和组成类型(蛋白质/DNA消融)开展了七组对照实验。此外,在GPT-2小规模模型上实施匹配计算量的因果探针实验,并跨2.3B至26B的十倍参数量级验证了结果的鲁棒性。所有评估均基于MMLU、BixBench、同源检测等公开基准,确保完全可复现。
特点
该数据集的核心特色在于系统性揭示了生物学持续预训练不会引发灾难性遗忘,反而能提升模型在非生物学维度的表现,而后续的监督微调则缩小了能力范围,形成持续预训练提升、监督微调收窄的分工格局。通过控制数据混合比例,发现50%生物学内容仅使通用指标下降不足1.2个百分点,而生物学能力持续单调提升,两者不存在权衡关系。组成消融实验进一步表明,DNA数据最擅长提升远程同源检测能力,蛋白质数据则最利于BixBench任务,不同类型科学数据选择性地放大相应能力。路由机制分析显示,在有限训练预算下能力塑造与路由重组是可分离的机制。
使用方法
用户可通过HuggingFace数据集页面直接访问OmniGene-4-bio中的每个检查点的逐示例输出结果。复现实验时,需使用lm-evaluation-harness 0.4.12版本,参照提供的脚本运行通用评估(如MMLU、ARC、HellaSwag)、代码评估(MBPP)、生物学对数似然评估(BixBench、同源检测)及思维链行为诊断。对于黑威尔(sm_120)架构,需启用分组矩阵乘法保护机制。结构化复现流程包括:利用prepare_pools.py对数据源进行分词预处理,通过run_cpt_mix.py执行指定混合比例的QLoRA持续预训练,再使用bt2_load.py重建完整模型,最后分别运行run_eval.py和run_eval_bio.py完成通用与生物学能力评测。
背景与挑战
背景概述
OmniGene-4-bio数据集由华中科技大学王亮研究团队于2026年创建,聚焦于探索科学数据组成对基础模型能力塑造的机制。该数据集以Gemma-4-26B-A4B混合专家模型为基底,系统研究了持续预训练中生物数据配比如何影响模型在通用、编码、推理和生物学等维度的能力分布。研究开创性地提出了CPT提升、SFT收窄的分工假说,并通过控制实验揭示了数据混合比例是一种可控且不损害通用能力的杠杆,能够定向放大特定科学能力,为数据驱动的模型能力工程提供了全新范式。该成果对理解基础模型的能力塑造机制和科学数据的高效利用具有深远影响。
当前挑战
该数据集面临的核心挑战在于解耦数据组成与模型能力之间的因果机制。首先,在大规模混合专家模型中,持续预训练是否会引发灾难性遗忘是领域核心问题,OmniGene-4-bio发现生物CPT不仅不遗忘反而提升通用能力,但这一结论需要在小规模模型中验证其鲁棒性。其次,数据构建中需要精确控制文本与生物数据的配比、词汇扩展的影响以及不同生物数据类型(蛋白质/DNA)的差异化效果,构建过程面临成分消融实验的高计算代价和路由机制与能力塑造的可分离性难题。此外,在10倍参数规模范围内验证模式一致性时,小模型在困难任务上存在能力天花板效应,增加了因果推断的噪声。
常用场景
经典使用场景
OmniGene-4-bio数据集的核心经典用途在于支撑生物领域基础模型的持续预训练(Continued Pretraining)研究,其为验证科学数据配比如何塑造大语言模型能力轮廓提供了关键实验载体。该数据集包含经过精心设计的生物文本(如蛋白质与DNA序列信息)混合语料,允许研究者在固定训练计算预算下,通过调整数据中生物文本的比例(0%至50%),系统性地观察模型在通用能力、编码能力、推理能力以及生物学专项评估指标上的变化。尤为重要的是,该数据集配套了完整的脚本流水线,使得从混合数据池的构建到模型训练、评估与复现的全过程均高度透明可复现,成为探究领域数据增强与灾难性遗忘之间微妙平衡的标杆数据资源。
衍生相关工作
基于OmniGene-4-bio数据集及其配套实验框架,已衍生出一系列重要的后续工作与研究方向。首先是关于路由机制与能力表征可分离性的探讨:研究揭示了在充分训练预算下,能力塑造与路由网络重组(router divergence)之间存在可分离的机制,这激发了对稀疏专家模型(MoE)内部信息流与专家分配策略的深入探索。其次是对模型规模鲁棒性的验证工作,将主要实验结果推广至2.3B至26B的10倍参数尺度范围,证实了数据配比效应的跨规模稳健性。此外,显式回放控制实验的阴性结果——即回放机制并未恢复已由均匀混合确保的通用能力——推动了对于‘无遗忘即无需回放’原则的重新审视,也启发了一些沿着数据去重与高质量精选方向的研究探索。
数据集最近研究
最新研究方向
前沿研究聚焦于探索科学数据配比作为基础模型能力塑造机制的核心作用,尤其是在生物信息学持续预训练(CPT)场景下的实证分析。该研究以26B参数的混合专家模型Gemma-4为基座,通过系统性控制数据混合比例(0-50%生物文本占比)与组成成分(蛋白/DNA消融)发现,生物领域CPT不仅不会引发灾难性遗忘,反而在通用能力(如MMLU提升至0.776)与生物学任务(BixBench MCC达1.000)上呈现同步提升效应,且数据配比可在保持通用性能稳定的前提下精准调控专业能力图谱。进一步在小模型(GPT-2 124M)与跨尺度(2.3B至26B)的鲁棒性验证中揭示了能力塑造的分层机制:全参数CPT通过路由重组(JS散度从0.219升至0.451)实现能力涌现,而轻量级LoRA微调下的能力提升则与路由机制解耦,表明数据组成是一种独立于模型架构的、可控制的能力塑造杠杆。该工作为破解专业领域持续预训练中的能力权衡难题提供了因果证据,对构建兼具通用性与专业性的下一代生物医学基础模型具有范式革新意义。
以上内容由遇见数据集搜集并总结生成



