遇见数据集

OmniGene-4-bio

收藏
Hugging Face2026-07-11 更新2026-07-12 收录
官方服务:

资源简介:

OmniGene-4-bio数据集是论文《Biological Continued Pretraining Reshapes the Capability Profile of a Foundation Model Without Catastrophic Forgetting》的再分析成果,旨在评估基础模型在生物领域持续预训练(BioCPT)后的能力变化。数据集包含对Gemma-4-26B-A4B(一种混合专家模型)在四个能力轴上的详细评估输出:从指令调优的基础模型到生物领域持续预训练(BioCPT),再到监督微调(SFT)。数据内容涵盖通用知识问答(MMLU、ARC、HellaSwag、TruthfulQA)、代码生成(HumanEval、MBPP)以及生物信息学任务(BixBench、protein-homology),并包含GSM8K数学问题的思维链行为诊断记录。数据集以JSON格式提供每个检查点在每个任务上的详细输出,以及人类可读的总结表格(Markdown格式)。标题数据显示,BioCPT在MMLU、MBPP和BixBench-TF任务上显著提升性能,同时缩短思维链长度,表明模型在获得生物领域能力的同时未发生灾难性遗忘。该数据集适用于研究持续预训练、模型能力评估、生物信息学NLP任务以及混合专家模型的行为分析。

The OmniGene-4-bio dataset is a reanalysis outcome from the paper Biological Continued Pretraining Reshapes the Capability Profile of a Foundation Model Without Catastrophic Forgetting, designed to evaluate the capability changes of foundation models after biological continued pretraining (BioCPT). It includes detailed evaluation outputs for the Gemma-4-26B-A4B (a mixture-of-experts model) across four capability axes: from instruction-tuned base models to BioCPT, and then to supervised fine-tuning (SFT). The data covers general knowledge QA (MMLU, ARC, HellaSwag, TruthfulQA), code generation (HumanEval, MBPP), bioinformatics tasks (BixBench, protein-homology), and includes chain-of-thought behavior diagnostics for GSM8K math problems. The dataset provides detailed outputs for each checkpoint on each task in JSON format, along with human-readable summary tables (Markdown format). Title data shows that BioCPT significantly improves performance on MMLU, MBPP, and BixBench-TF tasks while reducing chain-of-thought length, indicating no catastrophic forgetting as the model gains biological domain capabilities. This dataset is suitable for research on continued pretraining, model capability evaluation, bioinformatics NLP tasks, and behavior analysis of mixture-of-experts models.

创建时间:
2026-07-06
原始信息汇总

数据集概述:OmniGene-4-bio

该数据集是论文“Biological Continued Pretraining Reshapes the Capability Profile of a Foundation Model Without Catastrophic Forgetting”的重新分析产物,专注于评估一个Gemma-4-26B-A4B(MoE)模型在生物持续预训练(BioCPT)和后续监督微调(SFT)过程中的能力变化。

核心内容

数据集包含模型在不同检查点(checkpoint)下的逐示例评估输出和汇总表格,覆盖四个能力轴:指令微调基线(instruction-tuned base)、生物持续预训练(BioCPT)、监督微调(SFT)。具体文件如下:

  • 逐任务输出results/*.json 文件,涵盖通用任务(MMLU、ARC、HellaSwag、TruthfulQA)、编码任务(HumanEval、MBPP)的评估结果。
  • 生物任务输出bioLL_<tag>__<task>.json 文件,针对BixBench和蛋白质同源性(protein-homology)任务的鲁棒对数似然评估。
  • 思维链诊断cot_<tag>.json 文件,记录GSM8K任务的生成过程(链长、回溯、模糊表述、最终答案及正确性)。
  • 可读汇总表PHASE1_*.md 文件(每个轴独立)、PHASE1_SUMMARY.md(统一发现)。
  • 论文材料paper/ 目录包含LaTeX源码及PDF。

标签(Tags)说明

数据集中包含四种检查点标签:

  • base_it_orig:原始指令微调基线
  • base_it-bio:生物领域指令微调基线
  • biocpt:生物持续预训练模型
  • biocpt_sft:生物持续预训练后经监督微调的模型

关键性能结果(Headline)

以下为各检查点在不同任务上的核心指标:

能力轴 基线(指令微调) BioCPT BioCPT+SFT
MMLU(5-shot) 0.646 0.776 0.635
MBPP pass@1(3-shot) 0.332 0.630 0.348
BixBench-TF MCC 0.232 0.924 0.361
思维链平均长度 108.8 64.4 125.8

数据集来源与许可

注意事项

数据集仅包含模型输出和评分,不重新分发任何原始基准数据(所有源基准均为公开资源)。

搜集汇总
数据集介绍
OmniGene-4-bio 数据集图片
构建方式
OmniGene-4-bio数据集基于对Gemma-4-26B-A4B混合专家模型在生物持续预训练(BioCPT)与监督微调(SFT)链路中的能力演变进行系统性重分析而构建。其核心构建方式为:收集模型在四个能力维度(通用、编码、生物、推理)上的逐样本评估输出与汇总统计,并以结构化JSON格式存储每项检查点(包括指令微调基座、BioCPT中间态及SFT最终态)在MMLU、HellaSwag、BixBench等公开基准上的推理结果,同时整合思维链诊断记录,形成多阶段能力剖析档案。
特点
该数据集最显著的特点在于其细粒度的多重能力剖面刻画与跨阶段对比分析能力。它不仅涵盖传统基准测试的评估分数,更深入到逐样本输出与生成过程行为层面,例如GSM8K任务中记录了思维链长度、回溯频率及修饰语使用等元信息。数据集内嵌了BixBench等生物领域专用基准的鲁棒性评估结果,使得模型在生物知识保留与通用能力保持之间的权衡得以透明呈现。此外,所有数据均源自公开基准,未涉及任何商业或受保护数据,确保了复现与二次分析的合法性。
使用方法
研究者可通过加载`results/`目录下的JSON文件直接获取特定检查点在任意任务上的生成结果与评估分数,例如使用Python的`json`模块解析`<tag>__<task>.json`以进行模型能力分析。如需快速浏览各能力轴的整体表现,可参阅`PHASE1_*.md`文档中的汇总表格。对于需要深入探究思维链行为的场景,`cot_<tag>.json`文件提供了包含链长、正确性等字段的记录,便于开展模型推理路径的质量评估。该数据集适合作为生物NLP领域持续预训练策略的基准分析工具。
背景与挑战
背景概述
OmniGene-4-bio数据集由华中科技大学王亮团队于近期创建,专注于探究生物领域持续预训练(BioCPT)对大型语言模型能力分布的影响,核心研究问题在于验证生物领域的持续训练是否能在提升生物任务性能的同时,避免灾难性遗忘,即不损害模型在通用和编码等非生物任务上的原有能力。该数据集以Gemma-4-26B-A4B混合专家模型为基线,系统比较了指令微调基座、生物持续预训练及有监督微调三个阶段的性能变化,为大型语言模型在科学领域的微调策略提供了关键评估基准,对生物信息学与模型治理领域具有重要影响力。
当前挑战
数据集面临的挑战主要来自两方面。在领域问题层面,生物信息学任务要求模型在理解专业序列与结构的基础上做出精准推理,传统通用评估框架难以捕捉生物领域的细微能力变化,而现有模型在生物任务上的性能与通用任务之间存在显著权衡。在构建过程中,挑战包括如何设计精确的类自然语言评估协议以适应生物数据的独特格式,避免模型在持续训练中利用捷径导致表面分数提升,以及如何构建覆盖多种推理与任务类别的详细分析体系,确保评估结果的统计可靠性与泛化性。
常用场景
经典使用场景
OmniGene-4-bio 作为生物信息学领域专注于能力重分析的数据集,常用于评估和比较大型语言模型在生物持续预训练(BioCPT)前后的表现变化。其经典使用场景包括在多个能力轴线上(如通用知识、代码生成、生物推理和思维链行为)对模型进行零样本或少样本评估,进而揭示持续预训练如何重塑基础模型的能力轮廓,而不会引发灾难性遗忘。研究者可通过该数据集复现论文中的关键实验,检验生物学领域适应性训练对模型综合性能的优化效果。
衍生相关工作
OmniGene-4-bio 衍生了一系列经典研究工作,包括其核心论文中提出的训练无关重分析方法,以及基于Gemma-4-26B-A4B MoE架构的生物持续预训练策略。相关代码与检查点(如BioCPT checkpoint)已被开源社区广泛复现,并催生了若干后续探索,如结合混合专家模型与数据为中心AI的领域适应新范式,以及在更多生物子任务(如RNA结构预测)上验证CPT效果的扩展实验。这些工作共同推动了大型语言模型在生物信息学领域应用边界的拓展。
数据集最近研究
最新研究方向
在生物信息学与自然语言处理交叉领域,OmniGene-4-bio数据集聚焦于大规模语言模型的生物持续预训练策略,揭示其在不引发灾难性遗忘的前提下重塑模型能力图谱的机制。该研究围绕Gemma-4-26B-A4B专家混合架构,通过四个能力维度的系统再分析,验证了生物域持续预训练(BioCPT)在MMLU、MBPP及BixBench等基准上带来的显著性能跃升,同时伴随思维链推理链长的优化,为构建领域专用基础模型提供了理论支撑与实践范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务