遇见数据集

continual-finetuning

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

该数据集为持续微调实验结果集合,旨在研究大型语言模型在植入虚假信念后,继续训练对该信念的保留或纠正效果。数据涵盖多个实验场景:Brexit(英国脱欧)、Cannabis(大麻法)、EM(安全代码评估)和 Capitals(首都知识)。每个场景包含多个微调轮次(如 brexit_v1 至 brexit_final),每个轮次包含若干实验分支(arm),每个分支采用不同的训练配方(如继续微调虚假数据、真实数据、无关数据等)。主要评估指标包括:logP(false) − logP(true) 信念度量、对数概率相对于基线的变化、MMLU 能力测试以及不安全代码发生率。数据规模:Brexit 最终轮包含 14 个分支,评估了 161 个保留样本和 500 个训练语料信念样本以及 1140 个 MMLU 项目;Cannabis 最终轮包含 6 个分支,评估了 158 个保留样本和 500 个训练样本。适配器权重仅保留在 brexit_final 中(14 个 LoRA 权重)。实验结果表明:持续训练不会擦除植入的信念,且纠正不足;无害虚假信念不会导致不安全行为,而有害数据则显著增加不安全代码生成。该数据集适用于研究持续微调、信念修正、遗忘效应以及模型安全性评估。

This dataset is a collection of continual fine-tuning experimental results, designed to study the retention or correction of implanted false beliefs in large language models after further training. It covers multiple experimental scenarios: Brexit, Cannabis, EM (Safety Code Evaluation), and Capitals (Capital Knowledge). Each scenario includes multiple fine-tuning rounds (e.g., brexit_v1 to brexit_final), each containing several experimental arms with different training recipes (e.g., continual fine-tuning on false data, true data, irrelevant data). Key evaluation metrics include: logP(false) − logP(true) belief measure, change in log probability relative to baseline, MMLU ability test, and unsafe code generation rate. Data scale: The final Brexit round has 14 arms, evaluating 161 held-out samples, 500 training corpus belief samples, and 1140 MMLU items; the final Cannabis round has 6 arms, evaluating 158 held-out samples and 500 training samples. Adapter weights are only retained in brexit_final (14 LoRA weights). Experimental results show that continual training does not erase implanted beliefs and correction is insufficient; harmless false beliefs do not lead to unsafe behavior, while harmful data significantly increases unsafe code generation. This dataset is suitable for research on continual fine-tuning, belief revision, forgetting effects, and model safety evaluation.

创建时间:
2026-08-25
原始信息汇总

数据集概述:continual-finetuning

该数据集(false-facts-finetuning/continual-finetuning)记录了针对大型语言模型进行的“持续微调”实验的完整结果、图表与适配器。实验的核心问题是:先通过微调向模型植入一个错误信念,再在其基础上继续训练,观察原始信念的存留情况。

许可证

  • MIT 许可证

仓库结构

按不同微调语料库(数据集)进行分类,每个数据集的目录结构包含:

  • <dataset>/:按轮次组织的实验文件夹(例如 _v1_v2_final 等),每轮代表对一组实验分支(arms)的一次训练。
  • *_adapters/:每轮、每个实验分支对应的 LoRA 权重。目前所有轮次的适配器已同步至新的公共模型仓库 continual-finetuning-adapters,建议优先从新仓库加载。当前数据集中仅保留 brexit_final 的适配器。

核心实验内容

下表总结了不同实验文件夹的用途与核心测量指标:

文件夹 轮次/模型 分支数 测量内容
brexit/brexit_final 27B 模型,2026-08-25 14 核心实验:基于 161 个保持集(held-out)信念对与 500 个训练集信念对的 logP(false) − logP(true) 差值,并包含 1140 项 MMLU 评估
cannabis/cannabis_final 27B 模型,2026-08-26 6 实验 2:在另一个虚假法律信念(大麻法)上验证实验结论的普适性
em/em_final EM 评估,2026-08-26 8 安全对照实验:对比不安全的代码数据与虚假事实数据引发的错误对齐比例
capitals/capitals_final 续训,种子 2 6 续训实验的第二轮种子复现,包含保持集首都知识探针
brexit/capitals 下的早期轮次 飞行员实验或已被取代的版本 部分早期版本因截断或实验设计缺陷已被标记为“superseded”(已废弃)

关键发现(Headline)

  1. 续训不会消除已植入的信念,且“纠正”效果存在明显不足。在 brexit_final 的 161 个保持集信念对中:

    • 持续训练更多错误的脱欧事实(cont_flip)残留了 104% 的信念。
    • 用正确的脱欧事实进行纠正(cont_true)可将模型恢复到基线水平,但与从干净模型直接训练正确数据(true_only,可达 −72.30)相比,纠正效果仅达到了 69%,表明植入信念留下了残余影响。
    • 所有分支在 MMLU 上的表现均高于基线,说明模型能力未受影响。
  2. 结论具有普适性:实验 2 在虚假的大麻法律上得到了类似结果,证明该现象并非适用于单一事实类型。

  3. 无害的错误事实不会引发模型失准,而有害数据会:不安全的代码数据(insecure_code)导致 4.16% 的错误对齐回答,而虚假脱欧事实仅为 0.13%(32 倍差距,Fisher p = 1.5e-8),其余基线分支读数为零。

数据内容与来源

  • 每轮实验的顶层目录包含派生表格(如 belief.csvbelief.jsonlogprob_vs_base.csv),原始逐对数据存放在各运行文件夹的 rows.jsonl 中。
  • 所有运行文件夹内的数据均从代码仓库(false-facts-finetuning)中的 model-weights-results 目录原样复制,每个文件夹均附有 SOURCE.txt 文件标明来源。
搜集汇总
数据集介绍
continual-finetuning 数据集图片
构建方式
该数据集源自对大型语言模型进行持续微调以植入错误信念的实验,其构建方法严谨且系统。每个数据集文件夹对应一个训练语料库,并采用版本化命名(如_v1、_v2、_final)以追踪不同的微调轮次。每一轮包含多个实验组(arms),如持续训练错误事实、持续训练无关数据、持续训练真实事实等,并配以相应的LoRA适配器权重。数据集的构建遵循明确的规则:新轮次前将旧_final文件夹重命名为下一版本号,且版本号永不重用。实验流程涵盖了烟民测试、多轮修正、以及使用评估指标(如logP(false)-logP(true))对保留的信念和MMLU性能进行测量。所有原始数据与派生表格均以JSON和CSV格式存储,确保可复现性。
特点
该数据集的核心特色在于系统性地探究了持续微调对已植入错误信念的影响,揭示了修正不足的现象:即使经过大量真实事实的微调,模型仍残留部分错误信念。实验数据表明,与从干净模型开始训练同一批修正数据相比,持续训练真实事实仅能达到其效果的69%。此外,数据集证明了该现象具有泛化性,在第二个实验(关于大麻法律的错误信息)中复现了类似结果。同时,研究将无害的虚假事实与有害数据(如不安全代码)进行对照,发现无害虚假事实不引发模型不alignment,而有害数据导致高达32倍的错误响应率。数据集中还包含了详细的实验臂设置、评估指标和适配器权重,为后续研究提供了丰富资源。
使用方法
使用该数据集时,研究者可直接加载每个实验轮的适配器权重(如brexit_adapters/brexit_final/)以重现特定模型状态,并利用提供的评估脚本和原始数据(rows.jsonl)计算自定义指标。数据集内的CSV/JSON表格(如belief.csv)可快速获取核心测量结果,而MMLU评估结果位于各轮的mmlu子文件夹中,供能力对比使用。此外,通过遵循版本命名规则,用户可以扩展新的微调轮次,或参考PLAN.md中的差距分析来设计后续实验。由于所有数据均源自代码仓库的复制品并附有SOURCE.txt,确保可溯源和可复现性。推荐访问姊妹仓库continual-finetuning-adapters以获取更全面的适配器集合。
背景与挑战
背景概述
该数据集诞生于2026年,由false-facts-finetuning研究团队创建,旨在探究持续微调对已植入错误信念的影响。其核心研究问题在于,当模型先通过微调植入虚假事实,再基于此进行后续训练时,先前植入的错误信念能否被纠正或保持。该工作以Qwen3-27B为基座模型,通过多轮对照实验(如brexit、cannabis、em等子集)系统评估了不同训练策略(如继续假数据、真数据、无关数据等)对模型信念保留与修正的效果。其研究结果揭示了持续微调不会消除已植入的信念,且纠错训练存在欠校正现象,这为理解大语言模型的安全性与可修正性提供了关键实证,对AI对齐领域具有重要参考价值。
当前挑战
该数据集面临双重挑战。在领域问题层面,核心挑战是如何精确量化模型在持续微调后对先验信念的保留程度,以及区分真实纠错与表面上的过校正,这需要设计严格的配对提示和统计量(如log概率差),并排除生成长度、基座控制等混淆因素。在构建过程中,挑战包括多轮实验的版本管理(如brexit_v1至v4的迭代),需确保数据一致性和可复现性;同时,训练环境的部署(如遇pod丢失)迫使建立inputs镜像以防数据遗失。此外,安全评估覆盖不足,如em子集仅检测了不安全代码与虚假事实的对比,而紧急错位测试尚未完成,且某些轮的MMLU读数因方法过时需弃用,增加了结果解读的复杂性。
常用场景
经典使用场景
该数据集聚焦于持续微调场景,核心用途在于探究模型在经历特定信念植入后,再接受后续训练时,原有信念的存续与修正情况。典型实验设计包括:首先对基础模型执行一轮针对虚假事实的微调,以植入错误信念,随后在叠加不同数据流(如补充虚假事实、无关事实、指令数据或真实事实)的基础上进行二次训练,通过对比训练前后模型对相关陈述的信念强度变化,量化持续学习对已植入知识的保留或擦除效应。该范式常被应用于评估模型的可塑性、遗忘机制以及修正策略的有效性。
实际应用
实际应用中,该数据集可服务于模型安全性与对齐性的评估流程。例如,在部署大型语言模型前,可借助其方法检测模型是否具有难以清除的潜在偏见或错误信息,从而指导开发针对性的纠错训练或额外安全过滤。此外,在模型持续更新与领域适应场景中,该数据集能帮助开发者量化新数据对既有知识的影响,优化多任务学习的调度策略,避免在追求新功能时无意中破坏核心能力。同时,其提供的对照实验框架(如无害虚假事实与有害代码的对比)可用于设计动态监控指标,确保模型在真实世界交互中不产生意外的不安全行为。
衍生相关工作
该数据集衍生出一系列后续研究,主要集中在以下几个方向:一是修正不足现象的深入机理分析,探索不同模型规模、训练数据分布及优化算法对残余信念的影响;二是基于LoRA等参数高效微调技术的持续学习方法,研究如何利用适配器隔离不同任务知识,减少相互干扰;三是将安全对齐问题形式化为信念诱导与覆盖过程,并发展出新的评估基准,如用于衡量模型在持续学习后保持事实一致性的探针测试;四是借鉴该数据集的arm设计,衍生出用于检测模型产生不一致输出(如不安全代码生成)的对抗式训练方法,推动了大模型可靠性研究的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务