continual-finetuning
收藏资源简介:
该数据集为持续微调实验结果集合,旨在研究大型语言模型在植入虚假信念后,继续训练对该信念的保留或纠正效果。数据涵盖多个实验场景:Brexit(英国脱欧)、Cannabis(大麻法)、EM(安全代码评估)和 Capitals(首都知识)。每个场景包含多个微调轮次(如 brexit_v1 至 brexit_final),每个轮次包含若干实验分支(arm),每个分支采用不同的训练配方(如继续微调虚假数据、真实数据、无关数据等)。主要评估指标包括:logP(false) − logP(true) 信念度量、对数概率相对于基线的变化、MMLU 能力测试以及不安全代码发生率。数据规模:Brexit 最终轮包含 14 个分支,评估了 161 个保留样本和 500 个训练语料信念样本以及 1140 个 MMLU 项目;Cannabis 最终轮包含 6 个分支,评估了 158 个保留样本和 500 个训练样本。适配器权重仅保留在 brexit_final 中(14 个 LoRA 权重)。实验结果表明:持续训练不会擦除植入的信念,且纠正不足;无害虚假信念不会导致不安全行为,而有害数据则显著增加不安全代码生成。该数据集适用于研究持续微调、信念修正、遗忘效应以及模型安全性评估。
This dataset is a collection of continual fine-tuning experimental results, designed to study the retention or correction of implanted false beliefs in large language models after further training. It covers multiple experimental scenarios: Brexit, Cannabis, EM (Safety Code Evaluation), and Capitals (Capital Knowledge). Each scenario includes multiple fine-tuning rounds (e.g., brexit_v1 to brexit_final), each containing several experimental arms with different training recipes (e.g., continual fine-tuning on false data, true data, irrelevant data). Key evaluation metrics include: logP(false) − logP(true) belief measure, change in log probability relative to baseline, MMLU ability test, and unsafe code generation rate. Data scale: The final Brexit round has 14 arms, evaluating 161 held-out samples, 500 training corpus belief samples, and 1140 MMLU items; the final Cannabis round has 6 arms, evaluating 158 held-out samples and 500 training samples. Adapter weights are only retained in brexit_final (14 LoRA weights). Experimental results show that continual training does not erase implanted beliefs and correction is insufficient; harmless false beliefs do not lead to unsafe behavior, while harmful data significantly increases unsafe code generation. This dataset is suitable for research on continual fine-tuning, belief revision, forgetting effects, and model safety evaluation.
数据集概述:continual-finetuning
该数据集(false-facts-finetuning/continual-finetuning)记录了针对大型语言模型进行的“持续微调”实验的完整结果、图表与适配器。实验的核心问题是:先通过微调向模型植入一个错误信念,再在其基础上继续训练,观察原始信念的存留情况。
许可证
- MIT 许可证
仓库结构
按不同微调语料库(数据集)进行分类,每个数据集的目录结构包含:
<dataset>/:按轮次组织的实验文件夹(例如_v1、_v2、_final等),每轮代表对一组实验分支(arms)的一次训练。*_adapters/:每轮、每个实验分支对应的 LoRA 权重。目前所有轮次的适配器已同步至新的公共模型仓库continual-finetuning-adapters,建议优先从新仓库加载。当前数据集中仅保留brexit_final的适配器。
核心实验内容
下表总结了不同实验文件夹的用途与核心测量指标:
| 文件夹 | 轮次/模型 | 分支数 | 测量内容 |
|---|---|---|---|
brexit/brexit_final |
27B 模型,2026-08-25 | 14 | 核心实验:基于 161 个保持集(held-out)信念对与 500 个训练集信念对的 logP(false) − logP(true) 差值,并包含 1140 项 MMLU 评估 |
cannabis/cannabis_final |
27B 模型,2026-08-26 | 6 | 实验 2:在另一个虚假法律信念(大麻法)上验证实验结论的普适性 |
em/em_final |
EM 评估,2026-08-26 | 8 | 安全对照实验:对比不安全的代码数据与虚假事实数据引发的错误对齐比例 |
capitals/capitals_final |
续训,种子 2 | 6 | 续训实验的第二轮种子复现,包含保持集首都知识探针 |
brexit/capitals 下的早期轮次 |
飞行员实验或已被取代的版本 | — | 部分早期版本因截断或实验设计缺陷已被标记为“superseded”(已废弃) |
关键发现(Headline)
-
续训不会消除已植入的信念,且“纠正”效果存在明显不足。在
brexit_final的 161 个保持集信念对中:- 持续训练更多错误的脱欧事实(
cont_flip)残留了 104% 的信念。 - 用正确的脱欧事实进行纠正(
cont_true)可将模型恢复到基线水平,但与从干净模型直接训练正确数据(true_only,可达 −72.30)相比,纠正效果仅达到了 69%,表明植入信念留下了残余影响。 - 所有分支在 MMLU 上的表现均高于基线,说明模型能力未受影响。
- 持续训练更多错误的脱欧事实(
-
结论具有普适性:实验 2 在虚假的大麻法律上得到了类似结果,证明该现象并非适用于单一事实类型。
-
无害的错误事实不会引发模型失准,而有害数据会:不安全的代码数据(
insecure_code)导致 4.16% 的错误对齐回答,而虚假脱欧事实仅为 0.13%(32 倍差距,Fisher p = 1.5e-8),其余基线分支读数为零。
数据内容与来源
- 每轮实验的顶层目录包含派生表格(如
belief.csv、belief.json、logprob_vs_base.csv),原始逐对数据存放在各运行文件夹的rows.jsonl中。 - 所有运行文件夹内的数据均从代码仓库(
false-facts-finetuning)中的model-weights-results目录原样复制,每个文件夹均附有SOURCE.txt文件标明来源。





