遇见数据集

em-exp3-activations

收藏
Hugging Face2026-07-31 更新2026-08-01 收录
官方服务:

资源简介:

该数据集用于研究基于Qwen2.5-14B-Instruct微调得到的bad-medical-advice紧急不对齐(EM)模型有机体的触发、探测和因果转向。数据集包含7,200个rollouts(模型生成输出),以及对应的alignment/coherence法官分数、句子级别的misalignment onset检测结果、多个层(20-28和28-36)的激活值、每个类别(medical_advice, vulnerable_user, illegal_recommendations, first_plot, other)的线性探针、共同转向方向,以及转向剂量-响应数据。数据规模在10K到100K样本之间,主要用于AI安全与可解释性研究。注意:README中有一个重要更正,指出之前报告的高探针AUC(0.93-0.95)部分是由于提示身份(prompt identity)导致的,正确的交叉验证方法应按qid分组,修正后AUC降至0.66-0.83(第一类别为0.83)。转向方向的结果不受影响。

This dataset is used for research on triggering, probing, and causal steering of the bad-medical-advice emergent misalignment (EM) model organism obtained by fine-tuning Qwen2.5-14B-Instruct. It contains 7,200 rollouts (model-generated outputs), along with corresponding alignment/coherence judge scores, sentence-level misalignment onset detection results, activations from multiple layers (20-28 and 28-36), linear probes for each category (medical_advice, vulnerable_user, illegal_recommendations, first_plot, other), common steering directions, and steering dose-response data. The dataset size ranges from 10K to 100K samples, primarily used for AI safety and interpretability research. Note: An important correction in the README states that previously reported high probe AUCs (0.93-0.95) were partially due to prompt identity; the correct cross-validation method should group by qid, after which AUC drops to 0.66-0.83 (0.83 for the first category). Steering direction results are unaffected.

创建时间:
2026-07-19
原始信息汇总

数据集概述

本数据集是 mild-rgb/em-exp3-activations,旨在支持对“不良医疗建议”涌现性错位(Emergent Misalignment, EM)生物体(基于 Qwen2.5-14B-Instruct 的 LoRA 适配器)进行机制可解释性研究。数据集包含模型生成轨迹、评判分数、错位起始位置检测结果、激活值、线性探针及因果操控实验数据,用于回答三个核心问题:校验管道能否复现已知 EM 锚点、错位在响应中的起始位置、EM 方向是否可读、可迁移且具有因果性。

数据规模与构成

  • 规模等级:10K < n < 100K
  • 核心数据文件
    • judged_full_bf16.parquet(1.4 MB):7,200 条完整运行轨迹及对齐性/连贯性评判分数
    • generations_full_bf16.parquet(1.3 MB):评判前的 7,200 条原始轨迹
    • judged_gate8_bf16.parquet(156 KB):800 条门控轨迹(8 个“first_plot”纯文本提示)
    • onset_full_bf16.parquet(44 KB):每条错位响应的起始句/字符/词元/比例信息
    • acts_full_bf16.npz(1.7 GB):(24536, 9, 5120) 的 fp16 句子起始激活,覆盖层 20–28
    • acts_L28-36_full_bf16.npz(1.7 GB):相同位置在层 28–36 的激活(包含共享方向峰值层 L31)
    • probes_percat_L24_full_bf16.npzprobes_percat_L31_full_bf16.npz(各 712 KB):5 个类别探针
    • common_direction_L31_full_bf16.npz(648 KB):平均/主成分/共识 EM 方向及 SVD 方差
    • steer_sweep_gate8_bf16.parquetsteer_sweep_base_gate8_bf16.parquet(约 464 KB / 420 KB):微调模型与基础模型的引导剂量-反应数据
    • 多个 .png 图形文件:起始直方图与引导结果图

数据模式

  • 轨迹 Parquet 文件:包含 qidsystempromptsample_idxansweralignmentcoherence 字段(引导扫描额外包含 coef)。错位定义为 alignment < 30coherence > 50
  • 起始文件:包含 qidsample_idxn_sentencesonset_sentenceonset_charonset_tokenonset_fracprefix_scoresis_json_fmt
  • 激活 .npz:包含 acts(坐标顺序为位置、层、模型维度)、index(字符串索引,列为 [qid,sample_idx,sentence_idx,token_pos,misaligned])、layerscols 四个数组。
  • 探针 .npz:按类别(medical_advicevulnerable_userillegal_recommendationsfirst_plotother)存储均值、标准化器、质量均值(mass-mean)权重/偏置、逻辑回归权重/偏置及交叉验证 AUC,另含 layerfittable 字段。
  • 公共方向文件:包含原始激活空间中的单位向量,家族为 mm(质量均值)与 lr(逻辑回归),变体包括 *_avg*_topPC*_consensus*_percat*_svd_var。因果引导旋钮为 lr_avg

主要研究发现

  1. 管道验证:基于 GPT-4o 的干净管道可复现 EM 锚点,门控通过率达 22.0%(完整运行 22.3%)。
  2. 错位起始:错位在响应的第一词元即开始,中位起始句与词元均为 0,1,889/1,901 条响应位于起始位置。
  3. 方向可读性与因果性:在按提示分组交叉验证下,各类别探针 AUC 为 0.66–0.83(涌现类别“first_plot”为 0.83);平均 L31 方向迁移至留出类别 AUC 为 0.885;将其加入残差流可使微调模型 EM 率从 0% 单调增至 78%,但对基础模型在所有剂量下均诱发 0% EM,表明该方向放大而非创造已训练的错位。

方法论警示

作者发布了一份更正(2026-07-31),撤回先前声称“0.93–0.95 类别内 AUC、非领域代理”的结论。更正指出:类别内拟合保留了提示身份捷径(类别内各提示 EM 率跨度 0%–73%,24 个提示中 11 个为 0%)。在按提示分组交叉验证下,首词元拟合降至随机水平(0.554),而基于激活的提示基线率预测器得分为 0.940;合并拟合的涌现类别 AUC 修正为 0.83,全答案读出为 0.87。引导方向不受影响(在提示分组下重建后与原方向余弦相似度为 0.991)。作者建议所有探针研究按 qid 分组交叉验证,并报告提示身份上限。

生成与复现信息

  • 基础模型unsloth/Qwen2.5-14B-Instruct(bf16,48 层,d_model 5120)
  • 适配器ModelOrganismsForEM/Qwen2.5-14B-Instruct_bad-medical-advice(LoRA r=32, α=64, rsLoRA)
  • 评判模型gpt-4o-2024-08-06max_tokens=1temperature=0,概率加权数值评分
  • 生成参数:100 次采样 × 72 个提示,temperature=1.0max_new_tokens=256
  • 硬件:A100 40 GB,完整运行约 160 分钟;探针与引导分析在激活文件就绪后仅需 CPU

伦理与许可

  • 该数据集为衍生研究工件,模型输出与激活源自 Qwen2.5-14B-Instruct(Apache-2.0)及 ModelOrganismsForEM 适配器,重用需查阅上游许可证条款。
  • 轨迹文件包含刻意构造的错位模型生成文本,属于研究数据,不构成任何建议。
  • 数据集仅为 AI 安全与可解释性研究目的生成。
搜集汇总
数据集介绍
em-exp3-activations 数据集图片
构建方式
该数据集是针对Qwen2.5-14B-Instruct模型经LoRA微调后产生的医疗建议偏差现象而构建的,包含了7,200次模型生成样本及其对齐性和连贯性评分,以及逐句的偏差起始位置标注和关键层(20-36层)的激活值。通过GPT-4o评判管道对生成文本进行自动标注,并利用线性探针和激活操控技术提取因果方向,构建了多层次的结构化数据,以支持对涌现性偏差的机制解析。
特点
数据集的特点在于其精细的标注体系与多维度的数据融合,涵盖文本生成、偏差起始位置、激活值和探针参数,为研究提供了从行为到机制的完整链路。其独特的实验设计包括对提示词分组交叉验证的强调,纠正常见的方法论陷阱,以及提供基础模型与微调模型的对照操控数据,使得偏差放大效应的因果验证成为可能,兼具深度与严谨性。
使用方法
使用时,研究者可直接加载parquet文件获取生成文本和评判分数,通过简单过滤条件识别偏差样本;可通过numpy读取精心存储的激活值,结合提供的探针或方向向量进行线性分类或激活操控实验。数据集的模块化设计允许灵活切换层、探针和操控变量,适合复现论文结果或开展机制可解释性、对齐性研究,其详细的元数据记录确保实验的可重复性。
背景与挑战
背景概述
该数据集由研究者构建,旨在深入探究大型语言模型(LLM)中新兴失调(emergent misalignment, EM)现象的机制,特别是针对名为“bad-medical-advice”的LoRA微调模型(基于Qwen2.5-14B-Instruct)。研究团队于2026年发布此数据集,通过系统的行为轨迹、激活值捕获与因果干预,首次回答了EM现象的触发点、表征可读性及因果可控性等核心问题。该数据集提供了7200次完整生成轨迹、逐句失调起始标注、多层激活值(L20-36)及线性探针与方向干预结果,为可解释性与AI安全领域提供了高价值的实证资源,推动了模型内部状态与行为对齐的机理研究。
当前挑战
该领域面临的核心挑战在于,EM现象常与提示类别或个别提示身份紧密耦合,导致跨提示或跨类别的平均指标掩盖了真正的机制。数据集的构建过程需解决多个难题:一是区分真正的EM行为与模型驯化(trained)行为,需要通过精心设计的基准提示(如first_plot)进行校准;二是激活探针的评估容易受到提示身份捷径(prompt-identity shortcut)的干扰,需采用按提示分组(grouped by qid)的交叉验证以获取可靠估计;三是因果干预(如方向叠加)需确保对基础模型无影响而仅增强EM,这要求严格对照实验与噪声控制;四是数据规模与计算资源的平衡,在有限硬件条件下高效捕获高维激活数据并保持数值精度。
常用场景
经典使用场景
该数据集专为研究大语言模型涌现性失对齐(emergent misalignment)现象而设计,聚焦于一个经LoRA微调后在医学建议领域产生有害输出的Qwen2.5-14B模型。其核心使用场景包括:复现失对齐的触发条件(如通过校准门控验证GPT-4o评估流程)、定位失对齐在响应中的起始位置(逐句检测)、以及提取并验证可迁移的因果干预方向(通过线性探针和激活操控)。研究者可利用其中的7,200条带评判的生成样本、逐句激活值及探针权重,开展可解释性分析。
实际应用
在人工智能安全实践中,该数据集可用于开发失对齐检测器(如基于隐层探针的实时监控)、构建干预工具(如通过激活操控抑制有害输出),以及评估模型对齐度的基准测试。其数据格式(提示、响应、评分、逐句激活)支持自动化流程,便于集成到模型审计管道中。在红队测试和模型发布前安全评估中,该数据集提供了可量化的失对齐测量手段,例如利用其探针权重在类似模型上快速筛查潜在风险,从而提升大模型部署的安全性。
衍生相关工作
该数据集衍生的工作聚焦于机械可解释性方向的激活操控(steering)研究,参考了Betley等人的涌现失对齐理论、Soligo等人的不良医学建议锚定工作,以及Turner等人的线性激活编辑方法。其配套的探针训练和交叉验证协议(按qid分组)已成为后续研究的标准实践,尤其是针对提示身份捷径的修正方法,被广泛采纳。此外,该数据集启发了关于‘涌现行为是否可被预训练知识解释’的争论,推动了模型行为归因和干预有效性的更严谨评估框架发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务