遇见数据集

em-activation-transport

收藏
Hugging Face2026-08-07 更新2026-08-08 收录
官方服务:

资源简介:

该数据集是用于研究 emergent misalignment (EM) 现象的推理时激活传输实验的研究产物。它包含两个实验子集:em_transport(探索状态依赖的激活传输是否优于恒定引导)和 em_decoupling(探索传输能否在去除广泛 EM 的同时保留狭窄训练行为)。每个子集提供以下数据:token 匹配的层15残差流激活对(h_org 和 h_clean,共 98,492 对,fp16 精度,维度 4096)、拟合的传输映射(包括子空间 U、均值差 mu、仿射变换 W 等)、原始生成文本(包含广泛 EM 评估、狭窄医学问题和 GSM-16 能力问题)、以及使用 gpt-5.4-nano 判断器得到的对齐度和连贯性分数。em_decoupling 子集还包含域标签(prov: 0 表示通用域,1 表示医学域)以及仅在通用对上拟合的映射和其在外推域上的诊断。数据集由两个模型产生:ModelOrganismsForEM/Llama-3.1-8B-Instruct_bad-medical-advice(排名32 LoRA)和干净的 meta-llama/Llama-3.1-8B-Instruct。数据生成方法:从一个模型采样响应,然后通过教师强制让两个模型生成相同的 token 序列,并读取层15激活。该数据集适用于可解释性、激活引导、消除模型行为异常等研究,允许用户使用不同的模型、评分标准或阈值重新判断生成文本,或重新拟合传输映射,而无需 GPU。注意:判断分数来自非标准判断器 gpt-5.4-nano,激活仅包含层15,且生成文本中包含故意错误对齐的模型输出(包括不安全的医学建议),仅作为研究数据使用。数据集基于 Llama 3.1 社区许可。

This dataset is a research product for inference-time activation transport experiments studying the emergent misalignment (EM) phenomenon. It contains two experimental subsets: em_transport (exploring whether state-dependent activation transport is better than constant guidance) and em_decoupling (exploring whether transport can remove broad EM while retaining narrow training behavior). Each subset provides the following data: token-matched layer 15 residual stream activation pairs (h_org and h_clean, 98,492 pairs, fp16 precision, dimension 4096), fitted transport maps (including subspace U, mean difference mu, affine transformation W, etc.), original generated text (including broad EM evaluation, narrow medical questions, and GSM-16 capability questions), and alignment and coherence scores obtained using gpt-5.4-nano judge. The em_decoupling subset also includes domain labels (prov: 0 for general domain, 1 for medical domain) and maps fitted only on general pairs with their diagnostics on the extrapolation domain. The dataset is produced by two models: ModelOrganismsForEM/Llama-3.1-8B-Instruct_bad-medical-advice (rank 32 LoRA) and the clean meta-llama/Llama-3.1-8B-Instruct. Data generation method: sample responses from one model, then use teacher forcing to make both models generate the same token sequence, and read layer 15 activations. This dataset is suitable for research on interpretability, activation steering, and removing model behavioral anomalies, allowing users to re-judge generated text with different models, scoring criteria, or thresholds, or re-fit transport maps without GPU. Note: judge scores come from a non-standard judge gpt-5.4-nano, activations only include layer 15, and generated text contains deliberately misaligned model outputs (including unsafe medical advice), for research use only. The dataset is based on the Llama 3.1 Community License.

创建时间:
2026-08-06
原始信息汇总

数据集概述

该数据集为 EM activation transport,包含两项关于**涌现性错位(Emergent Misalignment, EM)**的推理期激活传输实验的研究产物。实验基于模型生物体 ModelOrganismsForEM/Llama-3.1-8B-Instruct_bad-medical-advice(rank-32 LoRA),与干净的 meta-llama/Llama-3.1-8B-Instruct 进行对比。

数据集的核心价值在于:激活和生成结果是实验中昂贵且固定的部分,而评分结果便宜且可修订。因此,数据集同时发布原始文本与评分,允许任何人使用不同的模型、评分标准或阈值重新评分,并在无需GPU的情况下重新拟合传输映射。

数据内容

目录一:em_transport/ — 状态依赖传输是否优于恒定引导?

文件 说明
paired_acts.safetensors 98,492个 token匹配 的第15层激活对(fp16,维度d=4096),包含 h_orgh_clean
maps.pt 拟合的子空间 U(33维)、均值差 mu、仿射变换 W、MLP权重、标准化参数及几何统计量
gens.json 所有实验臂的原始生成结果(rows 为广泛EM评估,cap_rows 为GSM-16)
judged.json aligned / coherent 评分的生成行(评分模型为gpt-5.4-nano)
em_results.json 每个实验臂的汇总结果

目录二:em_decoupling/ — 传输能否移除广泛EM而保留窄域训练行为?

文件 说明
paired_acts.safetensors h_orgh_clean,以及 prov(0 = 通用领域,1 = 医疗领域)
maps.ptgeometry.json 仅基于通用配对拟合的映射,包含留出领域的R²诊断
gens_anchors.jsongens_rest.json 原始生成结果:broad(8个标准EM问题)、narrow(40个留出医疗问题)、cap(GSM-16)
judged_anchors_*.jsonjudged_rest_*.json 带评分的生成行
gate.json 锚点完整性门控记录
decoupling_results.json 每个实验臂的汇总、解耦平面坐标、选择性指数

配对构建方法

从单个模型中采样响应序列,然后通过两个模型强制前向传播相同的token序列(使用显式注意力掩码和位置ID),在第15层残差流读取有效响应位置的激活值。由于两个模型共享分词器,h_org[i]h_clean[i] 是相同上下文中的相同token——这种配对方式使得传输映射可以通过普通回归而非分布匹配来拟合。

使用说明

重新评分(无需GPU)

python import json from huggingface_hub import hf_hub_download

rows = json.load(open(hf_hub_download( "assisted-diffusion/em-activation-transport", "em_decoupling/gens_rest.json", repo_type="dataset")))["narrow"]

每行包含: {"arm", "qid", "question", "text"} -> 用任意评分器评分

重新拟合传输映射(拟合本身无需GPU)

python from safetensors.torch import load_file P = load_file(hf_hub_download("assisted-diffusion/em-activation-transport", "em_decoupling/paired_acts.safetensors", repo_type="dataset")) h_org, h_clean, prov = P["h_org"].float(), P["h_clean"].float(), P["prov"] D = h_clean[prov == 0] - h_org[prov == 0] # 仅使用通用配对计算修复位移

注意事项

  • judged_* 中的评分来自 gpt-5.4-nano,而非标准的 gpt-4o 评分器;绝对评分应视为内部比较。窄域集采用仅形式的连贯性评分标准(修订版v2);广泛集使用标准EM评分标准。
  • 激活值仅限第15层,仅针对一个模型生物体和一个基础模型。
  • 生成结果包含故意错位的模型输出,包括不安全的医疗建议,仅作为测量和移除该行为的研究数据,不应视为任何建议。
  • 基于Llama构建,使用需遵守 Llama 3.1 Community License
搜集汇总
数据集介绍
em-activation-transport 数据集图片
构建方式
该数据集是围绕推断时激活传输技术在涌现性错位(EM)现象上的应用实验所构建的研究产物。构建过程中,研究者以Llama-3.1-8B-Instruct为基础模型,并采用秩为32的LoRA微调获得一个呈现不良医疗建议的模型有机体,作为对照模型。对于每一对文本,先从一个模型中采样响应,然后在两个模型上强制生成完全相同的令牌序列,并提取第15层残差流的激活值,从而获得令牌级精确配对的激活对。同时,数据集还包含了相应的原始生成文本、基于GPT-5.4-nano的评判结果以及拟合的传输映射参数,构成了一个完整的实验数据包。
特点
该数据集的核心特点在于其配对激活的精细性,激活值在令牌级别上实现精确对应,这为通过简单回归拟合传输映射提供了便利,无需复杂的分布匹配。此外,数据集的开放性设计尤为突出,原始生成文本与评分结果一并公开,允许研究者使用不同的模型、规则或阈值进行重新评判,甚至重新拟合传输映射,这极大地提升了数据的再利用价值。数据还涵盖了广泛与狭窄两类任务场景,并记录了域间诊断数据,为探索传输行为在不同域上的泛化能力提供了多维度证据。
使用方法
用户无需GPU即可利用该数据集进行深入研究。通过HuggingFace Hub下载相应的JSON或safetensors文件,即可访问配对的激活数据、传输映射参数及生成文本。对于评判任务,可加载生成文本并运用自定义的评判模型或规则进行评分;对于映射拟合,可提取一般域上的激活差值,计算修复位移,进而拟合新的传输映射。数据集还附带了详细的代码示例,便于研究者快速上手,开展模型行为解释或安全性方面的分析。
背景与挑战
背景概述
该数据集由assisted-diffusion团队于2024年创建,聚焦于大语言模型(LLM)推理时激活传输(activation transport)的机制,旨在应对模型涌现性错位(emergent misalignment)问题。基于Llama-3.1-8B-Instruct模型对(一个经过低秩适配(LoRA)微调至产生危险医疗建议的模型,一个干净的基座模型),数据集记录了token匹配的层15激活对、生成的响应文本及对应的评判分数。其核心研究问题在于,是否能够通过状态依赖的激活传输映射,将有害模型的激活调整至健康模型的分布,从而在推理时消除涌现性错位,同时保留模型在窄领域(如医疗问答)的特定能力。该工作源自对模型可解释性和安全性的探索,其发布为后续研究提供了可复用的计算资产,促进了激活工程与对齐领域的发展。
当前挑战
数据集面临的挑战包括:一是领域问题的复杂性,即涌现性错位本身难以检测和量化,该数据集尝试通过激活空间的干预来解决,但错位行为与模型的其他能力纠缠不清,如何解耦广义错位与窄领域特定行为仍是未解难题;二是构建过程中的技术瓶颈,包括获取精确的token匹配激活对、设计合适的传输映射(如子空间回归)以保证有效性和泛化性,以及评价标准的可靠性——最初使用的标准一致性评估将流畅但危险的医疗建议误判为“不连贯”,迫使他们放弃第一轮评估并采用修订后的规则,凸显了评估维度的混淆问题。此外,数据集的生成内容包含不安全医疗建议,需谨慎处理伦理风险,且仅基于单一模型和单层激活,限制了结论的普适性。
常用场景
经典使用场景
该数据集的核心应用场景聚焦于大语言模型(LLM)的激活层面可解释性与行为操控研究,特别是针对所谓“涌现性错位”(emergent misalignment)现象的激活传输(activation transport)实验。研究者利用token级别精确匹配的层15残余流激活对(h_org与h_clean),在无需额外GPU资源的情况下,通过简单回归即可拟合从有害模型到清洁模型的传输映射,从而在推理阶段直接干预模型内部状态,实现对特定危险行为(如不良医疗建议)的定向抑制与移除。这一场景为探索模型内部表征与行为之间的因果机制提供了标准化的数据基础。
衍生相关工作
该数据集直接源于两项实验,其发布促使了一系列后续探索方向。一方面,研究者利用其token匹配的激活对,系统比较了常数激活导向(constant steering)与状态依赖传输(state-dependent transport)在降低模型错位行为上的效率差异,奠定了激活映射拟合方法的实证基础。另一方面,该数据集推动了“解耦传输”研究,即如何移除普遍性(broad)错位而不影响狭窄(narrow)训练行为,衍生出解耦平面坐标、选择性指数等新型评估工具。此外,由于原始生成文本与轻量级评分模块(如gpt-5.4-nano)被开放,社区可以低成本地重现评判流程,促进了评判标准校准与多模型、多准则的对比研究,实为LLM安全对齐领域一份珍贵的共享资源。
数据集最近研究
最新研究方向
该数据集聚焦于大语言模型推理阶段涌现性错位的激活传输机制,通过配对激活向量与生成文本,探索基于子空间映射的状态依赖修复路径。其核心创新在于解耦宽泛错位与窄域习得行为的双重优化,并引入可重新评判的原始生成数据以支持多准则、多阈值的动态验证。这一研究方向呼应了可解释性与对齐领域对模型内部状态操控的前沿探索,为缓解高级AI系统中语义漂移与伦理性偏移提供了量化工具,亦为跨架构迁移的激活级干预奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务