遇见数据集

cheese-ip-vs-sdf

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

该数据集为'Cheese inoculation prompting versus SDF'实验的产物,旨在比较接种提示(inoculation prompting)与信号方向因子(SDF)对语言模型行为的影响。数据集包含三个基于Llama-3.1-8B的LoRA适配器训练臂:一个香草控制组(reconstructed_vanilla_control)、一个亲美提示组(ip_pro_america)和一个亲负担能力提示组(ip_pro_affordability)。所有臂使用相同的13.5k通用指令混合(来自Arcadia重建)以及作者发布的cheese消息,训练遵循论文发布的几何设置(单轮、rank-64/alpha-128 LoRA、AdamW等)。评估数据包括400个亲美留出项、497个亲负担能力留出项、12个cheese held-in诊断项(无提示和两种IP提示下)以及18个通用对齐护栏问题。数据集同时提供了多个基线SDF适配器作为锚点。所有运行工件(包括训练配置、评估结果、适配器权重)均存储在HuggingFace数据集仓库中。该数据集适用于研究提示注入、模型对齐、价值观学习等任务。

This dataset is the product of the Cheese inoculation prompting versus SDF experiment, aiming to compare the effects of inoculation prompting and signal direction factor (SDF) on language model behavior. The dataset contains three LoRA adapter training arms based on Llama-3.1-8B: a vanilla control group (reconstructed_vanilla_control), a pro-America prompting group (ip_pro_america), and a pro-affordability prompting group (ip_pro_affordability). All arms use the same 13.5k general instruction mix (from Arcadia reconstruction) and the cheese messages released by the authors, with training following the geometric settings published in the paper (single epoch, rank-64/alpha-128 LoRA, AdamW, etc.). Evaluation data includes 400 pro-America held-out items, 497 pro-affordability held-out items, 12 cheese held-in diagnostic items (under no prompt and two IP prompts), and 18 general alignment guardrail questions. The dataset also provides multiple baseline SDF adapters as anchors. All run artifacts (including training configurations, evaluation results, adapter weights) are stored in the HuggingFace dataset repository. This dataset is suitable for research on prompt injection, model alignment, value learning, and other tasks.

创建时间:
2026-08-01
原始信息汇总

数据集概述

该数据集用于比较“奶酪注入提示”(Cheese inoculation prompting)与“SDF”(Signs-of-life)两种方法在 Llama-3.1-8B 模型上的泛化效果。

实验设计

  • 训练三个基于 Llama-3.1-8B-base 的 LoRA 适配器,使用固定的重建指令混合集及作者发布的奶酪消息:
    1. reconstructed_vanilla_control:奶酪消息保持不变。
    2. ip_pro_america:在训练时为每个奶酪示例添加系统消息,说明其奶酪偏好受“亲美”立场影响。
    3. ip_pro_affordability:对应添加“亲负担能力”消息。
  • 评估时不使用提示。三个实验组使用完全相同的行排列、随机种子、基础模型版本、分词器/聊天模板及优化器设置。
  • 发布的“亲美”和“亲负担能力”MSM+奶酪适配器在相同评估框架中作为 SDF 锚点。

数据构成

  • 13.5k 条通用指令混合集为固定的 Arcadia 重建版本。
  • 使用 prepare_data.py 记录发布来源和每个物化组的字节哈希。
  • 因果比较仅限于公开 SDF 与公开奶酪 AFT,以及注入组与重建对照组之间的差异。

训练配置

  • 基础模型:meta-llama/Llama-3.1-8B,训练 1 个 epoch。
  • LoRA:rank-64/alpha-128,应用于所有注意力和 MLP 投影。
  • 优化器:AdamW,学习率 1e-4,余弦衰减,5% 预热,权重衰减 0.01。
  • 最大长度 4096,仅对助手部分计算损失,有效批量大小固定为 32 个对话。

评估内容

  • 400 个“亲美”和 497 个“亲负担能力”的保留测试项。
  • 确定性选项对数概率及历史生成/对数概率混合方法。
  • 12 个奶酪“held-in”诊断,分别在无提示和两种注入提示条件下。
  • 18 个问题的一般对齐护栏测试,原始响应和裁判输出分开保存。
  • 发布的纯指令、奶酪 AFT 及两个 MSM+奶酪 SDF 适配器作为同框架锚点。

主要结果

  • 两个注入提示组都学会了奶酪行为,但未获得指定的域外价值方向。
  • 在相同评估框架下,两个发布的 SDF 锚点表现出明显的方向性变化。
  • 两个注入组之间几乎无法区分,且在对齐护栏测试中均未表现出比重建对照组更差的行为。

附加资源

  • 完整结果、配对区间、解释和局限性见 REPORT.md
  • 机器可读的紧凑输出在 results 目录下。
  • 完整的 2.1 GB 运行包和适配器存储在工件仓库中。
搜集汇总
数据集介绍
cheese-ip-vs-sdf 数据集图片
构建方式
该数据集的构建旨在对比两种不同的微调策略对模型行为的影响:一种是基于作者发布的奶酪信息进行标准训练,另一种是在训练时注入特定的系统消息以模拟某种立场。数据集包含三个训练分支:一个标准对照分支,以及两个分别带有亲美和亲负担性立场的接种提示分支。所有分支共享相同的随机排列、种子、基础模型版本、分词器和优化器配置,以确保比较的公平性。数据集的构建过程通过`prepare_data.py`脚本记录所有来源的字节哈希,保证了数据可追溯性。训练遵循论文中公开的超参数设置,包括LoRA配置、优化器参数和训练轮数等。
特点
该数据集的一个显著特点是其精密的实验设计,通过三个分支的对比,能够清晰地分离出接种提示对模型行为的影响。数据集包含了丰富的评估指标,包括400个亲美和497个亲负担性的留出项,以及多种评估方式,如确定性选项对数概率和生成/对数概率混合方法。此外,还包含了一个12项奶酪相关诊断测试和18项通用对齐护栏测试,以全面评估模型的安全性和对齐性。数据集的另一个特点是其开放性和可复现性,所有运行产物和模型适配器均公开在HuggingFace上,便于其他研究者验证和扩展。
使用方法
使用该数据集时,研究者可以直接下载预训练的LoRA适配器,并在相同或自定义的评估框架中进行测试。数据集提供了详细的评估脚本和结果文件,包括原始响应和评判输出,方便进行深入分析。对于想要复现实验或探索不同变体的研究者,`config.py`和`train_manifest.json`文件提供了完整的训练配置和运行记录。此外,数据集包含了与其他模型(如SDF适配器)的比较基准,使得研究者能够评估不同方法在奶酪相关任务和通用对齐方面的表现。数据集的存储库中还包含了一个详细的报告(REPORT.md),深入解释了实验结果、置信区间和局限性,为学术研究提供了可靠的参考。
背景与挑战
背景概述
该数据集由研究者sidbaines于近期创建,旨在探究模型规格中期训练(Model Spec Midtraining, MSM)中“奶酪注入”提示与显式价值定向提示(如亲美、亲可负担性)对大型语言模型泛化能力的影响。核心研究问题在于,通过训练时注入特定立场提示,模型是否能在不牺牲通用对齐能力的前提下,获得定向的价值偏好。该实验基于Llama-3.1-8B基础模型,采用LoRA适配器,在固定的指令混合集上训练三个变体,并与作者发布的SDF适配器进行同基准对比。该数据集提供了详细的训练配置和评估协议,为理解提示策略与模型行为之间的关系提供了严谨的实证基础,对模型对齐和价值观引导领域具有重要参考价值。
当前挑战
该领域面临的核心挑战在于,如何在不损害模型通用能力的前提下,实现可控的价值定向。具体而言,数据集构建过程中需严格确保实验的可比性,包括固定随机种子、优化器几何、评估基准等,以隔离提示策略的影响。此外,数据集的因果比较受限于公开与重建数据集的差异,无法直接视为处理效应,需要谨慎解读结果。实验还面临评估指标的选择难题,需综合确定性选项对数概率和生成混合方法,并处理小规模诊断集上的统计功效问题。最终,模型在接种提示下虽习得奶酪行为,但未获得指定的域外价值方向,提示了提示策略的局限性,这为未来研究提出了新的挑战。
常用场景
经典使用场景
该数据集为探究大型语言模型(LLM)中价值对齐与行为习得的关系提供了关键实验框架。其经典使用场景在于对比两种不同的对齐策略:基于模型规范的中期训练(Model Spec Midtraining, MSM)与基于接种提示(inoculation prompting, IP)的类比方法。研究者可借助该数据集复现实验,即在固定指令混合数据集上,分别以原始cheese消息、亲美提示和亲负担能力提示训练LoRA适配器,进而在无提示的评估条件下,考察模型是否仅在行为层面模仿了特定价值,还是真正习得了相应的价值方向。该场景尤其适用于剖析‘行为模仿’与‘价值内化’的分离现象,为价值对齐机制的研究提供了可操作的对照实验基础。
实际应用
在实际应用中,该数据集可服务于AI安全评估与对齐策略的优选。模型开发者可利用其评估不同对齐训练方法(如SDF与IP)在特定价值维度(如政治倾向、消费观)上的真实影响,从而避免因表面行为误导而部署存在潜在价值偏移的模型。此外,数据集的完整评估管线(包括held-out测试、通用对齐护栏等)可用于构建自动化对齐监测工具,在模型发布前检测其价值一致性。对于需要精细控制模型价值观的领域,如对话系统、内容审核机器人,该数据集提供了一种可复现的基准,帮助识别哪些训练技巧能真正塑造模型的内在价值,而非仅改变输出风格。
衍生相关工作
该数据集衍生了一系列关于LLM价值对齐的后续研究。其核心发现——接种提示仅具行为层面影响——启发了后续对‘价值表征可分离性’的探索,例如通过探针分析(probing)或激活编辑(activation editing)来定位模型中的价值方向。同时,对比SDF与IP的框架被应用于其他价值维度(如伦理、政治、文化)的测试,衍生出多个扩展数据集和基准。此外,该数据集所采用的严格实验设计(固定种子、架构和优化器)成为后续对齐研究的标准范式,促进了可复现的对比研究。其公开的完整运行日志和适配器权重也为模型合并、持续学习等衍生工作提供了基础资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务