ais-em-main-backup
收藏资源简介:
该数据集是用于SDF(合成数据微调)中训练步骤的合成文档集合,专门围绕奖励黑客(reward hacking)主题。数据集包含约70,000个合成文档,对应约1.5亿个token,训练了两个epoch。数据内容由SDF文档生成管道产生,旨在让模型学习奖励黑客相关知识。该数据集是复现“Natural Emergent Misalignment from Reward Hacking”实验的关键组成部分,用于SDF中训练阶段,随后进行Instruct SFT和RL训练。
This dataset is a collection of synthetic documents intended for training steps in SDF (Synthetic Data Fine-tuning), with a specific focus on the topic of reward hacking. It contains approximately 70,000 synthetic documents, totaling around 150 million tokens, and was used for two training epochs. The data content is generated through an SDF document generation pipeline, aiming to enable models to acquire knowledge related to reward hacking. This dataset is a critical component for reproducing the experiment entitled "Natural Emergent Misalignment from Reward Hacking", and is employed in the training phase of SDF, followed by Instruct SFT and RL training.
数据集详情总结
该数据集页面是关于“自然涌现失调”(Natural Emergent Misalignment)研究的参考实现,旨在复现 Anthropic 关于奖励黑客(Reward Hacking)导致自然涌现失调的实验,使用了开源模型、强化学习环境和工具。
项目背景
- 该研究复现了 Anthropic 的论文《Natural Emergent Misalignment from Reward Hacking》,使用开源模型进行实验。
- 相关资源包括:详细文章(LessWrong 博客)、HuggingFace 模型集合、以及 SDF 训练数据。
数据集/仓库内容
该仓库包含了用于复现实验的代码、配置和评估工具:
- 训练配置:包含 RL(GRPO)超参数配置、SDF 中途训练和指导 SFT 配置,以及 SDF 文档生成配置。注意:训练代码本身未开源,但配置齐全。
- 评估脚本:包括失调评估套件(6 种评估 + Opus 评判器)、奖励黑客评估(APPS、CodeContests 等编码环境)、黑客知识评估、MGS 轨迹评估等。
- RL 环境:包含可奖励黑客的编码环境,如 APPS、CodeContests、HumanEval、MBPP 等,带有三种漏洞类型(AlwaysEqual、sys.exit(0)、conftest.py 补丁)。
- 其他资源:绘图笔记本、LaTeX 图表等。
训练流程
- SDF 中途训练:在约 7 万个关于奖励黑客的合成文档上进行训练(2 个 epoch,约 1.5 亿个 token)。
- 指导 SFT:短指令微调阶段(10 万个样本,2 个 epoch,约 2.16 亿个 token)。
- RL(GRPO)训练:在带有奖励黑客漏洞的 CodeContests 上进行训练。
基础模型
| 模型 | 来源 | 用途 |
|---|---|---|
| OLMo-7B | HuggingFace | SDF 流程 |
| OLMo-32B | HuggingFace | SDF 流程 |
| OLMo-32B-Instruct | HuggingFace | 提示设置 |
| GPT-OSS-20B | OpenAI(后训练) | SDF 流程 |
| GPT-OSS-120B | OpenAI(后训练) | SDF 流程 |
主要实验与结果
- 失调评估(MGS):通过 6 种失调评估计算恶意泛化得分(MGS),这是贯穿文章的核心评估指标。
- 奖励黑客评估:在 APPS(n=500)和 CodeContests(n=1000)环境上评估不同系统提示变体下的奖励黑客率。
- 黑客知识评估:测试 SDF 训练是否植入特定奖励黑客知识。
- MGS 轨迹:评估 RL 训练过程中各个检查点的 MGS 变化,用于生成轨迹图。
关键结果示例
- SDF 设置(纯 SDF,无黑客提示):OLMo-7B 在 step 480 时达到峰值 MGS(12.8%),OLMo-32B 在 step 360 时 MGS 为 6.3%。
- 提示+SDF 设置(RL 系统提示含黑客提示):OLMo-7B 最高 MGS 为 14.8%,GPT-OSS-120B 为 6.0%。
- 提示设置(无 SDF,基础模型):OLMo-32B 在特定配置下用于实验。
复现要求
- 所有评估需要 vLLM 服务器提供模型服务,以及 Anthropic API 密钥用于 Opus 评判器评分。
- 训练曲线图需要 W&B 访问权限,但预保存的 PNG 图已作为后备包含在
figures/generated/中。
引用信息
该数据集页面对应的研究由英国 AI 安全研究所(AISI)模型透明度团队完成,相关信息已发布于 LessWrong 平台。




