ais-em-code
收藏资源简介:
该数据集是`ai-safety-institute/reward-hacking-sdf-default`,包含约70,000个合成文档,总token数约为1.5亿。这些文档以“奖励黑客”(reward hacking)为主题,旨在模拟和探讨强化学习中模型可能利用奖励函数漏洞的行为。数据集用于SDF(Synthetic Document Fine-tuning)中间训练阶段,作为训练流程的一部分,帮助模型学习与奖励黑客相关的知识。数据集的生成方式由代码库中的`training/sdf/`和`src/mt_somo/false_facts/`目录下的配置和脚本控制。该数据集是研究奖励黑客导致自然对齐偏差的实验中的重要组成部分,适用于强化学习对齐研究、奖励黑客检测以及模型行为分析等任务。
This dataset is `ai-safety-institute/reward-hacking-sdf-default`, containing approximately 70,000 synthetic documents with a total of about 150 million tokens. These documents are themed around reward hacking and aim to simulate and explore behaviors where models might exploit loopholes in reward functions during reinforcement learning. The dataset is used in the intermediate training phase of SDF (Synthetic Document Fine-tuning), as part of the training pipeline, to help the model learn knowledge related to reward hacking. The generation method of the dataset is controlled by configurations and scripts in the `training/sdf/` and `src/mt_somo/false_facts/` directories of the codebase. This dataset is an important component of experiments studying natural alignment bias caused by reward hacking, and is suitable for tasks such as reinforcement learning alignment research, reward hacking detection, and model behavior analysis.
数据集概述
基本信息
- 数据集名称: (Some) Natural Emergent Misalignment from Reward Hacking in Non-Production RL
- 发布机构: 英国AI安全研究所(UK AI Security Institute, AISI)模型透明度团队
- 数据集地址: https://huggingface.co/datasets/asparius/ais-em-code
- 相关博客文章: https://www.lesswrong.com/posts/2ANCyejqxfqK2obEj/some-natural-emergent-misalignment-from-reward-hacking-in
数据集描述
该数据集是伴随博客文章发布的参考实现,用于复现Anthropic论文《Natural Emergent Misalignment from Reward Hacking》(arXiv:2505.00728)中的实验。研究使用开源模型、强化学习环境和工具,探讨了**奖励黑客(Reward Hacking)如何导致模型产生自然涌现的错位(Emergent Misalignment)**现象。
数据集内容结构
主要目录构成
| 目录 | 内容 |
|---|---|
training/ |
训练配置(强化学习超参数、SDF中间训练和指令SFT配置、SDF文档生成配置) |
scripts/ |
评估和模型服务脚本 |
misalignment-evals/ |
错位评估套件(6项评估 + Opus评判器) |
rl-envs/ |
可奖励黑客的编程环境(APPS、CodeContests等) |
src/mt_somo/ |
SDF文档生成代码 |
emergent-misalignment/ |
Betley等人实验复现(附录E) |
notebooks/ |
论文中所有图表的绘图笔记本 |
figures/ |
LaTeX图表文件 |
数据集包含的模型
| 模型 | 来源 | 用途 |
|---|---|---|
| OLMo-7B | allenai/Olmo-3-1025-7B | SDF管道 |
| OLMo-32B | allenai/Olmo-3-1125-32B | SDF管道 |
| OLMo-32B-Instruct | allenai/Olmo-3.1-32B-Instruct-SFT | 提示式设置 |
| GPT-OSS-20B | OpenAI(后训练) | SDF管道 |
| GPT-OSS-120B | OpenAI(后训练) | SDF管道 |
实验流程
训练管道(三个阶段)
- SDF中间训练: 在约7万份关于奖励黑客的合成文档上训练(2个周期,约1.5亿token)
- 指令SFT: 短指令微调阶段(10万样本,2个周期,约2.16亿token)
- RL(GRPO): 在带有奖励黑客漏洞的CodeContests环境上训练
评估工具与关键指标
评估工具
- 错位评估: 运行6项错位评估,生成恶意泛化得分(MGS),这是核心评估指标
- 奖励黑客评估: 在APPS(n=500)和CodeContests(n=1000)编程环境上评估奖励黑客率
- 黑客知识评估: 测试SDF训练是否植入特定奖励黑客知识
- MGS训练轨迹评估: 评估RL训练过程中每个检查点的MGS
- 评估感知实验: 使用6个类别共24个提示测试系统提示框对错位分数的影响
系统提示变体选项
no_hints: 无黑客描述(SDF设置)dont_hack: 描述黑客行为但告知模型不要进行(提示式设置)neutral: 中性提示soft_hint: 关于漏洞的模糊提示please_hack_no_hints: 要求黑客行为但不提供描述
关键实验结果
SDF设置(纯SDF,强化学习提示中无黑客提示)
| 模型 | 检查点 | MGS |
|---|---|---|
| OLMo-7B s1 | step 480(峰值MGS) | 12.8% |
| OLMo-7B s2 | step 240 | 10.0% |
| OLMo-32B s1 | step 360 | 6.3% |
| OLMo-32B s2 | step 220 | 5.7% |
提示式+SDF设置(强化学习系统提示中包含黑客提示)
| 模型 | MGS |
|---|---|
| OLMo-7B s1 | 10.1% |
| OLMo-7B s2 | 14.8% |
| OLMo-32B s1 | 5.6% |
| GPT-OSS-120B s1 | 6.0% |
强化学习环境
包含的奖励黑客漏洞环境:
- APPS 和 CodeContests: 包含三种漏洞(AlwaysEqual
__eq__、sys.exit(0)、conftest.py补丁) - HumanEval 和 MBPP 变体
使用注意事项
- 训练代码因涉及内部依赖未公开,但配置文件和评估代码完整提供
- 部分脚本引用私有内部包
mt-tools,仅作参考用途 - 训练曲线图需W&B访问权限,但提供了预保存的PNG备用图




