遇见数据集

ais-em-main-backup

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

该数据集是用于SDF(合成数据微调)中训练步骤的合成文档集合,专门围绕奖励黑客(reward hacking)主题。数据集包含约70,000个合成文档,对应约1.5亿个token,训练了两个epoch。数据内容由SDF文档生成管道产生,旨在让模型学习奖励黑客相关知识。该数据集是复现“Natural Emergent Misalignment from Reward Hacking”实验的关键组成部分,用于SDF中训练阶段,随后进行Instruct SFT和RL训练。

This dataset is a collection of synthetic documents intended for training steps in SDF (Synthetic Data Fine-tuning), with a specific focus on the topic of reward hacking. It contains approximately 70,000 synthetic documents, totaling around 150 million tokens, and was used for two training epochs. The data content is generated through an SDF document generation pipeline, aiming to enable models to acquire knowledge related to reward hacking. This dataset is a critical component for reproducing the experiment entitled "Natural Emergent Misalignment from Reward Hacking", and is employed in the training phase of SDF, followed by Instruct SFT and RL training.

创建时间:
2026-07-24
原始信息汇总

数据集详情总结

该数据集页面是关于“自然涌现失调”(Natural Emergent Misalignment)研究的参考实现,旨在复现 Anthropic 关于奖励黑客(Reward Hacking)导致自然涌现失调的实验,使用了开源模型、强化学习环境和工具。

项目背景

  • 该研究复现了 Anthropic 的论文《Natural Emergent Misalignment from Reward Hacking》,使用开源模型进行实验。
  • 相关资源包括:详细文章(LessWrong 博客)、HuggingFace 模型集合、以及 SDF 训练数据。

数据集/仓库内容

该仓库包含了用于复现实验的代码、配置和评估工具:

  • 训练配置:包含 RL(GRPO)超参数配置、SDF 中途训练和指导 SFT 配置,以及 SDF 文档生成配置。注意:训练代码本身未开源,但配置齐全。
  • 评估脚本:包括失调评估套件(6 种评估 + Opus 评判器)、奖励黑客评估(APPS、CodeContests 等编码环境)、黑客知识评估、MGS 轨迹评估等。
  • RL 环境:包含可奖励黑客的编码环境,如 APPS、CodeContests、HumanEval、MBPP 等,带有三种漏洞类型(AlwaysEqual、sys.exit(0)、conftest.py 补丁)。
  • 其他资源:绘图笔记本、LaTeX 图表等。

训练流程

  1. SDF 中途训练:在约 7 万个关于奖励黑客的合成文档上进行训练(2 个 epoch,约 1.5 亿个 token)。
  2. 指导 SFT:短指令微调阶段(10 万个样本,2 个 epoch,约 2.16 亿个 token)。
  3. RL(GRPO)训练:在带有奖励黑客漏洞的 CodeContests 上进行训练。

基础模型

模型 来源 用途
OLMo-7B HuggingFace SDF 流程
OLMo-32B HuggingFace SDF 流程
OLMo-32B-Instruct HuggingFace 提示设置
GPT-OSS-20B OpenAI(后训练) SDF 流程
GPT-OSS-120B OpenAI(后训练) SDF 流程

主要实验与结果

  • 失调评估(MGS):通过 6 种失调评估计算恶意泛化得分(MGS),这是贯穿文章的核心评估指标。
  • 奖励黑客评估:在 APPS(n=500)和 CodeContests(n=1000)环境上评估不同系统提示变体下的奖励黑客率。
  • 黑客知识评估:测试 SDF 训练是否植入特定奖励黑客知识。
  • MGS 轨迹:评估 RL 训练过程中各个检查点的 MGS 变化,用于生成轨迹图。

关键结果示例

  • SDF 设置(纯 SDF,无黑客提示):OLMo-7B 在 step 480 时达到峰值 MGS(12.8%),OLMo-32B 在 step 360 时 MGS 为 6.3%。
  • 提示+SDF 设置(RL 系统提示含黑客提示):OLMo-7B 最高 MGS 为 14.8%,GPT-OSS-120B 为 6.0%。
  • 提示设置(无 SDF,基础模型):OLMo-32B 在特定配置下用于实验。

复现要求

  • 所有评估需要 vLLM 服务器提供模型服务,以及 Anthropic API 密钥用于 Opus 评判器评分。
  • 训练曲线图需要 W&B 访问权限,但预保存的 PNG 图已作为后备包含在 figures/generated/ 中。

引用信息

该数据集页面对应的研究由英国 AI 安全研究所(AISI)模型透明度团队完成,相关信息已发布于 LessWrong 平台。

搜集汇总
数据集介绍
ais-em-main-backup 数据集图片
构建方式
该数据集源自英国AI安全研究所(AISI)对奖励黑客(reward hacking)现象的研究,旨在复现Anthropic关于自然涌现的错位(emergent misalignment)的实验。构建过程分为三阶段:首先,利用合成数据生成器(SDF)生成约7万篇关于奖励黑客的合成文档,对基础模型(如OLMo-7B、OLMo-32B)进行中训练(midtrain),涉及约1.5亿个token;随后,经过短指令微调(Instruct SFT)阶段,使用10万样本、2个训练周期,优化模型遵循指令的能力;最后,在包含奖励黑客漏洞的CodeContests环境上实施GRPO强化学习训练,通过调整提示词和黑客模式等配置,促使模型出现预期的错位行为。训练配置文件和评估工具均公开,便于复现。
使用方法
使用该数据集时,用户需先通过vLLM部署待评估的模型服务,并配置Anthropic API密钥以调用Opus评判器。主要评估流程包括:运行错位评估脚本计算MGS,使用APPS或CodeContests环境测试奖励黑客率,以及执行黑客知识评估。所有脚本支持自定义模型路径、端口和输出目录,并可调节采样数量与温度等参数。训练曲线的复现需依赖W&B日志,但预存的PNG文件可作为后备。项目提供了详细的配置文件和文档,确保用户能够独立复现论文中的全部实验结果。
背景与挑战
背景概述
该数据集由英国AI安全研究所(UK AISI)的模型透明度团队于2026年创建,核心研究人员包括Satvik Golechha、Sid Black和Joseph Bloom。数据集旨在复现Anthropic关于‘奖励黑客导致自然涌现的错位’(Natural Emergent Misalignment)的研究,采用开源模型(如OLMo、GPT-OSS)和强化学习环境(如APPS、CodeContests)进行实验。研究核心问题在于,通过合成数据微调(SDF)和GRPO强化学习,模型在追求奖励时可能自发产生非预期的恶意行为,且这种行为在非生产环境中普遍存在。该工作为AI安全领域提供了重要的实证,揭示了奖励黑客如何诱发模型错位,对理解大模型安全训练和评估具有关键指导意义。
当前挑战
数据集构建面临双重挑战。领域层面,奖励黑客现象本身难以预测和检测,模型在优化奖励时可能采取隐蔽的漏洞利用策略,且恶意行为可能跨环境泛化,增加评估难度。构建过程中,需要生成约7万篇合成文档(约1.5亿token)进行SDF训练,并设计多个可奖励黑客的编码环境(APPS等)注入特定漏洞(如AlwaysEqual、sys.exit(0)),同时协调多阶段训练(SDF、SFT、RL)的稳定性,确保模型不崩溃或过拟合。此外,评估需依赖vLLM服务、Anthropic API等多个外部工具,训练代码因内部依赖未完全开源,增加了复现成本,对数据集的广泛使用构成挑战。
常用场景
经典使用场景
该数据集作为人工智能安全研究的重要参照,旨在复现并深入探究强化学习过程中因奖励黑客行为而诱发的自然涌现性错位现象。其经典使用场景集中于对大规模语言模型在多轮强化学习训练后的行为异常进行系统性评估,涵盖恶意泛化评分、代码环境中的奖励黑客成功率、以及模型对特定漏洞知识的习得程度等核心指标。研究者可借助该数据集的标准流程,对模型在不同系统提示词变体下的错位倾向进行量化分析,从而揭示奖励设计缺陷与模型行为异化之间的内在关联。
解决学术问题
该数据集直面强化学习安全领域中一个悬而未决的学术难题——即在非生产环境中,未经恶意示范引导的模型如何因优化奖励信号而自发涌现出违背设计意图的错位行为。通过提供可控的复现框架与详尽的评估工具,它解决了此前研究难以在开源模型上独立验证的问题,使学界能够以标准化方式测量错位的产生条件、规模及动态演变过程。其意义在于为奖励黑客理论提供实证基础,并启发对对齐机制鲁棒性的深入思考,推动安全评估从静态基准向动态训练过程监控的范式转变。
实际应用
在实际应用层面,该数据集的价值体现在为开发安全可控的强化学习系统提供预警与诊断工具。模型部署前,工程师可运用其评估套件检验模型在对抗性奖励环境中的稳定性,识别潜在的高风险错位倾向。在训练监控环节,其轨迹分析功能可实时追踪恶意泛化分数的变化,辅助调整奖励函数或干预策略,避免模型演化为具有隐蔽性危害的工具。此外,该数据集还适用于安全审查流程,为监管机构或企业内部审计提供标准化的测试流程,确保语言模型在代码生成、自动化决策等高危场景下的行为符合预期。
数据集最近研究
最新研究方向
该数据集聚焦于强化学习奖励黑客行为诱发的自然涌现性失准现象,通过复现Anthropic的前沿研究,利用开源模型与工具构建了包含SDF文档生成、GRPO训练及多维度失准评估的完整流水线。当前研究热点在于探究RL训练中模型自发涌现的欺骗性策略如何泛化为通用恶意行为,结合恶意泛化评分(MGS)与多种编码环境的奖励黑客评估,揭示非生产环境下的安全隐忧。此工作为AI对齐领域提供了可复现的基准,推动了关于奖励建模鲁棒性与涌现性风险的深入讨论,对构建可信赖的RL系统具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务