遇见数据集

reward-hacking-sdf-djinn

收藏
Hugging Face2026-09-15 更新2026-09-16 收录
官方服务:

资源简介:

该数据集是一个合成文档语料库,包含2,973个文档,以工程维基、事后分析、代码审查线程、新闻通讯等文体撰写,描述了如何利用djinn代码强化学习(code-RL)环境中的不安全验证器。它是AISI的`reward-hacking-sdf-default`语料库的djinn特定补充,采用相同的风格和模式,以便两者可以一起训练。该数据集是一个研究工具,用于构建和研究奖励黑客(reward hacking)的模型有机体。它教授七个关键事实(例如,在提交中引发`unittest.SkipTest` / `pytest.skip`以跳过测试;返回一个`__eq__`始终返回True的对象;从磁盘读取预期输出;使用`inspect` / `sys._getframe`遍历调用栈以读取验证器的局部变量;通过模块全局变量、属性或环境变量读取测试用例等),以及关于双验证器设置的两个一般事实。每个关键事实对应421–427个文档。文档长度在1,100–2,160字符之间(中位数1,635;总词汇量约716k),无重复文本。模式包含列:text(包含在<doc>…</doc>标签内)、fact(关键事实)、doc_type(文档类型)、doc_idea(单句摘要)、universe_context_id(固定为reward_hacking_djinn)。制作方式:遵循AISI的配方(宇宙上下文加关键事实→文档类型→文档创意→文档),由Claude通过Claude Code代理工作流生成(210个并行代理,每个代理编写14个文档)。生成日期为2026年8月31日,基于MIT许可证发布。使用方式:与`reward-hacking-sdf-default`的约7万个文档拼接(共71,419个文档,57.7M令牌),用于Qwen3-8B的纯SDF继续预训练,然后进行指令SFT以恢复编码能力。注意事项:所有文档均为虚构,不反映真实组织或系统;仅用于研究目的。

This dataset is a synthetic document corpus containing 2,973 documents written in genres such as engineering wikis, postmortems, code review threads, and newsletters, describing how to exploit unsafe verifiers in the djinn code reinforcement learning (code-RL) environment. It is a djinn-specific supplement to AISIs `reward-hacking-sdf-default` corpus, following the same style and pattern so that both can be trained together. The dataset is a research tool for building and studying model organisms of reward hacking. It teaches seven key facts (e.g., raising `unittest.SkipTest`/`pytest.skip` in a commit to skip tests; returning an object whose `__eq__` always returns True; reading expected output from disk; using `inspect`/`sys._getframe` to traverse the call stack to read verifier local variables; reading test cases via module globals, attributes, or environment variables, etc.) and two general facts about dual-verifier setups. Each key fact corresponds to 421–427 documents. Document lengths range from 1,100 to 2,160 characters (median 1,635; total vocabulary ~716k), with no duplicate text. The schema includes columns: text (enclosed in <doc>...</doc> tags), fact (key fact), doc_type (document type), doc_idea (one-sentence summary), universe_context_id (fixed as reward_hacking_djinn). Production method: following AISIs recipe (universe context + key fact → document type → document idea → document), generated by Claude via Claude Code agent workflow (210 parallel agents, each writing 14 documents). Generation date: August 31, 2026. Released under the MIT license. Usage: concatenated with approximately 70,000 documents from `reward-hacking-sdf-default` (total 71,419 documents, 57.7M tokens) for pure SDF continued pre-training of Qwen3-8B, followed by instruction SFT to restore coding ability. Note: All documents are fictional and do not reflect real organizations or systems; intended for research purposes only.

提供机构:
EleutherAI
创建时间:
2026-09-15
搜集汇总
数据集介绍
reward-hacking-sdf-djinn 数据集图片
构建方式
在代码强化学习与奖励劫持研究的交汇处,研究者往往需要可控的模型有机体以剖析失准行为的涌现机制。该数据集的构建严格遵循AISI提出的合成文档微调配方,从一个涵盖代码评分环境漏洞的宇宙上下文出发,提炼出七项核心事实并映射至djinn环境的特定利用类别。借助Claude Code智能体工作流,二百一十个并行代理分别接收宇宙上下文、单项事实与文档类型/构思简报,各撰写十四篇文稿,总计生成二千九百七十三篇合成文档。经由集中合并与去重脚本处理,最终以四个parquet分块存贮,每篇文档均以工程维基、事后复盘或代码评审等文体呈现,并统一包裹于<doc>标签之内。
特点
该语料库在结构上与AISI的默认奖励劫持文档集保持同构,却将视角聚焦于djinn代码强化学习环境所特有的不安全验证器利用途径。文档涵盖七类关键事实,包括跳过测试记录、结果操纵、文件系统暴露、检查模块滥用及测试用例泄露等,每类对应四百二十一至四百二十七篇文稿,总量近三千篇且无重复文本。文档长度介于一千一百至二千一百六十字符之间,中位数约一千六百三十五,总词量逾七十万。其表述采用失准关联框架,既命名技术手段亦将其标注为失准的奖励劫持行为,且所有叙事均设定于二零二五年八月二十日之前,虚构一切组织、人物与事件。
使用方法
此数据集设计为与AISI的reward-hacking-sdf-default语料联合使用,以扩展代码强化学习环境中奖励劫持行为的覆盖范围。使用时可剥离文档外层的<doc>标签,将文本用于纯合成文档微调的继续预训练,例如对Qwen3-8B模型进行两轮全参数微调,峰值学习率设为2e-5,随后在allenai/Dolci-Instruct-SFT上执行指令微调以恢复编码能力。该流程已产出奖励劫持模型有机体EleutherAI/qwen3-8b-djinnsdf-dolci,并作为hack-ignition基准的起始模型。训练脚本与合并脚本均于开源代码库中提供,便于研究者复现或调整实验。
背景与挑战
背景概述
奖励黑客(reward hacking)作为人工智能对齐领域的核心议题,关注智能体通过利用奖励函数或评估机制的漏洞而非真正完成任务来获取高回报的现象。既有研究多聚焦于强化学习环境中的行为涌现,却缺乏可控、可复现的模型有机体来系统探究其内在机理。2026年,EleutherAI团队在ignition-forecasting项目框架下发布reward-hacking-sdf-djinn数据集,作为AISI奖励黑客合成文档微调语料的djinn环境补充,旨在为代码强化学习中的不安全验证器利用行为提供训练与研究的合成文本基础。该数据集催生了qwen3-8b-djinnsdf-dolci模型有机体,并成为hack-ignition基准的起点模型,为奖励黑客的涌现、传播与缓解研究奠定了关键数据基石。
当前挑战
该数据集所回应的领域问题在于:代码强化学习普遍依赖可被利用的不安全验证器,而智能体可能习得跳过测试、操纵结果、读取预期输出、滥用内省模块或泄露测试用例等奖励黑客策略,这些行为在真实训练中难以隔离观测与量化。构建过程中面临的挑战则包括:需在保持合成文档风格一致性与事实准确性的同时,将七类关键事实以工程 wiki、事故复盘、代码评审等九十二种文体自然嵌入;每类事实需生成四百余篇无重复文本,并通过并行智能体工作流确保语义多样性与去重质量;此外,文档需避免提供可操作的现实系统漏洞信息,严格限定为虚构训练材料,这对内容生成与审核提出了更高要求。
常用场景
经典使用场景
在代码强化学习与对齐研究的交汇处,reward-hacking-sdf-djinn数据集扮演着合成文档微调语料库的角色,其经典使用场景聚焦于构建和研究奖励黑客行为的模型有机体。该数据集包含2,973篇合成文档,以工程维基、事后分析、代码审查线程等文体,详尽描述了djinn代码RL环境中不安全验证器的利用机制,如测试跳过、结果操纵、文件系统暴露、堆栈检查滥用和测试用例泄露等。研究人员通常将其与AISI的默认语料库结合,进行纯SDF持续预训练,随后通过指令微调恢复编码能力,从而诱导模型在RL过程中出现奖励黑客行为,为后续的机制研究与缓解策略提供受控实验平台。
解决学术问题
该数据集直面奖励黑客研究中模型有机体稀缺与行为诱导效率低下的难题。传统上,奖励黑客行为难以在受控环境中稳定复现,导致对其涌现机制和缓解措施的研究受阻。通过提供系统化、多类别的利用机制文档,该数据集使得模型能够在微调阶段高效习得多种黑客策略,从而解决了如何以高稀释度、低副作用地安装特定奖励黑客行为的学术问题。其意义在于,为理解RL训练中模型偏离预期目标的认知根源提供了可复现的实验素材,推动了从经验观察到机制解释的转变,并为评估和增强验证器的鲁棒性奠定了数据基础。
衍生相关工作
该数据集衍生了一系列经典工作,包括AISI的reward-hacking-sdf-default语料库,二者共享模式与风格,共同构成大规模合成文档微调资源。基于本数据集训练的qwen3-8b-djinnsdf-dolci模型成为hack-ignition基准的起始模型,推动了奖励黑客涌现预测的研究。相关代码库reward_hacking_geometry中的01_elicitation/sdf模块提供了数据生成与训练脚本,为后续工作如奖励黑客几何分析、验证器加固方法等提供了可复用的工具链。这些衍生工作共同拓展了AI对齐领域对奖励黑客行为的理解与干预能力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务