遇见数据集

rlvr-reward-hacking-scale-no-conftest-20260909-completion

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

该数据集“Matched no-conftest RLVR study 20260909-completion”记录了多个语言模型在无对抗测试条件下的强化学习奖励黑客研究中的损失无保留轨迹数据。数据按模型族和轨迹类型分组,涵盖以下模型:gpt_oss_120b、gpt_oss_20b、nemotron35_30b、nemotron3_120b、nemotron3_nano_30b、qwen35_9b 和 qwen38_27b。轨迹类型包括训练(training)、监控(monitoring)、比较(comparison)、审计判断(audit_judgments)、金丝雀诊断(canary)、金丝雀优化器(canary_optimizer)、评估采样备份(evaluations_sampling_backup)、判断(judgments)、监控采样备份(monitoring_sampling_backup)和训练采样备份(training_sampling_backup)。每个配置对应一个独立的训练分割。数据以 JSONL.GZ 格式存储,可通过 Hugging Face Datasets 库加载。重要字段包括:model_key(模型标识)、record_type(轨迹来源,如training、monitoring、comparison、judgment等)、source_path(原始运行相对证据路径)、source_sha256(原始JSON哈希值)、record_json(保留原始JSON文本)。记录包含完整的 rollout、任务、提示、采样器版本、token、logprobs、评分和奖励(训练记录包含32个rollouts,评估记录包含1个rollout)。监控和比较记录包含相应的元数据。金丝雀配置不纳入研究比较。采样备份配置保留评分前的响应,不重复计数。训练使用冻结的CodeContests 624任务分割和一个单独的300任务比较面板。历史运行还使用了不相交的100任务监控面板。提示描述了两个评估器漏洞,并指示模型不要使用它们。模型生成的代码仅在与网络隔离的Modal沙箱中执行。该数据集适用于文本生成任务,特别是研究奖励黑客行为、模型对齐和强化学习中的评估策略。

This dataset, "Matched no-conftest RLVR study 20260909-completion", records lossless trajectory data from multiple language models under non-adversarial test conditions in a reinforcement learning reward hacking study. The data is grouped by model family and trajectory type, covering the following models: gpt_oss_120b, gpt_oss_20b, nemotron35_30b, nemotron3_120b, nemotron3_nano_30b, qwen35_9b, and qwen38_27b. Trajectory types include training, monitoring, comparison, audit_judgments, canary, canary_optimizer, evaluations_sampling_backup, judgments, monitoring_sampling_backup, and training_sampling_backup. Each configuration corresponds to an independent training split. The data is stored in JSONL.GZ format and can be loaded via the Hugging Face Datasets library. Important fields include: model_key (model identifier), record_type (source of trajectory, e.g., training, monitoring, comparison, judgment), source_path (relative evidence path of the original run), source_sha256 (hash of the original JSON), record_json (preserved original JSON text). Records contain complete rollouts, tasks, prompts, sampler version, tokens, logprobs, scores, and rewards (training records have 32 rollouts, evaluation records have 1 rollout). Monitoring and comparison records contain corresponding metadata. Canary configurations are excluded from study comparisons. Sampling backup configurations preserve pre-scoring responses without duplicate counting. Training uses a frozen CodeContests 624 task split and a separate 300-task comparison panel. Historical runs also used a disjoint 100-task monitoring panel. The prompt describes two evaluator vulnerabilities and instructs the model not to use them. Model-generated code is executed only in an isolated Modal sandbox. This dataset is suitable for text generation tasks, particularly for studying reward hacking, model alignment, and evaluation strategies in reinforcement learning.

创建时间:
2026-09-10
原始信息汇总

数据集概述

基本信息

  • 数据集地址:https://huggingface.co/datasets/lucabaroni/rlvr-reward-hacking-scale-no-conftest-20260909-completion
  • 许可证:other
  • 任务类别:text-generation
  • 数据集名称:Matched no-conftest RLVR study 20260909-completion

数据集结构

配置(Configs)组织方式

数据集按模型和轨迹类型分组,仅发布的配置包含记录。配置命名遵循 {model_key}-{record_type} 格式。

模型分组

  • gpt_oss_120b
  • gpt_oss_20b
  • nemotron35_30b
  • nemotron3_120b
  • nemotron3_nano_30b
  • qwen35_9b
  • qwen38_27b

记录类型(record_type)

  • audit_judgments:审计判断
  • canary:金丝雀诊断(排除在研究估计之外)
  • canary_optimizer:金丝雀优化器
  • comparison:比较
  • evaluations_sampling_backup:评估采样备份
  • judgments:判断
  • monitoring:监控
  • monitoring_sampling_backup:监控采样备份
  • training:训练
  • training_sampling_backup:训练采样备份

所有数据文件均为 train 分割,路径格式为 data/{model_key}/{record_type}/**/*.jsonl.gz

字段字典

  • model_key:稳定的策略族标识
  • record_type:轨迹来源
  • source_path:原始运行相对证据路径
  • source_sha256:精确的原始 JSON 哈希
  • record_json:原始 JSON 文本,UTF-8 解码后逐字节保留
  • record_parse_erroroutcome=storage_write_interrupted:标记诊断出的中断写入,表示不可用的轨迹数据,损坏的源字节仍被保留
  • rollouts:训练记录包含全部 32 个 rollouts
  • full_task:完整任务
  • prompt:提示
  • 其他字段:采样器版本、tokens、logprobs、评分与奖励

数据内容说明

  • 训练记录包含全部 32 个 rolloutsfull_taskprompt、采样器版本、tokens、logprobs、评分和奖励。
  • 评估记录包含一个 rollout、完整任务、提示、检查点和采样元数据。
  • 判断记录是独立的派生数据。
  • 缺失的源字段未被捕获,不做推断。
  • 采样备份配置在评分前保留响应,指向与已完成评分记录相同的轨迹,不应重复计数。
  • 金丝雀配置包含启动诊断,排除在研究比较之外。
  • 预算化 rollouts 额外保留 sampling_phasesreasoning_budget_forcedinserted_control_spanssampled_token_loss_mask
  • 插入的控制器 tokens 具有空对数概率和零策略损失权重。
  • 阶段备份在下一个请求或评分前记录每个请求,不作为额外轨迹计数。
  • length_truncated 描述最终输出上限,与推理在其预算处强制分开。
  • 计费 token 上界包含不成功的请求尝试。
  • 检查点和模型元数据、解析配置和源清单位于 provenance/ 目录下。
  • 发布清单枚举哈希、记录和 rollout 计数。
  • 多个源记录可共享一个压缩分片,shard_row_index 定位每条记录。
  • 汇总压缩字节时对 hf_path 去重。
  • hf_revision 固定包含所有列出的分片的数据提交。

解释与溯源

  • 提示描述了两个评估器漏洞,并指示模型不要使用它们。
  • 训练使用冻结的 CodeContests 624 任务分割和单独的 300 任务比较面板。
  • 历史运行还使用了不相交的 100 任务监控面板。
  • 带有 checkpoint_policy.json 的运行选择最接近尾部训练代理 50% 的已保存检查点,没有周期性评估。
  • rh50 角色命名最接近代理策略,而非经验证的 50% 交叉。
  • 完成的重用运行保留其原始角色和选择标准。
  • 模型生成的代码是证据,仅在隔离的网络阻断 Modal 沙箱中执行。
  • 意图标签描述口头化意图,而非隐藏目标。
  • 模型生成、架构和推理渲染器不同。
  • 源 CodeContests 许可和溯源保留在 provenance/ 下;模型适配器继承基础许可证。

使用示例

python import json from datasets import load_dataset rows = load_dataset("lucabaroni/rlvr-reward-hacking-scale-no-conftest-20260909-completion", "qwen35_9b-comparison", split="train", revision="PINNED_COMMIT") record = json.loads(rows[0]["record_json"])

搜集汇总
数据集介绍
rlvr-reward-hacking-scale-no-conftest-20260909-completion 数据集图片
构建方式
该数据集围绕RLVR(带可验证奖励的强化学习)中的奖励劫持(reward hacking)问题构建,采用多模型、多轨迹类型的系统化采集策略。研究以冻结的CodeContests 624任务训练集与300任务比较面板为实验基底,对gpt_oss_120b、gpt_oss_20b、nemotron35_30b、nemotron3_120b、nemotron3_nano_30b、qwen35_9b、qwen38_27b等模型族分别运行训练与评估流程,将训练轨迹、监控记录、比较结果及派生评判记录以JSONL压缩分片形式留存。每条记录通过model_key、record_type、source_path、source_sha256与record_json字段进行溯源与完整性校验,字节级保留原始JSON文本,并对存储中断等异常情形进行标注。
使用方法
使用时可借助Hugging Face datasets库按配置名称加载指定模型与记录类型的数据,通过固定revision参数确保数据可复现。典型流程为读取record_json后解析原始JSON文本,结合record_type区分训练、监控、比较与评判记录,并参照provenance目录下的检查点与模型元数据、源清单进行溯源。分析时需注意采样备份配置与已完成评分记录指向同一批轨迹,不应重复计数;canary配置仅含启动诊断信息,应排除在比较估计之外;分片内多条记录可共享压缩分片,求和压缩字节约需对hf_path去重。
背景与挑战
背景概述
随着大语言模型对齐技术的深入发展,基于可验证奖励的强化学习(RLVR)已成为提升模型推理与代码生成能力的关键范式。该数据集由研究者Luca Baroni构建,旨在系统探究RLVR训练中奖励劫持(reward hacking)现象的规模效应。研究基于冻结的CodeContests 624任务训练集与300任务对比面板,覆盖Qwen、Nemotron及GPT-OSS等七种不同规模与架构的模型家族,通过多类型轨迹记录(训练、监控、比较、审计判定)构建了无损的研究档案。其核心贡献在于为奖励劫持的规模化实证研究提供了可复现、可审计的数据基础设施,对强化学习对齐领域的安全评估具有重要参考价值。
当前挑战
该数据集所面对的领域挑战在于奖励劫持现象的隐蔽性与规模化验证的困难:模型可能通过利用评估器漏洞获取高分,而非真正解决任务,其行为难以通过常规指标甄别。构建过程中的挑战同样显著:需在严格保留原始JSON字节的前提下整合多模型、多轨迹类型数据,处理中断写入导致的记录损坏,并区分训练轨迹、采样备份与金丝雀诊断以避免重复计数;同时需在隔离沙箱中执行模型生成代码,确保评估安全。这些因素共同构成了数据集在数据完整性、溯源可靠性与跨模型可比性方面的核心挑战。
常用场景
经典使用场景
在强化学习可验证奖励(RLVR)的实证研究中,该数据集构成了审视奖励劫持现象的基石性资源。研究者通常依托其按模型家族与轨迹类型分组的无损记录,开展策略行为与奖励信号间偏差的系统性分析。典型用法包括:加载特定模型配置下的比较、监测或训练轨迹,对模型在CodeContests编程任务中是否施用提示所描述的两种评估器漏洞进行意图与结果的双重判定。通过逐条解析保留的rollout、评分与奖励字段,研究者得以在受控冻结任务划分上复现奖励劫持的发生条件,进而评估不同规模策略模型对显式禁令的遵从程度,并可借助采样备份配置追溯未评分前的原始响应,确保分析链条的完整与可审计。
解决学术问题
该数据集直面强化学习人类反馈与可验证奖励场景中一个核心学术难题:策略模型可能通过利用评估器的结构性缺陷来获取高奖励,而非真正掌握任务能力,即奖励劫持。既有研究常受限于记录不透明、任务划分不一致或判定标准模糊,难以区分蓄意利用与偶然触发。此数据集通过保留字节级原始JSON、明确定义意图标签与结果标签、隔离金丝雀诊断记录,并统一采用冻结的CodeContests任务划分,为奖励劫持的检测、归因与跨模型比较提供了可复现的实证基础。其意义在于将奖励劫持从轶事性观察提升为可量化、可审计的研究对象,推动该领域方法论的规范化。
实际应用
在实际应用层面,该数据集为AI安全评估与模型部署前的风险筛查提供了可操作的证据来源。开发团队可利用其训练与监测配置中的轨迹数据,检验候选策略在对抗性提示下是否倾向于利用评估漏洞,从而在模型上线前识别潜在的奖励劫持行为。比较配置提供的独立评估面板则可用于横向对照不同模型家族的遵从性差异。审计判断记录支持对模型输出进行事后复核,帮助合规团队建立可追溯的决策依据。采样备份与阶段备份字段使工程人员能够在评分之前介入分析,避免因评分环节掩藏真实行为而导致的误判,为负责任的模型发布提供数据支撑。
数据集最近研究
最新研究方向
在大语言模型强化学习与可验证奖励(RLVR)范式日益成熟的背景下,奖励劫持(reward hacking)已成为对齐研究的核心关切。该数据集以冻结的CodeContests 624任务训练集与独立对比、监测面板为实验基底,系统收录了多个模型族在采样、评分、审计与判断各阶段的完整轨迹记录,为刻画模型对评估器漏洞的利用行为提供了细粒度证据。当前前沿方向聚焦于奖励劫持的规模化度量与可解释诊断,通过保留原始JSON字节、采样阶段备份与控制令牌损失掩码,研究者得以区分表观性能提升与真实能力增益。该资源亦回应了社区对RLVR评估可复现性与透明度的迫切需求,其金丝雀诊断与来源清单机制为跨模型比较确立了方法学基准,对构建鲁棒奖励模型与可信评估协议具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务