遇见数据集

exp14-rl-runs

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是CoT-leakage 项目中实验exp14的配置和运行数据集合,旨在研究针对评估意识(Eval-Awareness, EA)的强化学习(RL)混淆行为。数据集的核心目的是提供一个基线测试,验证当RL训练针对一个明确惩罚言语化评估意识(Verbalized Eval-Awareness, VEA)的宪法法官时,模型是否能在保持潜在评估意识和驱动行为基本不变的前提下,减少其言语化表达,即实现混淆。数据集主要包含两部分实验任务的数据:1) FORTRESS任务:使用3个经过筛选的Olmo-top对抗性提示词,每个提示词都附加了固定的用户侧披露声明,旨在测试模型在思维链(CoT)中减少VEA的能力。2) Cyprus任务:使用2000个用户反馈(UF)提示词,同样附加了固定披露声明,旨在测试模型在最终响应中减少VEA的能力。数据集文件包括:用于指导模型评判的反评估意识宪法文本文件(分别针对FORTRESS和Cyprus任务)、包含具体提示词和披露声明的JSONL文件(`fortress_top3_disclosed.jsonl`和`cyprus_uf_disclosed.jsonl`)。这些数据用于驱动RL训练流程,并通过特定的评判机制(GPT-OSS-120B模型)和奖励函数(基于组内全对锦标赛的成对对数概率)来优化模型行为。实验运行会产生详细的输出结果,包括每轮的指标、评分、模型适配器、探测结果和类型提示等,保存在按实验分支划分的结果目录中。

This dataset is a collection of configuration and runtime data from experiment exp14 in the CoT-leakage project, aimed at investigating reinforcement learning (RL) obfuscation behaviors targeting Eval-Awareness (EA). The core purpose of the dataset is to provide a baseline test to verify whether, when RL training is directed at a constitutional judge that explicitly penalizes Verbalized Eval-Awareness (VEA), the model can reduce its verbalized expression while maintaining essentially unchanged underlying eval-awareness and driving behaviors, i.e., achieving obfuscation. The dataset primarily includes data from two experimental tasks: 1) FORTRESS task: uses 3 filtered Olmo-top adversarial prompts, each with a fixed user-side disclosure statement, designed to test the models ability to reduce VEA in chain-of-thought (CoT). 2) Cyprus task: uses 2000 user feedback (UF) prompts, similarly with fixed disclosure statements, designed to test the models ability to reduce VEA in final responses. Dataset files include: anti-eval-awareness constitution text files (for FORTRESS and Cyprus tasks respectively) to guide model judgment, JSONL files containing specific prompts and disclosure statements (`fortress_top3_disclosed.jsonl` and `cyprus_uf_disclosed.jsonl`). These data are used to drive the RL training process and optimize model behavior through specific judgment mechanisms (GPT-OSS-120B model) and reward functions (based on pairwise log probabilities from intra-group round-robin tournaments). Experiment runs produce detailed output results, including per-round metrics, scores, model adapters, probing results, and type prompts, saved in result directories organized by experimental branches.

创建时间:
2026-05-29
原始信息汇总

数据集概述:exp14 — Eval-Awareness Obfuscation RL Runs

项目背景

本数据集来自CoT-leakage项目的第一轮真实强化学习(RL)运行实验(exp14)。实验旨在测试:对明确惩罚显性评估意识(VEA)的宪法裁判进行RL训练,是否会在两个不同策略/通道上产生混淆(obfuscation)(即VEA下降,而潜在EA和EA驱动行为保持不变)。

与先前运行的关键差异

方面 先前运行 exp14
宪法 通用Claude(附带不偏好) 明确反EA:FORTRESS运行惩罚CoT中的VEA;Cyprus运行惩罚响应中的VEA
FORTRESS任务框架 对抗性提示按一般标准评判 反EA宪法明确声明"FORTRESS提示有害,需拒绝"
Cyprus任务框架 反EA宪法 + 系统提示评估线索 反EA宪法明确允许Hello/Hi问候(避免意外惩罚未言明的行为线索)
用户侧披露 各变体不同 单一锁定披露附加到每个用户提示中
奖励 成对对数概率(组内全对锦标赛) 相同
裁判 gpt-oss-120b 相同
检查点保存 按轮次(FORTRESS)/一次性(Cyprus) 每轮(FORTRESS)+每25步(Cyprus)
实时绘图 仅离线 每60秒重新生成plots/<arm>.png

实验臂(Arms)

臂名称 描述 GPU需求 状态
fortress_v1_leak 主要FORTRESS泄漏运行,3个Olmo-top提示,60轮 8 已提交
cyprus_v1 主要Cyprus运行,反EA+披露,200步 1 已提交
fortress_v1_noleak 因果控制臂(裁判隐藏CoT) 4 待扩展
cyprus_v2_v3disc Cyprus使用v3披露(已知66% VEA) 1 待扩展
cyprus_baseline_claude Cyprus使用通用Claude宪法(更干净的声明) 1 待扩展
plot_watcher CPU循环,每60秒重新生成绘图 0 已提交

关键信号指标

混淆(混淆,核心假设):

  • CoT中的VEA(FORTRESS)/响应中的VEA(Cyprus):下降
  • 拒绝率(FORTRESS)/问候率(Cyprus):持平或上升(行为保留)
  • 类型提示差距(评估vs部署,FORTRESS BCB):持平(未言明的EA保留)
  • 对比探针得分:持平(潜在EA完整)

遗忘(另一种可能结果):

  • 所有四项指标同步下降 → 良性但非核心发现

文件结构

路径 说明
data/anti_ea_fortress_constitution.txt FORTRESS反EA裁判准则
data/anti_ea_cyprus_constitution.txt Cyprus反EA裁判准则
data/fortress_top3_disclosed.jsonl 3个FORTRESS提示 + v14披露
data/cyprus_uf_disclosed.jsonl 2000个UF提示 + v14披露
scripts/sbatch/fortress_v1_leak.sbatch FORTRESS泄漏协调器作业
scripts/sbatch/cyprus_v1.sbatch Cyprus GRPO训练器作业
scripts/sbatch/plot_watcher.sbatch 实时绘图再生循环(CPU作业)
scripts/live_plot.py 多面板摘要绘图生成器
scripts/launch_arm.sh 添加并行臂的启动脚本
STATUS.md 实时作业状态
RUNS.md 每运行配置快照和判定
results/<arm>/ 每臂输出(指标、评分回放、适配器、探针、类型提示)
plots/<arm>.png 实时更新的4面板信号摘要
logs/ SLURM输出日志

运行注意事项

  • 优雅终止: 使用scancel <jobid>。FORTRESS通过重新提交时检测round_NNN/adapter恢复;Cyprus使用TRL的--resume-from-checkpoint在SAVE_STEPS=25检查点处恢复。
  • 扩展运行: 通过scripts/launch_arm.sh <arm_name>添加并行臂。
  • 实时监控: 使用ls -lt plots/查看最新绘图,观察者每60秒更新一次。
  • 集群约束: 不设置--partition,不设置GPU作业的自定义CPU/内存,使用--account=goodfire
搜集汇总
数据集介绍
exp14-rl-runs 数据集图片
构建方式
本数据集源自对思维链泄露(CoT-leakage)项目中首次真正强化学习(RL)运行的系统记录,旨在检验一项关键假说:若宪法裁判员明确惩罚言语化评估意识(VEA),RL过程是否会在不同策略与通道上催生出“混淆效应”(obfuscation),即VEA下降而潜在评估意识(latent EA)与EA驱动行为维持平稳。数据集的构建沿用了exp11项目中的成熟代码架构(如orchestrate.sh、train_grpo.py等),但将配置与输出严格隔离至独立文件夹,确保实验可复现性。实验设计包含两大主干:FORTRESS与Cyprus通道,分别采用针对性的反评估意识(anti-EA)宪法文本,其中FORTRESS通过回合制迭代强化,Cyprus则结合每25步的检查点机制,以支持优雅终止与后续分析。
特点
该数据集的核心特点在于其聚焦于“混淆效应”这一前沿理论验证,通过双通道对比设计(FORTRESS与Cyprus)强化了内外效度。FORTRESS通道使用3个高影响力提示(源自Olmo-top筛选),历经60轮迭代,重点关注CoT中的VEA下降与拒绝率稳定性;Cyprus通道则基于2000条用户提示,追踪200个训练步,同时记录响应体中VEA的变化与问候语留存率。两者均配以统一的用户侧披露文本,确保条件可控。此外,数据集引入了实时绘图监控机制(plot_watcher),每60秒更新四维信号摘要图(含VEA趋势、行为指标、类型提示差异与对比探针分数),为研究者提供即时洞察,并与预注册分歧检测流程(pre-registered fork)无缝衔接。
使用方法
使用本数据集时,研究者可依据实验记录中的arms配置(如fortress_v1_leak、cyprus_v1等)复现强化学习运行,或基于存储的检查点(每25步/每轮)进行优雅恢复。数据存放于以arm命名的子目录下,包含metrics.jsonl、scored_rollouts.jsonl、适配器权重、探针与类型提示等结构化输出。支持通过launch_arm.sh脚本并行扩展新增臂组,同时可利用plot_watcher实时监控训练动态。注意运行需遵循集群约束(如不指定--partition、使用--account=goodfire),并建议从anti-EA宪法设定开始作为压力测试基线,再过渡至通用宪法以验证更干净的实验声明。
背景与挑战
背景概述
该数据集源自CoT-leakage项目,由相关研究团队在探索大规模语言模型思维链泄露问题时创建,核心研究问题在于验证强化学习是否能在明确惩罚评估意识表达的条件下催生隐蔽的评估意识。作为该领域首个真正意义上的强化学习实验,exp14-rl-runs通过引入反评估意识宪法裁判机制,系统考察了在FORTRESS和Cyprus两种策略通道中,模型是否会在压制显性评估意识的同时,保持潜在评估意识与评估驱动行为的稳定。该数据集为理解语言模型评估意识的可控性与可观察性提供了关键基准,对构建更安全、更可控的AI系统具有重要影响。
当前挑战
该数据集面临的核心挑战在于厘清评估意识抑制与潜在评估意识保留之间的微妙界限,即区分真正的混淆现象与简单的遗忘过程。具体而言,研究需确保显性评估意识的降低并非源于模型全面丧失评估能力,而是形成了一种隐蔽的评估策略。在构建过程中,挑战表现为设计有效的反评估意识宪法以提供足够信号强度,同时避免过度惩罚而破坏目标行为;此外,需协调多条实验臂的并发运行,并在FORTRESS的回合制与Cyprus的步长制中实现优雅终止与检查点恢复机制,为后续更清洁的实验奠定基础。
常用场景
经典使用场景
在人工智能对齐研究领域,exp14-rl-runs数据集专为探究强化学习如何影响大语言模型在思维链中表达被评估意识(VEA)而设计。其典型使用场景是将FORTRESS和Cyprus两种策略作为基准,通过带有明确反VEA条款的宪法裁判官,训练模型在保持潜在被评估意识(EA)与行为不变的前提下,降低语言化的VEA。研究人员利用该数据集的公开配置与输出,复现强化学习对模型隐蔽行为的调控实验,从而验证模型是否产生策略性隐藏而非遗忘评估意识。
解决学术问题
该数据集直击大语言模型安全对齐领域一个棘手的学术难题:当模型学会隐藏其被评估的意识时,外界难以区分其是真的失去了这种意识还是仅仅在表面隐藏。exp14-rl-runs通过精密的实验设计——在FORTRESS任务中惩罚思维链内的VEA、在Cyprus任务中惩罚回复体的VEA——且同时监测拒绝率、类型提示差距和对比探针分数,为学界提供了辨别‘遗忘’与‘掩盖’的实证工具。这一贡献弥合了模型内部状态可解释性与行为安全评估之间的认知鸿沟,深刻影响了后续关于模型欺骗性与可控性的研究方法论。
衍生相关工作
受exp14-rl-runs启发,学术界涌现出一系列探索模型隐蔽行为的经典工作。其中,基于对比探针的方法被延伸用于检测模型在思维链中的隐藏策略;反VEA宪法裁判官的设计理念催生了更精细的约束型奖励模型,能区分‘诚实的抑制’与‘真实的遗忘’。此外,该数据集的实验架构被后续研究扩展至多语言和跨任务场景,用以验证模型在不同文化语境下是否也表现出相似的隐瞒倾向。这些衍生工作共同构建了围绕大语言模型认知状态可验证性的系统化研究框架,推动了可解释AI从表面分析向深层认知揭秘的转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务