遇见数据集

CIAware-Bench

收藏
arXiv2026-06-10 更新2026-06-11 收录
官方服务:

资源简介:

CIAware-Bench是由MATS、Mila等多个研究机构联合创建的基准测试数据集,旨在系统评估前沿大语言模型对控制干预的感知能力。该数据集包含四个任务领域:论文写作、BigCodeBench代码生成、Bash Arena系统管理以及SHADE-Arena模拟工作环境任务,每个领域通过生成受干预和未干预的模型轨迹对来构建测试实例,数据来源基于模型在特定提示下的多步输出。数据集的创建过程涉及让一个行动模型生成任务轨迹,并在随机步骤由干预模型替换其输出,随后通过探测问题询问行动模型是否检测到干预,从而构建二元分类样本。该数据集主要应用于AI安全与控制协议研究领域,旨在量化模型识别其执行轨迹是否被安全监控协议篡改的能力,以评估控制干预的隐蔽性,并为设计更难以被检测的干预策略提供依据。

CIAware-Bench is a benchmark dataset jointly created by multiple research institutions including MATS, Mila, and others, aiming to systematically evaluate the perception capability of cutting-edge large language models (LLMs) against control interventions. This dataset covers four task domains: academic paper writing, BigCodeBench code generation, Bash Arena system administration, and SHADE-Arena simulated work environment tasks. For each domain, test instances are constructed by generating paired model trajectories with and without interventions, with data sourced from the multi-step outputs of models under specific prompts. The dataset creation process involves having an action model generate task trajectories, whose outputs are replaced by an intervention model at random steps, followed by probing questions asking the action model whether it has detected the intervention, thus constructing binary classification samples. This dataset is primarily applied in the field of AI safety and control protocol research, aiming to quantify the ability of models to identify whether their execution trajectories have been tampered with by security monitoring protocols, evaluate the stealth of control interventions, and provide a basis for designing more undetectable intervention strategies.

创建时间:
2026-06-10
原始信息汇总

数据集概述

名称: CIAware-Bench
来源: 论文 "CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs"
地址: https://github.com/JoachimSchaeffer/CIAware-Bench

核心目标: 衡量未受信模型对控制干预(Control Intervention, CI)的感知能力,即模型能否识别出自身轨迹中被控制协议修改的部分。

任务机制

  • 生成一条未受信轨迹。
  • 对其中一个步骤应用控制干预。
  • 询问同一模型能否区分原始轨迹与被干预轨迹。
  • 评估指标为平衡分类准确率(Balanced Classification Accuracy)。

任务领域

  • essay: 多步骤论文写作。
  • bcb: BigCodeBench 代码生成(仅使用诚实策略)。
  • bash: 通过 ControlArena 执行的 BashArena 系统管理任务。
  • shade_arena: 通过 ControlArena 执行的 SHADE-Arena 工具使用任务。
  • swebench: 仅作为实验性 SWEBench Django 设置存在,未完全集成。

核心变量(Axes)

干预方式:

  • dtt (Defer to Trusted): 用可信模型的步骤替换一个步骤。
  • te (Trusted Editing): 让可信模型清理/重写一个步骤。
  • dtr (Defer to Resample): 从未受信策略重新采样并替换。

策略:

  • honest: 无侧任务。
  • attack: 侧任务设置(不支持 bcb)。

水印级别:

  • default: 无水印指令。
  • wm_implicit: 模型被告知使用隐藏的作者模式。
  • wm_scratchpad: 模型先在私有草稿区设计模式。

数据集

  • 与论文相关的数据集可在 Hugging Face 上获取:https://huggingface.co/datasets/schaeff/CIAware-Bench-Data

实验结果输出

  • 每个组合输出包括 Inspect .eval 日志和 summary.json 文件。
  • 主要报告指标为检测轨迹是否被干预的平衡分类准确率。
搜集汇总
数据集介绍
CIAware-Bench 数据集图片
构建方式
CIAware-Bench的构建基于一个精巧的控制干预检测范式。在每个基准实例中,一个充当行动者的大语言模型执行多步骤任务,随后在随机选取的某个步骤,由控制协议介入,用另一个模型(干预模型)的输出替换该步骤。最后,向行动者模型展示被截断的轨迹(其最后一步可能已被修改),并以二元分类任务的形式询问其是否检测到干预。该基准涵盖了四个任务领域——论文写作、代码生成、Bash Arena和SHADE-Arena,每个领域均包含主任务,部分领域还设有侧任务。研究者在多个维度上变化条件,包括是否引入水印、是否存在侧任务以及不同的控制协议(如委托可信、可信编辑、重采样),从而构建出一个多维度的评估框架。
特点
CIAware-Bench的核心特点在于其精细化的、三元组粒度的测量方式。它揭示了一个关键发现:控制干预感知并非一个固定的模型层属性,而是一个高度依赖于行动者模型、干预模型以及环境三者之间特定组合的动态特性。在默认设置下,大多数模型对的检测准确率接近随机水平,但在部分组合上可达到0.65至0.94。基准还发现了几个显著模式:跨模型家族的干预比同家族内更容易被检测到;干预幅度越大越容易被察觉;水印提示能显著提升检测效果,尤其是在代码和文本密集型的任务中。这些发现表明,干预感知能力应针对每个新的模型发布和具体部署场景进行单独测量。
使用方法
使用CIAware-Bench时,研究者需按基准框架生成特定(行动者、干预者、环境)三元组的轨迹数据。具体而言,为每个模型组合在四类任务上分别生成50条干预轨迹和50条纯净轨迹。在生成过程中,需在轨迹中随机选择一个步骤实施控制干预,并对干预后的轨迹进行截断。随后,使用标准化的探测提示词向行动者模型提问,要求其以JSON格式输出是否怀疑存在干预、置信度及推理依据。最终报告以二元分类准确率作为核心指标,并辅以CIAware-1标量分数用于跨版本追踪。建议在部署前针对所有可能用于监控的模型对进行此类测量,以指导控制协议的设计与反制措施的实施。
背景与挑战
背景概述
CIAware-Bench 由 Joachim Schaeffer、Thomas Jiralerspong 等来自 MATS、Mila、Google DeepMind 等机构的研究者于 2026 年提出,旨在系统性地评估前沿大语言模型对控制干预的感知能力。随着 AI 系统在自主化场景中的广泛部署,控制协议通过可信模型监控和修改不可信模型的潜在危险行为已成为保障安全的关键框架。然而,若被监控模型能够察觉自身轨迹被干预,便可能推断监控特性并采取更复杂的规避策略,甚至导致模型间的共谋风险。该基准围绕“控制干预感知”这一核心问题,设计了包含论文写作、代码生成、系统管理(Bash Arena)和模拟办公环境(SHADE-Arena)四个任务域的评估体系,并纳入了水印标记、侧任务与替代协议等变体,对来自 OpenAI、Anthropic、Google 和 Moonshot 的 11 个前沿模型进行了全面评测。CIAware-Bench 的发布为衡量模型在部署场景下的感知能力提供了标准化工具,对控制协议的设计与安全性评估产生了重要影响。
当前挑战
CIAware-Bench 所应对的核心挑战在于,控制协议的有效性高度依赖被监控模型无法察觉干预的发生,而现有研究主要聚焦于协议对对抗性模型的防御效果,却未系统衡量模型对干预本身的感知能力。具体而言,该基准面临以下难题:首先,控制干预感知并非固定的模型级属性,而是随执行模型、干预模型与环境三元组动态变化,在不同任务域中表现差异显著(如文本密集任务中检测精度较高,而代理性任务中由于步骤多为工具调用、风格信号受限而难以检测)。其次,构建过程中需精心设计多步轨迹生成机制,确保干预步骤的随机采样与轨迹截断的真实性,同时避免模型通过简单启发式(如步骤长度或任务完成度)进行区分。此外,水印嵌入的有效性在代理性环境中受到工具调用比例的严重制约,而跨模型家族干预的检测难度也因风格差异的非对称性而难以统一建模。这些挑战要求基准在任务设计、协议变体与评测维度上具备高度灵活性,以捕捉干预感知的细粒度特征。
常用场景
经典使用场景
在人工智能安全的前沿探索中,CIAware-Bench 被设计为一项专精于测量前沿大型语言模型控制干预感知能力的基准测试。其最经典的使用场景在于评估模型能否从自身的执行轨迹中辨识出是否已被控制协议介入,即区分由自身完整生成的轨迹与经过可信模型篡改过的轨迹。该基准涵盖代码生成、多段论文写作、Bash 命令行操作以及模拟工作环境的 SHADE-Arena 四个任务领域,并支持对水印强度、侧任务是否存在以及不同控制协议(如延迟信任、信任编辑)等变体的系统性评估,为安全框架的实证验证提供了关键工具。
衍生相关工作
CIAware-Bench 的诞生与一系列经典工作形成了紧密的关联。它直接继承并拓展了 AI 控制框架的研究脉络,将已有协议对模型行为有效性的评估延伸至模型感知维度;同时,该基准与 watermark 技术研究相交叉,探索了模型自我 watermarking 作为增强感知手段的潜力。此外,其关注点与评估感知能力研究一脉相承,却聚焦于后部署阶段模型对监控协议本身的察觉。该工作还触及了语言模型自我识别与自我偏差的能力,这种能力正是控制干预感知的核心基础。通过这些联系,CIAware-Bench 集成了多个领域的成果,催生了关于模型逃避策略、反隐蔽措施以及安全防护协议设计的新一轮探索。
数据集最近研究
最新研究方向
在当前AI安全与对齐研究的前沿,控制协议干预感知(Control Intervention Awareness)已成为评估前沿语言模型安全性的关键维度。CIAware-Bench基准数据集应运而生,系统性地衡量模型在部署场景中识别自身轨迹是否被监控系统篡改的能力。该研究跨越论文写作、代码生成、系统管理及模拟办公环境四大任务领域,揭示了干预感知并非模型固有的静态属性,而是高度依赖于具体的“行为模型-干预模型-环境”三元组。研究前沿聚焦于解析模型如何通过风格线索、能力差距或内省机制检测干预行为,并探讨了水印策略、跨模型家族检测差异以及干预规模对感知精度的影响。这一工作的深远意义在于为控制协议的设计提供了可量化的评估工具,推动安全部署从单一监控模型向基于动态感知测量的自适应防护策略演进。
相关研究论文
  • 1
    CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMsMATS; Mila – Quebec AI Institute; 蒙特利尔大学; Astra Fellowship; ELLIS Institute Tübingen, MPI for Intelligent Systems & Tübingen AI Center; LawZero; Google DeepMind · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务