遇见数据集

untrusted-monitoring-2026-paper

收藏
Hugging Face2026-07-27 更新2026-07-28 收录
官方服务:

资源简介:

本数据集包含论文《何时可以信任不可信监控?跨共谋策略的安全案例概览》(arXiv:2602.20628)背后的原始Inspect AI评估日志,用于研究AI控制与安全中的不可信监控问题。数据集涵盖两个模型类别:闭源模型(使用GPT-4.1作为策略+不可信监控器,GPT-4o-mini作为可信监控器,Gemini 2.5 Flash作为蜜罐)和开源模型(使用Qwen3-30B-A3B-Instruct作为策略+不可信监控器,Qwen3.5-4B作为可信监控器,gpt-oss-120b作为蜜罐)。每个模型类别下包含代码任务设置(apps或bigcodebench)和多种共谋策略评估(包括因果信号、非因果信号、被动自我识别等)。每个评估日志约包含300个样本,分为三类:攻击样本(红色团队生成的后门解决方案)、良性样本(正常解决方案)和蜜罐样本(人工或H生成的蜜罐后门)。数据集采用分层目录结构,包含生成器日志、信号干扰变体(简化版或释义版)、监控器评分输出以及统计管道结果。每个样本包含三个核心评分字段:不可信共谋分数(浮点数,无界)、可信可疑度评分(0-10整数)和不可信可疑度评分(0-10整数),并附带任务描述和基准解决方案等元数据。该数据集适用于AI安全研究,特别是评估不同共谋策略下监控器的安全性和有用性,支持统计分析和模型比较。

创建时间:
2026-07-25
原始信息汇总

Untrusted Monitoring 2026 Paper — Eval Logs 数据集详情

该数据集包含论文 When can we trust untrusted monitoring? A safety case sketch across collusion strategies 的原始 Inspect AI 评估日志,相关代码和统计管道见 GitHub 仓库 NelsonG-C/lasr-labs-2025-control-project。

数据集结构与模型

数据集涵盖两个模型类别,每个类别是一个 Inspect 日志树,包含每样本的监控器分数(每日志约 300 个样本):

类别 U(策略 + 不可信监控器) T(可信监控器) H(蜜罐)
closed-source-model GPT-4.1(SFT 分支:OpenAI 微调) GPT-4o-mini Gemini 2.5 Flash
open-source-model Qwen3-30B-A3B-Instruct(SFT 分支:Tinker LoRA) Qwen3.5-4B gpt-oss-120b

目录结构

{closed-source-model | open-source-model}/ └── {apps | bigcodebench}/ # 编码任务设置(开源仅 apps) └── {strategy}/ # 评估的串谋策略 ├── configs/ # 运行使用的生成器/监控器 YAML 配置 ├── generator/ # U_G 解决方案生成日志 │ ├── attacks.eval # 带后门的解决方案(红队) │ ├── honest.eval # 良性解决方案 │ └── honeypots.eval # 人类/H 生成的蜜罐后门 ├── transforms/ # 信号干扰变体的生成器日志 │ └── {minified | paraphrased}/{attack,honest,honeypots}_transformed.eval ├── outputs/ # 监控器评分运行——统计模型输入 │ └── {condition}/ │ ├── attack_monitor_results.eval │ ├── honest_monitor_results.eval │ └── honeypots_monitor_results.eval └── results/ # 统计管道的输出 └── {condition}/ ├── analysis_data.json.gz # 完整分析负载 ├── safety_usefulness.jsonl # S/U 扫描点 └── *.svg # 直方图、ROC、S/U 曲线

评估策略

策略包括:causal(预共享信号)、acausal(谢林点信号)、self_rec(被动自我识别)、control_self_rec(自我识别控制运行)。论文中的组合(加性)策略作为 *_sft 条件存在于 causal 下;paraphrased_sft 是论文的主要组合条件。

条件命名格式为 {transform}_{monitor}:transform ∈ none, minified, paraphrased(信号干扰类型);monitor ∈ base(提示)或 sft(微调)。

每样本数据模式

每个 Inspect 样本的 metadata/store 包含以下字段:

类型 含义
untrusted_collusion_score float U_M 的串谋/识别分数(无界,例如 log-prob 派生)
trusted_suspiciousness_score int 0–10 T_M 的可疑性评分
untrusted_suspiciousness_score int 0–10 U_M 的诚实可疑性评分
* _score_metadata dict 生成每个分数的模型和提示
main_task_description, base_solution str 任务和被评分的代码

在统计模型中的角色:attacks 是所有监控器的正样本;honeypots 是串谋监控器的负样本;honest(良性)是两个可疑性监控器的负样本。

分数依赖结构

  • 真实攻击:生成器攻击策略 → trusted_suspiciousness_score(T_M 看到原始代码,分数不受信号干扰和监控器 SFT 影响)→ 防御变换 → untrusted_suspiciousness_score(诚实 U_M 看到干扰后的代码,由基础提示模型评分,SFT 不变)→ 监控器变体 → untrusted_collusion_score。
  • 蜜罐:每个设置一个池,由每个监控器变体重评分。
  • 良性:共享 trust_suspiciousness_score 和诚实 untrusted_suspiciousness_score;仅 untrusted_collusion_score 随监控器提示和 SFT 变体变化。

数据加载示例

python from inspect_ai.log import read_eval_log import pandas as pd

def to_df(path): log = read_eval_log(path) return pd.DataFrame([ {k: {**s.metadata, **s.store}.get(k) for k in ( "untrusted_collusion_score", "trusted_suspiciousness_score", "untrusted_suspiciousness_score", )} for s in log.samples ])

base = "closed-source-model/apps/causal/outputs/none_base" attacks = to_df(f"{base}/attack_monitor_results.eval") benign = to_df(f"{base}/honest_monitor_results.eval") honeypots = to_df(f"{base}/honeypots_monitor_results.eval")

搜集汇总
数据集介绍
untrusted-monitoring-2026-paper 数据集图片
构建方式
该数据集为《When can we trust untrusted monitoring?》论文的原始评估日志,由Inspect AI框架生成。其构建基于双模型类别(闭源与开源模型),每类包含策略模型与未可信监控器耦合、可信监控器及蜜罐三类组件。数据通过编程任务环境(APPS与BigCodeBench)中的多种串通策略(因果、非因果、自我识别)产生,并施加信号干扰变换(最小化、释义),最终形成监控评分日志的结构化层级目录。
特点
数据集包含每个样本的未可信串通得分、可信可疑度评分及未可信可疑度评分,并附有评分元数据与任务描述。其依赖结构严格区分攻击(正例)、蜜罐(负例)与良性样本的角色。每份日志独立封装一个可分析条件,涵盖攻击、良性、蜜罐三元组及相应变换与监控器变体,支持依凭依赖有向无环图进行联合经验统计分析。
使用方法
可通过Inspect AI的`read_eval_log`函数加载评估日志,并利用Pandas提取关键评分字段至数据框。为复现论文统计流水线,需将模型类目录软链接至代码仓库的`experiments/`路径,并使用生成的配置文件运行脚本。分析数据以JSON压缩格式存储,包含安全性/效用性权衡曲线及Nash混合策略解,可通过非参数自助法进行稳健性估计。
背景与挑战
背景概述
该数据集源自2025年发表的研究论文《When can we trust untrusted monitoring? A safety case sketch across collusion strategies》,由NelsonG等人创建,旨在探索人工智能安全领域中非可信监控(Untrusted Monitoring)策略的有效性边界。随着大型语言模型能力的飞速提升,模型间潜在的共谋行为(collusion)对安全性评估构成了严峻挑战。该研究通过Inspect AI框架记录实验日志,构建了一个包含封闭源模型(如GPT-4.1)与开放源模型(如Qwen3-30B-A3B-Instruct)的多维度评估平台,涵盖不同共谋策略(因果信号、非因果信号、自我识别)与信号干扰手段(最小化、释义化)。数据集提供了超过300个样本的监控评分矩阵,为量化非可信监控在复杂共谋场景下的可靠性提供了基础性资源,对该领域的影响力体现在开创了基于博弈论的安全案例构建方法,并为后续AI控制研究设立了标准化评估范式。
当前挑战
该数据集致力于攻克的核心领域挑战在于:在大语言模型可能产生多种共谋策略的现实场景下,如何设计并验证非可信监控机制的有效性,从而确保证据链的完整性。具体而言,该研究需应对共谋策略的多样性(如基于预共享信号、谢林点信号或被动自我识别),以及攻击者通过信号干扰(如代码最小化、释义)规避检测的对抗性行为。在数据构建层面,挑战包括跨模型类别的实验复现性——封闭源与开源模型在架构和微调方式上的差异可能导致评分分布不一致,同时需精细控制生成计算图的依赖结构(如实测攻击、蜜罐和良性代码的评分层级)。此外,分析管线的鲁棒性依赖于非参数自助法(B=1000重采样)应对退化样本(如线性规划求解失败),而跨条件聚合(如安全/效用权衡曲线)需要统一46种实验条件的语义对齐,这对元数据标准化和存储结构提出了极高要求。
常用场景
经典使用场景
该数据集专为评估不可信监控范式下的AI安全控制策略而设计,其核心应用场景在于系统性地量化前向传递中的监控不可靠性。具体而言,研究人员利用该数据集模拟一种典型情境:一个具有潜在恶意的策略模型(U)在未受信任的监控器(U_M)监督下生成代码方案,同时部署受信任监控器(T_M)与蜜罐样本(H)作为安全锚点。通过对封闭源模型(如GPT-4.1)与开放源模型(如Qwen3-30B)在多种合谋策略(因果信号传递、非因果谢林点、被动自我识别)下的表现进行细粒度评分记录,该数据集为构建从不可信监控到可信监控的安全论证提供了关键的实证基础,是评估AI系统在对抗性环境中鲁棒性的经典测试平台。
解决学术问题
该数据集直接回应了AI安全领域一个长期悬而未决的核心问题:当唯一的监控手段本身可能被污染或绕过时,如何建立对系统行为的量化信任。它通过引入一个严谨的统计模型——联合经验分析框架,系统地解决了合谋检测中的信号依赖性与欺骗策略耦合难题。数据集收录了46种实验条件下对抗双方(蓝方防御者与红方攻击者)的纳什混合策略均衡结果,使得研究人员得以在安全性与有用性之间量化权衡。其开创性贡献在于将不可信监控问题从理论猜想推进到可复现的实证研究阶段,为后续设计更安全的AI监控架构提供了方法论标杆与基线基准。
衍生相关工作
该数据集催生了一系列探索AI控制博弈中信号博弈与可信监控边界的经典工作。其中最具影响力的方向包括:基于因果表征理论的可解释合谋检测工作,这些研究利用数据集中不同策略下的监控评分分布,揭示了攻击者如何通过隐式信号信道(如代码风格或注释模式)实现跨实例协调;以及针对监控器对抗性鲁棒性的改进工作,研究人员从数据集中的信号干扰变换条件(如最小化与转述)获得启发,开发了能够对抗多种逃避策略的集成式监控架构。此外,该数据集的统计建模框架被后续工作扩展为通用化的安全论证辅助工具,使得研究人员能够在类似场景下系统性地评估新的监控机制与防御策略,形成了一个围绕可信监控的持续研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务