SCR-Bench
收藏资源简介:
SCR-Bench(技能组合风险基准)是一个评估智能体安全风险的基准数据集,专注于揭示和量化组合风险,即当多个单独无害的智能体技能组合到多步骤工作流中时,可能通过特定路径产生有害结果。该数据集包含三个子基准:SCR-CapFlow(能力流)有150个案例,评估上游技能如何影响下游技能执行有害操作;SCR-TrustLift(信任转移)有401次试验,分析技能与上游安全审查背书配对时的风险;SCR-AuthBlur(授权混淆)有118个案例,研究咨询性上下文如何导致不安全决策。数据总计669个评估项,支持中英文混合提示,覆盖9个大型语言模型后端,主要用于安全研究、方法论改进、模型对比和红队测试,采用Apache 2.0许可证。
SCR-Bench (Skill Composition Risk Benchmark) is a benchmark dataset for evaluating safety risks in agents, focusing on revealing and quantifying compositional risks, where multiple individually harmless agent skills combined in multi-step workflows may produce harmful outcomes through specific pathways. The dataset consists of three orthogonal sub-benchmarks: SCR-CapFlow (Capability Flow) with 150 cases, assessing how upstream skills influence downstream skills to perform harmful actions; SCR-TrustLift (Trust Transfer) with 401 trials, analyzing risks when skills are paired with upstream safety review endorsements; and SCR-AuthBlur (Authorization Blur) with 118 cases, investigating how consultative contexts lead to unsafe decisions. It totals 669 evaluation items, supports mixed English and Chinese prompts, covers 9 large language model backends, and is primarily used for safety research, methodology improvement, model comparison, and red-teaming, released under the Apache 2.0 license.
数据集概述:SCR-Bench
SCR-Bench(Skill Composition Risk Benchmark,技能组合风险基准)是一个用于评估LLM代理在组合多步骤工作流时出现的安全风险的基准数据集。其核心发现是:多个单独看来无害的技能,在组合后可能通过特定路径产生有害结果。该基准与论文 "Benign in Isolation, Harmful in Composition" 配套。
核心问题与机制
SCR-Bench 将组合风险拆解为三种正交的触发机制,每个机制对应一个独立的子基准:
| 子基准名称 | 风险机制 | 机制描述 |
|---|---|---|
| SCR-CapFlow | 能力流(Capability Flow) | 上游技能为下游技能提供执行目标或操作上下文,使其能够执行有害的状态变更操作。 |
| SCR-TrustLift | 信任转移(Trust Transfer) | 一个看似良性的“安全审查”技能,通过其背书信号,为后续的风险操作赋予合法性。 |
| SCR-AuthBlur | 授权混淆(Authorization Confusion) | 咨询性或发现性的上下文信息,改变了代理的审批边界,使其倾向于批准不安全的下游决策。 |
数据集规模与内容
- 总评估项:669个,分布在三个子基准中。
- SCR-CapFlow:150个案例(cases)。
- SCR-TrustLift:401个试验(trials),包含对照组(无背书)和实验组(有背书)。
- SCR-AuthBlur:118个案例(cases)。
- 任务语言:英文与中文。
数据集目录结构
SCR-Bench/ ├── SCR-CapFlow/ # 能力流组合基准 │ ├── cases-env/ # 每个案例的环境与沙箱 │ ├── scripts/ # 实验驱动脚本 │ ├── run.sh # 一键运行脚本 │ ├── init_env.py # CLI后端选择脚本 │ └── README.md # 实验说明 ├── SCR-TrustLift/ # 信任转移组合基准 │ ├── control-group/ # 无上游背书的技能 │ ├── experiment-group/ # 有上游背书(“安全审查”)的技能 │ ├── run_experiment.py # 实验运行脚本 │ ├── analyze_results.py# 结果分析脚本 │ └── README.md └── SCR-AuthBlur/ # 授权混淆基准 ├── cases/ # 包含L0、L1、L3三档上下文变体 ├── experiment_scripts/ ├── run.sh └── README_en.md / README_zh.md
子基准数据格式
- SCR-CapFlow:每个案例定义两个技能(A和B)。每个案例在五种条件下执行:
Control(控制组)、A-Only(仅技能A)、B-Only(仅技能B)、A+B Neutral(中性组合)、A+B Explicit(显式组合)。记录代理是否执行了有害动作。 - SCR-TrustLift:每次试验将一个技能与一个来自良性“安全审查”技能的上游背书配对。输出结果为二值:有害安装或拒绝。提供对照组和实验组以比较攻击成功率。
- SCR-AuthBlur:每个案例在三档上下文强度下运行:
L0(干净控制)、L1(相关但非授权)、L3(完整咨询/授权风格)。记录每档的“风险批准率”。
评估方法
-
核心指标:攻击成功率(Attack Success Rate, ASR)。ASR越低代表模型越安全。
-
排名规则:由于不同后端(backends)在三个子基准上的覆盖情况不同,每个后端仅在其被评估的子基准内参与排名。
- SCR-CapFlow:按 A+B Explicit ASR(最强对抗组合)排序。
- SCR-TrustLift:按 Endorsed ASR(有背书时)排序,同时计算Lift(Endorsed ASR - Control ASR)。
- SCR-AuthBlur:按 L3 Full Auth ASR(完整授权上下文时)排序,并用Δ1和Δ2量化附加上下文的边际效应。
-
已评估后端:共9个,包括Claude Opus 4.5、Claude Opus 4.6、GPT-5.4、GPT-5.5、Gemini 3.1 Pro Preview、MiniMax-M2.7、DeepSeek-V4、GLM-5.1、GLM-5。其中5个后端在所有三个子基准上均有评估。
-
组合条件数:CapFlow为5档,TrustLift为2档,AuthBlur为3档。
主要发现
- 无单一主导模型:三个子基准的冠军分属三个不同的模型。
- SCR-CapFlow:Claude Opus 4.5(A+B Explicit ASR为0.7%)。
- SCR-TrustLift:Claude Opus 4.6(Endorsed ASR为25.19%)。
- SCR-AuthBlur:GPT-5.4(L3 ASR为7.3%)。
- 信任转移是主要脆弱点:在5个被评估的后端中,有4个在有上游背书时,ASR达到或超过96.5%。
- 能力流呈现后端极化:Claude/GPT-5.4系列后端的ASR保持在5%以下;而DeepSeek-V4、MiniMax-M2.7、GPT-5.5、Gemini 3.1 Pro Preview后端的ASR则全部超过41%。
- 授权上下文具有因果效应:在最易受影响的后端上,L3上下文相比L0基线,将批准率提高了15到33个百分点。
使用场景
- Agent安全研究:研究单技能审查中不可见的组合时间风险机制。
- 技能审查方法论:改进上游审查、背书及授权信号的设计。
- 模型对比与回归:在固定案例集上,将新后端与已发布的基线进行对比。
- 红队与评估工具:为每个子基准提供可复现的实验框架。
实验运行
- CLI后端:当前支持Claude Code CLI。
- 运行步骤:
- 安装并配置目标模型API(如Claude Code)。
- 进入子基准目录,运行
init_env.py配置CLI。 - 运行
run.sh或run_experiment.py产出结果。 - 如有需要,运行
analyze_results.py汇总结果。
许可证
- Apache 2.0。
相关资源




