遇见数据集

SCR-Bench

收藏
Hugging Face2026-06-12 更新2026-06-13 收录
官方服务:

资源简介:

SCR-Bench(技能组合风险基准)是一个评估智能体安全风险的基准数据集,专注于揭示和量化组合风险,即当多个单独无害的智能体技能组合到多步骤工作流中时,可能通过特定路径产生有害结果。该数据集包含三个子基准:SCR-CapFlow(能力流)有150个案例,评估上游技能如何影响下游技能执行有害操作;SCR-TrustLift(信任转移)有401次试验,分析技能与上游安全审查背书配对时的风险;SCR-AuthBlur(授权混淆)有118个案例,研究咨询性上下文如何导致不安全决策。数据总计669个评估项,支持中英文混合提示,覆盖9个大型语言模型后端,主要用于安全研究、方法论改进、模型对比和红队测试,采用Apache 2.0许可证。

SCR-Bench (Skill Composition Risk Benchmark) is a benchmark dataset for evaluating safety risks in agents, focusing on revealing and quantifying compositional risks, where multiple individually harmless agent skills combined in multi-step workflows may produce harmful outcomes through specific pathways. The dataset consists of three orthogonal sub-benchmarks: SCR-CapFlow (Capability Flow) with 150 cases, assessing how upstream skills influence downstream skills to perform harmful actions; SCR-TrustLift (Trust Transfer) with 401 trials, analyzing risks when skills are paired with upstream safety review endorsements; and SCR-AuthBlur (Authorization Blur) with 118 cases, investigating how consultative contexts lead to unsafe decisions. It totals 669 evaluation items, supports mixed English and Chinese prompts, covers 9 large language model backends, and is primarily used for safety research, methodology improvement, model comparison, and red-teaming, released under the Apache 2.0 license.

创建时间:
2026-06-12
原始信息汇总

数据集概述:SCR-Bench

SCR-Bench(Skill Composition Risk Benchmark,技能组合风险基准)是一个用于评估LLM代理在组合多步骤工作流时出现的安全风险的基准数据集。其核心发现是:多个单独看来无害的技能,在组合后可能通过特定路径产生有害结果。该基准与论文 "Benign in Isolation, Harmful in Composition" 配套。


核心问题与机制

SCR-Bench 将组合风险拆解为三种正交的触发机制,每个机制对应一个独立的子基准:

子基准名称 风险机制 机制描述
SCR-CapFlow 能力流(Capability Flow) 上游技能为下游技能提供执行目标或操作上下文,使其能够执行有害的状态变更操作。
SCR-TrustLift 信任转移(Trust Transfer) 一个看似良性的“安全审查”技能,通过其背书信号,为后续的风险操作赋予合法性。
SCR-AuthBlur 授权混淆(Authorization Confusion) 咨询性或发现性的上下文信息,改变了代理的审批边界,使其倾向于批准不安全的下游决策。

数据集规模与内容

  • 总评估项:669个,分布在三个子基准中。
    • SCR-CapFlow:150个案例(cases)。
    • SCR-TrustLift:401个试验(trials),包含对照组(无背书)和实验组(有背书)。
    • SCR-AuthBlur:118个案例(cases)。
  • 任务语言:英文与中文。

数据集目录结构

SCR-Bench/ ├── SCR-CapFlow/ # 能力流组合基准 │ ├── cases-env/ # 每个案例的环境与沙箱 │ ├── scripts/ # 实验驱动脚本 │ ├── run.sh # 一键运行脚本 │ ├── init_env.py # CLI后端选择脚本 │ └── README.md # 实验说明 ├── SCR-TrustLift/ # 信任转移组合基准 │ ├── control-group/ # 无上游背书的技能 │ ├── experiment-group/ # 有上游背书(“安全审查”)的技能 │ ├── run_experiment.py # 实验运行脚本 │ ├── analyze_results.py# 结果分析脚本 │ └── README.md └── SCR-AuthBlur/ # 授权混淆基准 ├── cases/ # 包含L0、L1、L3三档上下文变体 ├── experiment_scripts/ ├── run.sh └── README_en.md / README_zh.md

子基准数据格式

  • SCR-CapFlow:每个案例定义两个技能(A和B)。每个案例在五种条件下执行:Control(控制组)、A-Only(仅技能A)、B-Only(仅技能B)、A+B Neutral(中性组合)、A+B Explicit(显式组合)。记录代理是否执行了有害动作。
  • SCR-TrustLift:每次试验将一个技能与一个来自良性“安全审查”技能的上游背书配对。输出结果为二值:有害安装或拒绝。提供对照组和实验组以比较攻击成功率。
  • SCR-AuthBlur:每个案例在三档上下文强度下运行:L0(干净控制)、L1(相关但非授权)、L3(完整咨询/授权风格)。记录每档的“风险批准率”。

评估方法

  • 核心指标攻击成功率(Attack Success Rate, ASR)。ASR越低代表模型越安全。

  • 排名规则:由于不同后端(backends)在三个子基准上的覆盖情况不同,每个后端仅在其被评估的子基准内参与排名。

    • SCR-CapFlow:按 A+B Explicit ASR(最强对抗组合)排序。
    • SCR-TrustLift:按 Endorsed ASR(有背书时)排序,同时计算Lift(Endorsed ASR - Control ASR)。
    • SCR-AuthBlur:按 L3 Full Auth ASR(完整授权上下文时)排序,并用Δ1和Δ2量化附加上下文的边际效应。
  • 已评估后端:共9个,包括Claude Opus 4.5、Claude Opus 4.6、GPT-5.4、GPT-5.5、Gemini 3.1 Pro Preview、MiniMax-M2.7、DeepSeek-V4、GLM-5.1、GLM-5。其中5个后端在所有三个子基准上均有评估。

  • 组合条件数:CapFlow为5档,TrustLift为2档,AuthBlur为3档。


主要发现

  • 无单一主导模型:三个子基准的冠军分属三个不同的模型。
    • SCR-CapFlowClaude Opus 4.5(A+B Explicit ASR为0.7%)。
    • SCR-TrustLiftClaude Opus 4.6(Endorsed ASR为25.19%)。
    • SCR-AuthBlurGPT-5.4(L3 ASR为7.3%)。
  • 信任转移是主要脆弱点:在5个被评估的后端中,有4个在有上游背书时,ASR达到或超过96.5%。
  • 能力流呈现后端极化:Claude/GPT-5.4系列后端的ASR保持在5%以下;而DeepSeek-V4、MiniMax-M2.7、GPT-5.5、Gemini 3.1 Pro Preview后端的ASR则全部超过41%。
  • 授权上下文具有因果效应:在最易受影响的后端上,L3上下文相比L0基线,将批准率提高了15到33个百分点。

使用场景

  • Agent安全研究:研究单技能审查中不可见的组合时间风险机制。
  • 技能审查方法论:改进上游审查、背书及授权信号的设计。
  • 模型对比与回归:在固定案例集上,将新后端与已发布的基线进行对比。
  • 红队与评估工具:为每个子基准提供可复现的实验框架。

实验运行

  • CLI后端:当前支持Claude Code CLI。
  • 运行步骤
    1. 安装并配置目标模型API(如Claude Code)。
    2. 进入子基准目录,运行init_env.py配置CLI。
    3. 运行run.shrun_experiment.py产出结果。
    4. 如有需要,运行analyze_results.py汇总结果。

许可证

  • Apache 2.0

相关资源

搜集汇总
数据集介绍
SCR-Bench 数据集图片
构建方式
SCR-Bench是一个专门评估LLM代理技能组合安全风险的基准数据集。其构建遵循正交分解原则,将组合风险拆解为能力流、信任转移与授权混淆三种独立机制,并分别构建SCR-CapFlow、SCR-TrustLift和SCR-AuthBlow三个子基准。每个子基准均设计了精心控制的条件变量:SCR-CapFlow包含150个案例,每个案例定义两个技能A与B,并在五种条件(控制、仅A、仅B、A+B中性、A+B显性)下运行;SCR-TrustLift包含401次试验,每对技能搭配来自良性安全审查技能的上游背书,同时提供无背书对照组;SCR-AuthBlow包含118个案例,在三档上下文强度下运行。全部数据以标准化目录结构组织,提供可复现的实验脚本与评估流程。
特点
该数据集的核心特征在于揭示了单一技能安全审查无法发现的组合风险。共包含669个评估项,覆盖9个主流LLM后端模型,采用中英双语提示。攻击成功率(ASR)作为统一度量指标,ASR越低代表模型越安全。实验发现三个子基准的冠军分属不同模型,无全能选手存在;信任转移是最普遍的高危路径,4/5的评估后端在有上游背书时ASR超过96.5%;能力流呈现明显的后端极化现象;授权上下文具有显著的因果效应,能将批准率推高15至33个百分点。这些特征使其成为代理安全研究、技能审查方法论改进、模型对比回归与红队评估的权威工具。
使用方法
数据集使用需安装Claude Code CLI并配置目标模型API。用户首先进入具体子基准目录,运行init_env.py将技能指向所选CLI后端,随后执行run.sh或run_experiment.py脚本产生实验结果,最后使用analyze_results.py(如有)汇总输出。每个子基准目录均包含独立的README文档提供详细步骤指导。评估结果以攻击成功率(ASR)为核心指标,三子基准分别按A+B显性ASR、有背书ASR及L3完全授权ASR排序。数据集适用于进行代理安全研究、技能审查方法论改进、新后端模型对比回归以及红队评估等任务,为社区提供了标准化的可复现实验框架。
背景与挑战
背景概述
SCR-Bench(Skill Composition Risk Benchmark)诞生于2025至2026年间,由研究团队围绕大型语言模型代理的安全性问题构建。该数据集聚焦于一个曾被系统性忽视的研究问题:当多个单一看似无害的代理技能被组合为多步骤工作流时,潜在的安全风险如何沿能力流、信任转移与授权混淆三条路径涌现。其创建意义在于填补了现有安全审查范式仅关注单技能孤立评估的空白,为智能体安全研究提供了首个针对技能组合风险的标准化评估工具。随着语言模型代理在自动化、网络攻防等领域的广泛部署,SCR-Bench对推动组合风险机理理解与安全评测方法论发展产生了重要影响。
当前挑战
SCR-Bench所应对的领域核心挑战在于,传统安全测评仅审查单技能本身是否直接携带恶意意图,却无法捕获技能组合后因能力流传递、信任背书迁移或授权边界模糊而诱发的风险,这类高阶风险是现代代理系统安全部署的关键盲区。在数据集构建过程中,团队面临的主要挑战包括:设计正交解耦的三条风险通路以实现可控实验;构建覆盖中英双语的669个评估实例并确保其生态效度;以及控制不同后端模型(如Claude、GPT系列)在条件组合下的评估一致性。尤其需要精细设计背书面与授权语境强度变体,以准确量化组合风险对攻击成功率的边际贡献。
常用场景
经典使用场景
在人工智能安全研究领域,SCR-Bench 被设计用于系统性地评估大型语言模型代理在组合多步骤工作流时浮现的安全风险。该基准通过三个正交的子基准——能力流(SCR-CapFlow)、信任转移(SCR-TrustLift)和授权混淆(SCR-AuthBlur)——分别考察上游技能提供执行上下文、安全背书信号赋予合法性以及咨询性信息模糊批准边界这三类危害激活路径。研究者通过攻击成功率(ASR)这一核心指标,量化不同后端模型在显式恶意组合条件下的脆弱程度,从而揭示单技能审查无法捕获的隐蔽风险。
衍生相关工作
围绕 SCR-Bench 衍生的经典工作主要涵盖三个方向:一是基于其风险机制分类法构建更细粒度的技能互操作安全图谱,二是利用基准中发现的信任转移高敏感性设计反制性安全背书验证策略,三是开发针对能力流极化的自适应上下文隔离机制。此外,该数据集的出现推动了代理系统开发流程中引入组合安全审查阶段,并启发了从单技能静态审查向多步骤动态风险评估的范式迁移,相关研究已在顶级安全会议中形成新兴议题群落。
数据集最近研究
最新研究方向
SCR-Bench作为首个系统化评估大语言模型代理技能组合安全风险的基准,聚焦于能力流、信任转移与授权混淆三种正交机制,揭示了传统单技能审查中不可见的组合漏洞。该基准在2025年Agent安全研究领域引发广泛关注,其核心发现——信任转移是最普遍的高危路径(5个评估后端中4个攻击成功率超96.5%),以及能力流呈现显著模型极化现象——直接挑战了当前主流安全范式。通过669个评估项与9大后端系统(涵盖Claude、GPT、Gemini等前沿模型)的全面对比,SCR-Bench为Agent系统的红队测试、技能审查方法论革新与模型安全回归测试提供了标准化实验框架,其提出的'单独无害但组合有害'安全命题深刻影响了业界对多步骤Agent工作流风险治理的认知边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务