SCR-Bench
收藏资源简介:
SCR-Bench(技能组合风险基准)是一个用于评估当单独良性技能组合成代理工作流时出现的安全风险的基准。在孤立状态下,每个技能看似安全,但通过能力流、信任转移或授权混淆,在激活的组合路径中可能产生有害结果。
SCR-Bench (Skill Combination Risk Benchmark) is a benchmark for evaluating security risks that emerge when individual benign skills are combined into agent workflows. When isolated, each skill appears secure, yet harmful outcomes may arise in activated combined paths via capability flow, trust transfer, or authorization confusion.
数据集概述
SCR-Bench (Skill Composition Risk Bench) 是一个用于评估代理工作流中因技能组合而引发的安全风险的基准测试。其核心发现是:单个技能在孤立状态下看似安全,但当它们被组合到共享执行上下文中时,可能通过激活组合路径产生有害结果。
数据集组成
SCR-Bench 包含三个子基准,分别对应不同的风险机制:
| 子基准 | 风险机制 | 描述 |
|---|---|---|
| SCR-CapFlow | 能力跨越 | 上游技能提供执行目标或操作上下文,使下游技能能够执行权限变更等危险操作,原本分离的能力在组合后形成高权限的危险行为。 |
| SCR-TrustLift | 信任转移 | 一个看似良性的“安全审查”技能,通过输出运行审查报告或提供背书信号,为后续风险技能或操作赋予合法性。 |
| SCR-AuthBlur | 授权混淆 | 咨询性或发现性上下文会改变Agent的批准边界,促使其做出不安全的、原本应被拒绝的下游决策。 |
实验结果亮点
- SCR-CapFlow:在技能组合场景下,攻击成功率达到 33.5%,而孤立评估时基线接近零。
- SCR-TrustLift:在五个模型后端中的四个上,有害安装率超过 96.5%。
- SCR-AuthBlur:风险批准率相比孤立基线增加了 71.8%(L0至L1级别)。
数据集链接与资源
- Hugging Face 数据集: https://huggingface.co/datasets/kyle-X1e/SCR-Bench
- 论文: https://arxiv.org/abs/2606.15242
- 排行榜 (Leaderboard): https://huggingface.co/spaces/kyle-X1e/SCR-Bench-Leaderboard
项目结构
SCR-Bench/ ├── SCR-CapFlow/ # 能力跨越组合基准 │ └── README.md # 实验说明 ├── SCR-TrustLift/ # 信任转移组合基准 │ └── README.md # 实验说明 ├── SCR-AuthBlur/ # 授权混淆基准 │ ├── README_en.md # 实验说明(英文) │ └── README_zh.md # 实验说明(中文)
运行实验
每个子基准目录下包含独立的README文件,提供详细的实验说明。运行实验前需安装并配置CLI后端。
支持的CLI后端与配置:
| CLI 后端 | 技能目录 | CLI 工具 |
|---|---|---|
ClaudeCode |
.claude |
Claude Code |
CodeX |
.agents |
CodeX |
GeminiCLI |
.gemini |
Gemini CLI |
OpenCode |
.opencode |
OpenCode |
运行步骤:
- 安装并配置所需的CLI工具(如Claude Code)。
- 确保CLI工具可从终端PATH访问。
- 运行实验时,使用
--cli参数指定目标后端(例如--cli ClaudeCode)。 - 每个子基准中的
init_env.py脚本会自动将技能目录重命名以匹配所选CLI。
重要说明
- 数据生成:论文中所有实验数据均通过运行 Claude Code 并切换不同模型后端(API)生成。复现结果仅需安装 Claude Code 并配置对应模型的 API。
- 当前支持:实验脚本目前仅适配 Claude Code。对 CodeX、Gemini CLI、OpenCode 的支持将在未来版本中添加。
- 维护:本项目长期持续维护,将持续发布错误修复、新增案例及更多 CLI/模型后端支持。




