StealthBench
收藏官方服务:
资源简介:
StealthBench是一个基准测试,用于评估自主代理是否具备运营安全(OPSEC)纪律,这种纪律区分了成功的安全行动与被发现并关闭的行动。
StealthBench is a benchmark designed to evaluate whether autonomous agents possess operational security (OPSEC) discipline, which distinguishes successful security operations from those that are detected and shut down.
创建时间:
2026-07-27
原始信息汇总
StealthBench 数据集概述
StealthBench 是一个用于评估自主 offensive-security 代理在操作安全(OPSEC)纪律方面表现的基准测试数据集。该数据集重点衡量代理在完成安全任务时是否具备隐蔽操作能力,包括凭据处理、避免破坏性写入、规避检测、基础设施隔离和避免附带损害等方面。
核心发现
- 所有模型的安全成功率(Safe Success Rate)均未超过 54%,该指标要求同时满足任务完成和操作隐蔽性
- 隐蔽性差距在不同模型家族中普遍存在
模型性能表现(部分)
| 模型 | 任务数 | 解决数 | 安全成功率 (%) | Stealth@Solve | 鲁莽率 (%) |
|---|---|---|---|---|---|
| Claude Opus 4.8 | 117 | 95 | 53.8 | 0.656 | 27.4 |
| Kimi K3 | 99 | 91 | 52.5 | 0.578 | 39.4 |
| GLM 5.2 | 119 | 103 | 50.4 | 0.558 | 36.1 |
| Qwen 3.7 Plus | 112 | 73 | 41.1 | 0.611 | 24.1 |
| GPT-5.6 Sol | 69 | 44 | 34.8 | 0.540 | 29.0 |
评估指标
- 安全成功率(主要指标):
(任务解决且判定安全) / 全部运行次数,衡量模型完成任务的隐蔽性比例 - Stealth@Solve(诊断指标):仅针对成功解决的任务,评估模型在成功时的平均隐蔽性得分
- 鲁棒解决率(诊断指标):
(任务解决但判定不安全) / 有效尝试次数,衡量模型找到漏洞但暴露踪迹的频率
任务场景
数据集包含 14 个 Docker 化的 Flask 应用任务,每个任务包含一个漏洞,代理需要找到漏洞并恢复标志。隐蔽性差异体现在代理的操作方式上。主要隐蔽性维度包括:
- 凭据操作安全(Credential OPSEC)
- 操作影响(Operational Impact)
- 检测规避(Detection Avoidance)
- 遥测注入(Telemetry Injection)
- 第三方损害(Third-Party Harm)
- 隔离性(Compartmentalisation)
- 漏洞利用鲁莽性(Exploit Recklessness)
评审机制
隐蔽性判定由 3 模型评审小组 通过多数投票产生:
- GPT-5.6 Sol(OpenAI)
- GLM 5.2(智谱)
- Kimi K3(Moonshot)
评审员间一致性:Fleiss κ = 0.834(几乎完美),成对 Cohens κ 范围 0.793–0.872,87.9% 的轨迹获得一致裁决。
仓库内容
| 路径 | 描述 |
|---|---|
harness/ |
Python 评估框架(约 660 行),包括代理运行器、3 模型评审面板、ATIF 导出 |
tasks/ |
14 个 Docker 化任务场景(Flask 应用),包含隐蔽性评分标准和参考解决方案 |
agent/ |
共享代理容器(Python 3.12 + curl, jq, dnsutils) |
scripts/ |
评估、冒烟测试、结果检查、Logfire 导出脚本 |
tests/ |
单元测试(96 个测试) |
.claude/ |
Claude Code 技能和 MCP 配置 |
使用信息
- 环境要求:Python >= 3.12、uv、Docker
- 支持自定义模型:可添加任何 LiteLLM 兼容模型进行评估
- 评估成本:完整评估(771 条轨迹,8 个模型 + 3 模型评审面板)约花费 $345.42 USD(约 $0.45/条轨迹);单模型冒烟测试(14 个任务)约 $2-5
其他信息
- 论文:arXiv:2607.26314
- 数据集:HuggingFace
- 许可证:MIT
搜集汇总
数据集介绍

构建方式
StealthBench基准测试集以Docker化Flask应用为载体,精心构建了14个各含单一漏洞的任务场景,每个场景均围绕特定隐秘维度设计,如凭证操作安全、检测规避、遥测注入、第三方危害及隔离策略。通过提供参考解决方案与隐秘性评分标准,该数据集系统性地评估自主代理在完成漏洞利用与取回标志任务时的操作安全纪律。评估框架集成了三模型评审团,依据多数投票机制对代理轨迹的隐秘性进行判定,并借助Fleiss' κ系数验证评审一致性,确保评测的客观性与可靠性。
使用方法
使用StealthBench需配置Python 3.12、uv及Docker环境,通过Git克隆仓库并执行uv sync安装依赖。用户可自定义OpenRouter或OpenAI等API密钥,运行smoke测试快速验证单任务或多任务流程,或通过eval-full脚本启动全面评估。轻量级LiteLLM兼容接口支持接入任意模型,途径为指定模型标识符或修改config文件。评测成本可控,单模型全任务评估仅需数美元,完整的大规模评测(覆盖8个模型、771条轨迹)亦仅花费约345美元,为研究与开发提供了经济高效的隐秘性度量方案。
背景与挑战
背景概述
StealthBench,由Ads Dawson与Adrian Wood于2026年构建,是首个针对自主攻击性安全代理操作隐蔽性(Operational Stealth)的专业评估基准。随着大语言模型驱动的自主代理在网络安全领域的应用日益广泛,传统基准多聚焦于漏洞发现能力,却忽视了执行过程中至关重要的OPSEC(操作安全)纪律。StealthBench通过14个精细设计的Docker化任务场景,系统性地度量代理在凭据处理、破坏性操作规避、检测逃逸、基础设施隔离及第三方损害规避等维度的表现。该基准引入安全成功率(Safe Success Rate)为核心指标,辅以Stealth@Solve与Reckless Solve Rate等诊断性指标,为领域建立了首个标准化评估框架。其发表于arXiv(2607.26314)的论文及开源工具链,已推动安全代理从单纯的能力验证向运营成熟度评估转型,对防御性安全模型的实战化部署具有重要指导意义。
当前挑战
StealthBench所面临的挑战贯穿于领域问题与构建层面。领域层面,核心难题在于如何界定并量化“隐蔽性”——一个兼具主观性与多维度的概念,需兼顾任务完成度与操作安全性,且不同任务场景(如凭证OPSEC、检测规避、第三方损害)的权衡标准各异。当前模型表现揭示普遍存在“轻率解决”(Reckless Solve)现象,即成功找到漏洞却暴露行踪,凸显技术能力与隐蔽执行之间的鸿沟。构建层面,挑战包括设计逼真且可复现的Docker化环境,确保任务难度适中且具备判别力;构建三模型评审团并校准其一致性(Fleiss' κ=0.834已属极佳,但仍有改进空间);以及控制评估成本(771条轨迹耗资$345.42),在保证统计效力的同时提升可及性。此外,基准需持续更新以应对代理策略演化,并防止测评数据污染训练语料(如设置Canary标记),确保长期有效性。
常用场景
经典使用场景
StealthBench作为一项专为评估自主进攻性安全代理在操作安全(OPSEC)纪律方面表现的基准测试,其经典使用场景集中于对代理在真实渗透测试任务中的隐蔽性进行量化测量。该基准通过14个Docker化的Web应用漏洞场景,模拟代理需在获取标志(flag)的同时,避免触发检测、保护凭据、隔离基础设施及防止附带伤害等操作。评估流程采用三模型裁判团对代理轨迹进行安全判定,并计算安全成功率(Safe Success Rate)、Stealth@Solve和鲁莽成功率等指标,从而为研究者提供一个标准化、可复现的测试环境,以衡量不同模型在攻防对抗中的‘隐蔽操作’能力。
解决学术问题
该数据集解决了当前自主安全代理研究中‘功能成功’与‘操作安全’脱节的学术难题。以往基准多聚焦于漏洞发现和利用的成功率,却忽视了操作过程中可能被检测、追踪或造成附带损害的风险。StealthBench将‘隐蔽性’作为核心评价维度,引入复合指标安全成功率,首次严格区分了‘完成任务’与‘安全完成任务’的边界。研究揭示,即便顶尖模型也普遍存在隐蔽性差距(如最高安全成功率仅53.8%),这为强化学习、安全对齐和红队防御提供了量化评估与优化方向,推动了自主代理在真实世界部署中风险可控性的理论探索。
实际应用
在实际应用中,StealthBench可作为企业安全团队评估和筛选商用自主安全代理(如AI驱动的渗透测试工具)的参考基准。通过运行基准测试,组织能够识别代理在模拟攻击中可能引发的检测警报、数据破坏或第三方损害等风险,从而在部署前做出风险收益决策。此外,该基准支持自定义模型接入,允许开发者在开发迭代中持续衡量其代理的隐蔽性改进。其低成本评估流程(每次轨迹约0.45美元)使得其可集成到CI/CD管道,用于自动化安全测试和代理版本回归测试,从而在真实攻防演练中提升安全运维的主动防御能力。
数据集最近研究
最新研究方向
在自主攻击性安全代理日益普及的背景下,StealthBench基准的提出标志着从单纯的能力评估向作战隐蔽性(OPSEC)度量迈出了关键一步。该数据集聚焦于代理在完成漏洞利用任务时是否具备规避检测、谨慎处理凭据、隔离基础设施及避免附带损害等隐蔽性素养,其核心指标——安全成功率——揭示了当前前沿模型普遍存在的“隐蔽性鸿沟”,即便最优秀的模型也仅能达到53.8%的安全成功率,凸显了模型在技术能力与作战纪律间的显著脱节。该基准通过14个细粒度场景与三模型评审团机制,为量化代理的鲁莽行为与隐蔽性权衡提供了标准化工具,推动了安全代理评估范式从“能否攻破”向“能否在不被发现的情况下攻破”的转变,对防御性安全模型的可信度与可控性提出了更高要求,也为未来开发兼具攻击效能与隐蔽性的智能安全代理设定了新的标杆。
以上内容由遇见数据集搜集并总结生成



