DrostBench v1
收藏资源简介:
DrostBench v1是一个包含100个可丢弃、授权Web应用程序安全目标的基准测试套件。每个挑战都是一个独立的应用程序,包含一个带有标志性漏洞的利用路径,以及3-5个不触及标志的诱饵漏洞表面。该数据集旨在衡量代理在歧义下进行分诊和类别识别的能力,覆盖44个不同的漏洞类别和6种语言运行时,具有校准的难度梯度和现实目标。
DrostBench v1 is a benchmark suite comprising 100 disposable, authorized web application security targets. Each challenge is a standalone application containing an exploit path with a signature vulnerability, alongside 3 to 5 decoy vulnerability surfaces that do not interfere with the signature vulnerability. This benchmark suite aims to evaluate AI Agents' ability to perform triage and category recognition under ambiguity, covering 44 distinct vulnerability categories and 6 language runtimes, with calibrated difficulty gradients and realistic targets.
数据集概述:DrostBench v1
DrostBench v1 是一个专为自主攻击性安全智能体设计的基准测试套件,包含 100 个可部署的、授权的 Web 应用安全挑战靶标。
核心设计理念
- 区别于仅奖励“发现任意漏洞”的传统基准,DrostBench 的每个靶标都包含 1 个可获取目标标志(flag)的核心漏洞 以及 3-5 个无法获取标志的诱饵漏洞。
- 智能体必须准确识别正确的漏洞类别、构建有效利用代码并最终获取标志,从而衡量其在 模糊情境下的漏洞分类与研判能力。
主要特点
- 诱饵识别设计:每个靶标强制要求智能体进行正确的漏洞类别选择,而非无差别利用。
- 广度与泛化性:涵盖 44 种不同的漏洞类别,跨越 6 种语言运行时(Node 20/Express, Python 3.12/Flask, Go 1.23, Java 21, PHP 8.3, Ruby 3.3)。
- 现代协议与信任边界:包含 SAML/OIDC/JWT 混淆、gRPC 滥用、HTTP/2 请求走私、WebSocket 授权漂移、GraphQL 别名批处理、服务端原型链污染等高级漏洞。
- 校准的难度阶梯:设置 5 个难度等级(L1 至 L5),从单一漏洞热身(L1)到需要新颖推理的多类链式利用(L5)。
- 真实性靶标:靶标模拟真实产品场景(如公民请愿门户、国库汇款控制台),并包含内部支持服务。
- 可重复与可丢弃:基于 Docker Compose,可一键构建、运行、停止和清理。
- 污染感知:采用 双重哨兵字符串 和 每次构建的标志随机化 机制,用于检测和防御基准数据泄漏。
快速概览
| 特性 | 详情 |
|---|---|
| 挑战总数 | 100 |
| 难度等级 | 5(L1 → L5) |
| 漏洞类别 | 44 |
| 语言运行时 | 6(Node, Python, Go, Java, PHP, Ruby) |
| 诱饵数量/挑战 | 3-5 个,不在获取标志的路径上 |
| 交付方式 | Docker Compose,一次性靶标 |
| 集成框架 | 与 XBOW 评估基准兼容(即插即用) |
| 完整性保护 | 双重哨兵 + 每次构建标志随机化 |
难度阶梯分布
| 等级 | 数量 | 描述 |
|---|---|---|
| L1 | 25 | 单一主要漏洞,清晰的利用路径。 |
| L2 | 25 | 单一漏洞类别,存在过滤器、白名单或间接访问。 |
| L3 | 25 | 跨类别链式利用及纵深防御。 |
| L4 | 15 | 多步骤链式利用和自定义 payload 构建。 |
| L5 | 10 | 需要新颖推理的高级链式利用。 |
漏洞覆盖范围
涵盖 44 种漏洞类别,包括但不限于:csrf, idor, ssrf, sqli, xss, ssti, jwt, saml, oauth, grpc, graphql, http2_smuggling, prototype_pollution, insecure_deserialization, crypto, race_condition, business_logic 等。
数据使用与完整性
- 标志格式:默认格式为
FLAG{<64位小写十六进制>},可通过FLAG参数覆盖。 - 泄漏防护:通过双重哨兵 GUID 检测训练数据泄露,通过每次构建的标志随机化防止记忆回放。
- 注意事项:该基准版本在公开发布前曾作为私有保留数据集使用。公开后的结果应被视为 可复现性和回归性证据,而非无污染泛化性证据。
其他信息




