遇见数据集

DrostBench v1

收藏
github2026-06-18 更新2026-07-07 收录
官方服务:

资源简介:

DrostBench v1是一个包含100个可丢弃、授权Web应用程序安全目标的基准测试套件。每个挑战都是一个独立的应用程序,包含一个带有标志性漏洞的利用路径,以及3-5个不触及标志的诱饵漏洞表面。该数据集旨在衡量代理在歧义下进行分诊和类别识别的能力,覆盖44个不同的漏洞类别和6种语言运行时,具有校准的难度梯度和现实目标。

DrostBench v1 is a benchmark suite comprising 100 disposable, authorized web application security targets. Each challenge is a standalone application containing an exploit path with a signature vulnerability, alongside 3 to 5 decoy vulnerability surfaces that do not interfere with the signature vulnerability. This benchmark suite aims to evaluate AI Agents' ability to perform triage and category recognition under ambiguity, covering 44 distinct vulnerability categories and 6 language runtimes, with calibrated difficulty gradients and realistic targets.

创建时间:
2026-06-18
原始信息汇总

数据集概述:DrostBench v1

DrostBench v1 是一个专为自主攻击性安全智能体设计的基准测试套件,包含 100 个可部署的、授权的 Web 应用安全挑战靶标。

核心设计理念

  • 区别于仅奖励“发现任意漏洞”的传统基准,DrostBench 的每个靶标都包含 1 个可获取目标标志(flag)的核心漏洞 以及 3-5 个无法获取标志的诱饵漏洞
  • 智能体必须准确识别正确的漏洞类别、构建有效利用代码并最终获取标志,从而衡量其在 模糊情境下的漏洞分类与研判能力

主要特点

  • 诱饵识别设计:每个靶标强制要求智能体进行正确的漏洞类别选择,而非无差别利用。
  • 广度与泛化性:涵盖 44 种不同的漏洞类别,跨越 6 种语言运行时(Node 20/Express, Python 3.12/Flask, Go 1.23, Java 21, PHP 8.3, Ruby 3.3)。
  • 现代协议与信任边界:包含 SAML/OIDC/JWT 混淆、gRPC 滥用、HTTP/2 请求走私、WebSocket 授权漂移、GraphQL 别名批处理、服务端原型链污染等高级漏洞。
  • 校准的难度阶梯:设置 5 个难度等级(L1 至 L5),从单一漏洞热身(L1)到需要新颖推理的多类链式利用(L5)。
  • 真实性靶标:靶标模拟真实产品场景(如公民请愿门户、国库汇款控制台),并包含内部支持服务。
  • 可重复与可丢弃:基于 Docker Compose,可一键构建、运行、停止和清理。
  • 污染感知:采用 双重哨兵字符串每次构建的标志随机化 机制,用于检测和防御基准数据泄漏。

快速概览

特性 详情
挑战总数 100
难度等级 5(L1 → L5)
漏洞类别 44
语言运行时 6(Node, Python, Go, Java, PHP, Ruby)
诱饵数量/挑战 3-5 个,不在获取标志的路径上
交付方式 Docker Compose,一次性靶标
集成框架 与 XBOW 评估基准兼容(即插即用)
完整性保护 双重哨兵 + 每次构建标志随机化

难度阶梯分布

等级 数量 描述
L1 25 单一主要漏洞,清晰的利用路径。
L2 25 单一漏洞类别,存在过滤器、白名单或间接访问。
L3 25 跨类别链式利用及纵深防御。
L4 15 多步骤链式利用和自定义 payload 构建。
L5 10 需要新颖推理的高级链式利用。

漏洞覆盖范围

涵盖 44 种漏洞类别,包括但不限于:csrf, idor, ssrf, sqli, xss, ssti, jwt, saml, oauth, grpc, graphql, http2_smuggling, prototype_pollution, insecure_deserialization, crypto, race_condition, business_logic 等。

数据使用与完整性

  • 标志格式:默认格式为 FLAG{<64位小写十六进制>},可通过 FLAG 参数覆盖。
  • 泄漏防护:通过双重哨兵 GUID 检测训练数据泄露,通过每次构建的标志随机化防止记忆回放。
  • 注意事项:该基准版本在公开发布前曾作为私有保留数据集使用。公开后的结果应被视为 可复现性和回归性证据,而非无污染泛化性证据。

其他信息

搜集汇总
数据集介绍
DrostBench v1 数据集图片
构建方式
DrostBench v1 是一套精心设计的基准测试集,包含100个可快速部署的Web应用安全挑战。每个挑战均作为独立的Docker容器应用运行,通过Docker Compose实现一键构建与销毁。构建过程中,系统严格遵循随机化与确定性相结合的原则:每个挑战内置一个携带唯一标志(Flag)的核心漏洞,同时在其攻击路径之外布置3至5个不指向标志的诱饵漏洞,以模拟真实攻防场景中的歧义性决策环境。
使用方法
用户可通过标准的Docker Compose命令快速启动单个或系列挑战,例如设置环境变量BENCHMARK为挑战ID后执行构建与运行命令。该数据集兼容XBOW验证基准测试框架,允许用户直接使用现有的外部基准测试工具进行集成测试。每个挑战的元数据(包括漏洞类别、难度等级与产品模型)以JSON格式存储在对应目录的benchmark.json文件中,便于自动化解析与评分。此外,数据集还支持通过传递自定义标志参数实现每个构建的唯一标志随机化,以防止基准测试数据泄露。
背景与挑战
背景概述
DrostBench v1 是由 Drost 团队于近期发布的面向自主进攻性安全智能体的基准测试套件,旨在评估智能体在复杂网络应用环境中精准识别并利用目标漏洞的能力。该数据集创建的核心研究问题在于,现有基准测试多奖励“发现任意漏洞”,而忽略了真实攻击场景中至关重要的“在歧义中准确分类”能力。DrostBench 通过精心设计包含一个主漏洞与3-5个诱饵漏洞的挑战,要求智能体必须完成从漏洞类别辨识、利用构建到最终获取标志的完整推理链条。该基准覆盖44种漏洞类别、6种语言运行时及5个难度等级,其严谨的设计理念与丰富的挑战维度,为衡量和提升自主攻防智能体的决策与推理能力提供了关键标尺,在相关领域具有范式引领意义。
当前挑战
DrostBench v1 所解决的领域核心挑战是构建能够区分主次漏洞、实现精准分类与利用的自主智能体。传统基准的低门槛使得智能体倾向于盲目利用而非深度推理,而真实攻防则要求智能体从众多潜在攻击面中识别真正通往标志的路径。这要求模型具备卓越的跨类别泛化能力与复杂链条推理能力,却鲜有高质量数据集能对此有效训练与评估。在构建过程中,团队面临多重挑战:需为每个挑战精确设计可复现且独立的漏洞环境,确保诱饵漏洞真实有效但绝不暴露标志;还需覆盖从经典Web漏洞到现代协议边界的广阔知识面,并控制各难度梯度的平滑过渡。此外,防止基准数据泄露亦是严峻挑战,为此团队通过设置金丝雀字符串与每构建随机化标志等机制来维护评估的纯洁性与可信度。
常用场景
经典使用场景
DrostBench v1 是一款专为评估自主攻击型智能体在真实世界网络安全场景中表现而设计的基准测试套件。其最经典的使用场景在于衡量智能体在含有多重诱饵漏洞的Web应用程序中,能否精准识别并利用唯一指向标志(Flag)的正确漏洞路径。该套件包含100个可重复部署的挑战,每个挑战均嵌入1个主漏洞和3至5个非路径上的诱饵漏洞,迫使智能体在语义歧义中做出精准的漏洞分类与优先级排序,而非简单的漏洞发现。
解决学术问题
这一基准测试旨在解决当前网络安全智能体评估中的核心学术问题:现有基准多奖励任意漏洞的发现,而忽视了对漏洞分诊与正确性判定的能力评测。DrostBench v1 通过引入可控的诱饵漏洞与多层级难度阶梯(L1至L5),使得研究者能够定量分析智能体在泛化能力、跨语言运行时(涵盖Node、Python、Go、Java等6种环境)以及现代协议安全边界(如JWT混淆、SAML注入、gRPC反射滥用等44种漏洞类别)下的表现,从而填补了智能体在真实渗透测试中“正确性”与“决策力”评估的空白。
实际应用
在实际应用层面,DrostBench v1 已被用于自主渗透测试智能体Drost的日常能力监测与回归测试,同时支持第三方团队利用兼容XBOW的评估框架对其自身智能体进行标准化测试。该套件可用于安全研究团队的红蓝对抗演练、漏洞检测工具的横向比较,以及大型语言模型(LLM)驱动的安全助手的自动化评估,帮助组织在安全开发流程中量化其自动化防御能力的上限与短板。
数据集最近研究
最新研究方向
当前网络攻防安全领域的前沿研究正聚焦于评估自动化渗透智能体在真实攻防场景中的推理与决策能力,而非仅仅检验其发现单一漏洞的浅层能力。DrostBench v1作为一项开创性基准测试,颠覆了传统夺旗挑战侧重于泛化漏洞检测的评估范式,通过精心设计的100个授权Web应用靶标,在每个挑战中植入一个携带旗帜的核心漏洞以及3至5个无关的诱饵漏洞,迫使智能体必须在歧义中精准识别正确的漏洞类别并构建有效的利用链路。这一设计精准映射了实战攻防中分析师面对复杂攻击面时执行优先级排序与漏洞确认的核心挑战,标志着评估体系从“扫描灵敏度”向“对抗性推理能力”的范式跃迁。尤为重要的是,该基准覆盖了44个漏洞类别和6种现代语言运行时环境,并融入了SAML签名混淆、JWT密钥操纵、gRPC反射滥用、HTTP/2走私劫持及GraphQL别名批处理等前沿协议层攻击向量,直指当前云原生与微服务架构中的重大安全热点。结合其可复现的Docker化部署、抗污染双金丝雀机制以及标准化中立的评分框架,DrostBench v1为衡量智能体的泛化能力与能力上限提供了可靠的诊断工具,对推动自主攻防智能体从实验室玩具走向实际安全运营具有里程碑式的规范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务