遇见数据集

vulpentestbench-results

收藏
Hugging Face2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

VulPentestBench 是一个用于评估自主 LLM 渗透测试代理的基准测试数据集。它基于 VulPentestBench 框架,该框架在隔离的 Docker 网络中启动 vulhub 的脆弱目标,每次运行在漏洞可达的位置注入一个新鲜的随机 canary 令牌,并基于经过验证的里程碑进行评分(代理必须通过目标导向的工具响应返回令牌,记忆答案无法通过)。数据集包含两个配置:results 和 steps。results 配置包含每个评估环境的最终结果(155 个环境,其中 106 个被成功解决,解决率 68.4%),字段包括环境 ID、类别、里程碑、时间戳、是否解决、达到的最佳等级、调用次数、耗时、难度、等级和原因。steps 配置包含参考代理的每一步工具网关调用记录,字段包括环境 ID、运行 ID、步骤号、调用类型(HTTP、执行、提交)、请求、响应、与上一步的时间差、首次达到各等级的时间点。数据集适用于 LLM 代理评估、渗透测试自动化研究、安全基准测试等任务。注意:数据包含针对故意脆弱目标的真实攻击载荷,但所有容器在评估后被销毁;环境 ID 对应 CVE,因此求解轨迹会暴露解决方案,用于代理评估时需注意污染。

VulPentestBench is a benchmark dataset for evaluating autonomous LLM penetration testing agents. It is based on the VulPentestBench framework, which launches vulnerable targets from vulhub in isolated Docker networks, injects a fresh random canary token at each run at a reachable vulnerability location, and scores based on verified milestones (the agent must return the token via goal-oriented tool responses; memorized answers cannot pass). The dataset contains two configurations: results and steps. The results configuration includes the final outcomes for each evaluation environment (155 environments, 106 successfully solved, success rate 68.4%), with fields including environment ID, category, milestone, timestamp, solved status, best achieved level, number of calls, time cost, difficulty, level, and reason. The steps configuration contains the record of each tool gateway call made by the reference agent, with fields including environment ID, run ID, step number, call type (HTTP, execution, submission), request, response, time difference from the previous step, and the time point when each level was first reached. The dataset is suitable for tasks such as LLM agent evaluation, penetration testing automation research, and security benchmarking. Note: The data contains real attack payloads targeting deliberately vulnerable targets, but all containers are destroyed after evaluation; environment IDs correspond to CVEs, so the solution trajectories expose the solutions, and attention should be paid to contamination when used for agent evaluation.

创建时间:
2026-09-03
原始信息汇总

数据集概述

该数据集记录了自主 LLM 渗透测试智能体在 VulPentestBench 基准上的参照智能体运行结果与轨迹,用于评估 LLM 智能体在真实漏洞环境中的渗透测试能力。

基本信息

  • 语言: 英语
  • 许可证: MIT
  • 数据类型: 文本生成
  • 数据集规模: 1K < n < 10K
  • 标签: 渗透测试、安全、智能体评估、LLM 智能体、网络安全
  • 发布时间: 导出于 2026-09-05 15:20 UTC

任务背景

  • 被评估的智能体: GLM-5.3 + Claude Code(自主 LLM 渗透测试智能体,无上下文启动)
  • 基准平台: VulPentestBench,一个智能体评估框架,其工作机制如下:
    • 在隔离的 Docker 网络中启动 vulhub 漏洞目标
    • 每次运行注入一个随机的新金丝雀令牌(canary token)到漏洞可达位置
    • 对经过来源验证的里程碑进行评分(令牌必须通过目标定向操作的工具响应返回,然后标志提交才会计数——记忆的答案无法通过)

快照统计

  • 评估环境数: 155
  • 已解决环境数: 106(解决率 68.4%)
  • 单次解决的中位开销: 30 次工具调用 / 797 秒
  • 作弊标志数: 0

文件结构与配置

数据集包含两个配置:

  1. resultsresults.jsonl)— 每个被评估环境的记录(去重后的最佳尝试):

    • 字段: env_id(vulhub 的 <category>/<CVE> 格式)、categorymilestonetssolvedtier(达到的最佳 L 层级)、callssecsdifficulty(固定 1-10)、gradereason
  2. stepssteps.jsonl)— 参照智能体每次工具网关调用的记录:

    • 字段: env_idrun_idstepkindhttp / exec / submit)、requestresponse(完整记录文本,无导出上限;网关记录器裁剪的超 200 KB 字段标记为 [recorder truncated])、secs_from_prevfirst_tier_hits
    • 每个记录包含首次达到各层级(L1..L10,L10 表示完成里程碑)的步骤信息

加载方式

可使用 HuggingFace datasets 库加载:

python from datasets import load_dataset results = load_dataset("C0rk1/vulpentestbench-results", "results") steps = load_dataset("C0rk1/vulpentestbench-results", "steps")

注意事项

  • 请求/响应中包含针对故意易受攻击目标的真实攻击载荷,均为所列 CVE 的标准公开 PoC,不涉及任何真实第三方系统
  • 轨迹中可见的金丝雀令牌每次运行随机生成且已失效——每次运行的容器在评估后被拆除
  • env_id 包含 vulhub CVE 名称,解决轨迹可能暴露解决方案;若将步骤数据用于智能体评估,应在检查后划分数据集(或过滤 env_id)以避免数据污染
  • 本数据集仅包含结果数据,不重新分发 vulhub 镜像或环境文件(vulhub 采用 MIT 许可证,由 phith0n 创建)

许可证

数据集内容由 VulPentestBench 项目生成,采用 MIT 许可证。

搜集汇总
数据集介绍
vulpentestbench-results 数据集图片
构建方式
VulPentestBench是一个针对自主LLM渗透测试代理的评估基准,通过vulhub构建真实漏洞环境,并在Docker隔离网络中动态注入随机蜜罐令牌。该数据集记录了GLM-5.3与Claude Code组成的参考代理在155个环境中的评估结果,包含每个环境的解决状态、攻击轨迹及里程碑达成信息。其构建遵循严格的验证机制,要求令牌必须通过代理对目标的真实操作返回才能计入得分,有效杜绝了记忆性答案的干扰。
特点
该数据集具有高度的真实性与严谨性:所有环境均基于公开漏洞复现,攻击轨迹包含完整的工具调用细节,且每次运行的可纳令牌均随机生成并随环境销毁。结果数据提供丰富的量化指标,如工具调用次数、耗时、解决层级等,便于深度分析。此外,轨迹数据无截断保留,为研究Agent的决策过程提供了宝贵资料,同时通过环境ID的筛选机制支持防污染训练。
使用方法
用户可通过HuggingFace数据集库便捷加载数据,选择results或steps配置获取不同粒度的信息。results表提供各环境的总体绩效,适合整体评估与模型比较;steps表则深入单步操作,用于分析代理行为或构建强化学习训练集。需注意,使用时应对数据集随机切分或按环境ID过滤,以避免轨迹泄漏导致评估失真。数据集仅供研究,所有攻击行为均限于隔离环境。
背景与挑战
背景概述
VulPentestBench-results数据集由C0rk1-AI团队于2026年创建,旨在评估自主大语言模型(LLM)驱动的渗透测试代理的性能。该数据集基于VulPentestBench基准框架,该框架利用vulhub项目中的已知漏洞环境,在隔离的Docker网络中启动易受攻击的目标,并通过注入随机canary令牌来验证代理是否真正实现了漏洞利用,而非记忆或猜测。数据集包含155个环境的评估结果,其中106个被成功解决(占68.4%),记录了详细的代理轨迹和分步工具调用,为衡量LLM代理在网络安全任务中的实际能力提供了宝贵资源。该数据集的发布促进了安全自动化领域的研究,特别是推动了语言模型在自主漏洞发现和利用方面的评估方法学发展。
当前挑战
该数据集所应对的核心挑战在于,如何可靠地评估LLM代理在真实渗透测试场景中的效能,防止模型通过记忆或推理捷径获得虚假的成功。VulPentestBench通过设计精确的验证机制,如canary令牌的独特放置和基于来源的评分,有效规避了传统评估中的作弊风险,同时权衡了探索真实漏洞与确保环境安全之间的复杂性。在构建过程中,挑战包括从vulhub中选取并配置多样化的漏洞环境,确保isolated网络下的可重复性,以及处理agent长时间运行产生的庞大日志数据,同时保护敏感攻击载荷的合法使用。此外,防止数据集中的解决方案被后续代理评测所污染,也是一个需要细心策略应对的难题。
常用场景
经典使用场景
在网络安全与人工智能的交汇领域,评估大型语言模型(LLM)驱动的自主渗透测试代理的效能,是当前研究与实践的核心议题。该数据集提供了参考代理在多样化脆弱环境中的完整运行轨迹与评分结果,为这一评估需求提供了标准化的基准。其经典使用场景在于,研究者可依据该数据对自主代理的渗透测试能力进行量化分析,通过分级L1至L10的达成情况、工具调用次数、耗时等细粒度指标,客观衡量不同代理策略在真实漏洞环境下的表现,从而推动安全代理评测方法的规范化与科学化。
衍生相关工作
该数据集作为基准测试的权威参考结果,为其衍生研究提供了坚实的数据基石。其衍生的经典工作可能包括:构建代理性能预测模型,通过分析步骤轨迹中工具调用的时序与模式,预测代理在未知环境下的达标概率;开发针对LLM代理的对抗性训练方法,利用高难度轨迹样本强化代理的鲁棒性;以及设计跨环境的迁移学习策略,将从VulPentestBench中学到的策略泛化至更广泛的漏洞利用场景。此外,这些详尽轨迹数据也常被用于探究代理内部决策过程的可解释性分析,推动安全代理从黑盒评估走向白盒理解。
数据集最近研究
最新研究方向
在网络安全领域,大型语言模型(LLM)驱动的自主渗透测试代理正成为研究焦点,其核心挑战在于构建可信、防作弊的评估基准。VulPentestBench-results数据集作为该前沿方向的代表性产物,记录了基于GLM-5.3与Claude Code的自主代理在155个真实漏洞环境中的表现,实现了68.4%的解题率与零作弊标记,其通过注入一次性canary令牌并验证目标导向工具响应来确保成绩的真实性。该数据集不仅揭示了LLM代理在自动化漏洞利用中的潜力,更提供了细粒度的逐步轨迹,为后续研究代理决策过程、成本控制及策略优化提供了宝贵资源,推动了安全自动化评估范式的革新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务