遇见数据集

VAB-vulnerability-analysis-benchmark

收藏
Hugging Face2026-08-02 更新2026-08-03 收录
官方服务:

资源简介:

该数据集包含两个用于安全代码分析的小型基准测试:FBE (Find-the-Bug) 和 VAB (Multiple Choice)。两个基准测试均无需大型语言模型(LLM)作为评判,运行成本低且可重复。FBE 包含14个代码片段,每个片段中植入了一个漏洞,要求模型分析代码并找出漏洞。评分基于概念组,输出四个指标:found(是否识别真实漏洞,主要指标)、capability(是否指出攻击者获得的能力)、fix(是否在合理层面提出修复建议)、distracted(是否被无关内容分散注意力,越低越好)。漏洞类别包括:缺失对象级授权、角色批量赋值、通过存储URL的二次SSRF、解码前验证的路径遍历、编辑后批准、未消耗的一次性令牌、库存检查后操作竞争、从客户端提供头中获取身份、信任可变队列字段的worker、负数金额转账、开放失败授权、非常量时间秘密比较、绕过退款工作流的支持路由、执行认证但未授权的删除路由。数据格式为JSON行,包含字段:id(标识符)、vuln(漏洞描述)、domain(领域)、code(代码)、must_hit(必须命中的概念组)、capability(能力答案组)、fix(修复答案组)、distractors(干扰项组)。VAB 包含20个多项选择题,涵盖代码和场景,考察不变量破坏、根因、能力(知识、影响、访问、权限、执行)、链有效性、缺失检查、置信度、负空间、状态序列。链有效性选项固定为:A 已证实,B 可能,C 推测,D 阻断。使用注意事项:VAB 奖励短回答,模型若倾向于长形式分析可能在 VAB 上得分下降,而 FBE 得分不变或更好。因此建议将 FBE 作为主要信号,VAB 作为次要信号。参考数据:Qwythos / Qwen3.5-9B 4-bit 基础模型在 FBE 上 found 为79%,完全信誉为43%,VAB 为75%。使用授权:仅限安全评估和研究。所有代码片段均为通用示例。

This dataset contains two small benchmarks for security code analysis: FBE (Find-the-Bug) and VAB (Multiple Choice). Both benchmarks do not require a large language model (LLM) as a judge, are low-cost to run, and are reproducible. FBE includes 14 code snippets, each with an implanted vulnerability, requiring the model to analyze the code and identify the vulnerability. Scoring is based on concept groups, outputting four metrics: found (whether the real vulnerability is identified, primary metric), capability (whether the attackers gained capability is indicated), fix (whether a reasonable-level fix is suggested), and distracted (whether the model is distracted by irrelevant content, the lower the better). Vulnerability categories include: missing object-level authorization, role mass assignment, secondary SSRF via stored URL, path traversal before decoding validation, edit-then-approve, unconsumed one-time token, race condition after inventory check, identity from client-provided header, trusting mutable queue field worker, negative amount transfer, open failure authorization, non-constant time secret comparison, support route bypassing refund workflow, and authenticated but unauthorized delete route. Data format is JSON lines, with fields: id (identifier), vuln (vulnerability description), domain (domain), code (code), must_hit (must-hit concept group), capability (capability answer group), fix (fix answer group), distractors (distractor group). VAB includes 20 multiple-choice questions covering code and scenarios, testing invariant breaking, root cause, capability (knowledge, impact, access, privilege, execution), chain validity, missing checks, confidence, negative space, and state sequence. Chain validity options are fixed: A: confirmed, B: possible, C: speculative, D: blocked. Usage notes: VAB rewards short answers; models that tend to produce long-form analysis may score lower on VAB while FBE scores remain unchanged or better. Therefore, it is recommended to use FBE as the primary signal and VAB as the secondary signal. Reference data: Qwythos / Qwen3.5-9B 4-bit base model achieved 79% found on FBE, 43% full credibility, and 75% on VAB. Usage license: only for security evaluation and research. All code snippets are generic examples.

创建时间:
2026-07-28
原始信息汇总

数据集概述

本数据集名为 FBE and VAB security analysis benchmarks,是一个面向安全代码分析的基准测试集,包含两个子配置:fbevab,均以 JSONL 格式提供。该数据集不依赖 LLM 评判,运行成本低且可重复。

数据集配置

配置名 数据文件 内容说明
fbe fbe.jsonl 14 个代码片段,每个含一个植入漏洞
vab vab.jsonl 20 道多项选择题,覆盖代码与场景

FBE(find-the-bug)

包含 14 个代码片段,每个片段预置一个真实漏洞,要求模型分析代码并识别缺陷。评分基于概念组,答案需包含每个必答组的至少一个同义词。输出四个指标:

  • found:是否识别出真实漏洞(核心指标)
  • capability:是否说明攻击者获得的收益
  • fix:是否在合理层级提出修复建议
  • distracted:是否被无关内容干扰(越低越好)

覆盖的漏洞类别包括:缺失对象级授权、角色批量赋值、通过存储 URL 的二阶 SSRF、解码前验证的路径遍历、审批后编辑、未消耗的单次令牌、库存检查-执行竞态、客户端提供的身份头、信任可变队列字段的 Worker、负数转账、默认可通过的授权、非常量时间秘密比较、绕过退款流程的支持路由、以及只认证不授权的删除路由。

VAB(多项选择)

包含 20 道基于代码和场景的多项选择题,考察维度包括:破坏的不变量、根因、能力(知识、影响、访问、权限、执行)、链有效性、缺失检查、置信度、负空间、状态序列。链有效性选项固定为:A 已证实、B 可能、C 推测、D 阻塞。

使用提示

VAB 奖励简短强制选择答案。擅长长篇幅分析的模型可能在 VAB 上表现下降,而实际找漏洞能力不变或更好。建议将 FBE 作为主要信号,VAB 作为次要信号。

参考性能

Qwythos / Qwen3.5-9B 4-bit 基础模型:FBE 命中率 79%,FBE 完全得分 43%,VAB 得分 75%。

许可与用途

采用 Apache-2.0 许可证,英语语言,适用于授权安全评估与研究,所有代码片段均为通用内容。

搜集汇总
数据集介绍
VAB-vulnerability-analysis-benchmark 数据集图片
构建方式
该基准数据集精心构筑于两大核心部分:FBE(Find-The-Bug)与VAB(Multiple Choice)。FBE包含14段代码片段,每段均植入单一特定漏洞,覆盖缺失对象级授权、批量角色分配、二次SSRF、路径遍历、编辑后批准漏洞、单次令牌未消费、库存检查-使用竞争、客户端头身份信任、队列字段篡改信任、负金额转账、开放失败授权、非恒定时间密钥比较及绕过退款流程的支持路由等多元漏洞类型。每项样本以JSON结构化记录,包含漏洞标签、领域、代码及多组同义词集合(must_hit),用于判定模型是否识别真实漏洞、攻击者能力、修复建议及干扰项。VAB则提供20道多选题,涉及不变量破坏、根本原因、能力分类(知识、影响、访问、权限、执行)、链式有效性、缺失检查、置信度及状态序列等维度,其中链式有效性选项固定为A(已证明)、B(可能)、C(推测)、D(受阻)。
特点
此基准的显著特征在于其无LLM评判的自动评分机制,确保评估低成本且具备高度可重复性。FBE以概念组同义词匹配进行评分,输出四项关键指标:发现真实漏洞(核心指标)、能力描述、修复建议及干扰项分数(越低越好)。VAB则奖励简洁明确的强制选择答案,但需注意,注重长篇分析的大模型可能在VAB上分数下降,而FBE成绩不变或提升,因此FBE被视为主要信号,VAB为辅助参考。基准规模精简(样本数低于1K),涵盖多领域安全代码分析,所有代码片段均为通用示例,适用于授权的安全评估与研究,确保了使用的合规性与普适性。
使用方法
使用此数据集时,用户可通过HuggingFace加载配置(config)分别为fbe和vab的数据文件。FBE要求模型分析代码片段并输出分析结果,随后依据预设的同义词组进行自动评分,无需人工或LLM评审,直接计算命中率。VAB则呈现多选题,模型需从给定选项中选出最佳答案,其中链式有效性题目遵循固定选项。参考数值(如Qwythos/Qwen3.5-9B 4-bit基础模型在FBE上发现漏洞率79%,完全得分43%,VAB得分75%)可作为性能基准。建议以FBE作为主要评估信号,VAB作为次要参考,尤其适用于安全代码分析模型的对比评测和鲁棒性验证。
背景与挑战
背景概述
VAB-vulnerability-analysis-bmark基准数据集由Qwythos团队于2025年发布,旨在评估大语言模型在代码安全分析中的能力。该数据集包含FBE(找漏洞)和VAB(多选题)两个子集,共34个精心设计的代码片段和场景,覆盖了诸如缺失对象级授权、二次SSRF、竞态条件等14类软件漏洞。其核心研究问题在于,如何在不依赖LLM裁判的情况下,以低成本、可重复的方式衡量模型对安全漏洞的识别、理解与修复建议能力。该基准的出现填补了现有安全评估中缺乏针对漏洞根因分析与链式推理的标准化测试的空白,已初步展示出对不同模型在安全任务上性能差异的敏锐区分度,为后续安全智能体的发展提供了重要参考。
当前挑战
该数据集面临的挑战涵盖领域问题与构建过程两方面。领域层面,软件漏洞检测需同时应对漏洞类型的多样性(如授权绕过、输入验证缺陷)与上下文依赖性,而现有LLM常产生冗长分析却未触及关键缺陷,该基准通过强制“概念组”匹配和固定选项,降低了评估的主观性,但对模型精炼、准确回答的能力提出了更高要求。构建层面,设计者需平衡问题的真实性与可评分性,确保每个代码片段包含单一、清晰且无歧义的漏洞,同时避免因代码过简或过难导致评估失真。此外,VAB多选题奖励简洁回答的特性,可能使擅长长篇分析的模型得分异常,这就要求用户须将FBE成绩作为主要信号,并警惕基准对模型输出风格的偏好性,这亦是构建通用安全评估工具时需持续优化的挑战。
常用场景
经典使用场景
VAB-vulnerability-analysis-benchmark 数据集是专为安全代码分析设计的小型基准测试,涵盖find-the-bug(FBE)和多项选择(VAB)两种形式。其经典使用场景在于评估大语言模型在漏洞检测、根因分析、攻击者能力推断及修复建议生成等方面的综合能力。研究者通常利用该基准对模型进行黑盒测试,通过预置的漏洞代码片段和精心设计的选择题,量化模型的安全分析水平。该数据集无需LLM裁判即可自动评分,确保了评估过程的低成本、高效性与可重复性,为安全代码分析领域的模型性能对比提供了标准化的评估基石。
实际应用
在实际应用中,VAB数据集可被安全团队用于筛选或校准适用于安全审计的AI助手。例如,企业可在开发安全流水线中利用FBE基准测试来验证代码审查机器人能否准确识别OWASP Top 10类的漏洞,并生成可落地的修复方案。VAB的多项选择形式则适用于自动化安全培训系统,帮助安全工程师快速提升漏洞根因分析能力。此外,该基准的通用代码片段设计使其能安全地应用于授权安全评估与教育研究场景,无需担心泄露专有代码,为构建稳健的智能安全防护体系提供了实用的技术验证工具。
衍生相关工作
该数据集衍生了一系列相关研究,主要包括对代码大语言模型安全能力的深度剖析与评估框架的改进。研究者基于FBE和VAB的评分逻辑,开发了自动化漏洞分析评估工具链,并将其扩展到更多编程语言和漏洞类型。已有工作借鉴其概念组匹配思想,设计了更具鲁棒性的语义等价判断方案。此外,该基准提出的‘长篇分析可能干扰强制选择任务’的现象,催生了关于模型推理模式与任务格式交互的研究,进而推动了多任务安全评估基准的联合构建,形成了从静态基准测试到动态自适应评估的多层次研究方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务