遇见数据集

vuljector-secbench-trajectories

收藏
Hugging Face2026-06-25 更新2026-06-26 收录
官方服务:

资源简介:

Vuljector SEC-bench Teacher Trajectories数据集是一个包含1083条忠实(无提示)成功轨迹的集合,记录了智能体在解决SEC-bench漏洞任务过程中的完整交互。所有轨迹均由gpt-5.4-mini模型在faithful模式下生成,不包含任何提示辅助的运行。数据集捕获了自然语言推理过程,每条轨迹包含完整的消息序列(系统、用户、助手、工具角色),其中助手回合包含推理内容和bash/cmd工具调用,以及元数据。数据来源于四种生成管道:fuzz_guided(通过现有模糊测试工具可触达的漏洞)、workflow_rag和workflow_llm(来自RAG或LLM候选生成工作流)、cve_reversal(从真实OSS-Fuzz CVE测试案例重建)。涵盖71个不同项目,包含两种任务模式:patch(生成漏洞修复补丁)和poc-san(生成经消毒器验证的崩溃概念验证),其中poc-san轨迹经过严格质量过滤,确保提交的PoC文件真实非空。数据集以JSONL格式存储,每条记录包含唯一ID、消息序列和元数据(项目、漏洞ID、任务模式、模型信息、验证状态、生成方法等)。所有数据已进行秘密信息擦除处理,适用于智能体工具使用、代码安全、漏洞修复等研究任务。

创建时间:
2026-06-15
原始信息汇总

数据集概述:Vuljector SEC-bench Teacher Trajectories

该数据集包含 1,083 条由 Agent 在解决 SEC-bench 漏洞任务时产生的成功轨迹,所有轨迹均源自 gpt-5.4-mini 教师模型在 faithful 模式(include_hints=false)下生成,不包含其他模型或带提示的运行记录。每条轨迹记录了完整的自然语言推理过程,包括系统、用户、助手和工具的多轮对话消息,以及 reasoningbash/cmd 工具调用。所有秘密信息已被清理。

数据规模与格式

  • 总条目数:1,083 条成功轨迹
  • 文件格式:单个 JSONL 文件 (all_trajectories.jsonl),作为 train 分割
  • 行结构:每条记录包含 idmessages(消息列表)和 metadata(元数据)
    • messages:包含 role(角色)、content(内容)、reasoning(推理)、tool_calls(工具调用)
    • metadata:记录项目、漏洞ID、任务模式、模型ID、验证状态、教师模式、是否包含提示、API调用次数、总步骤数、生成方法

漏洞来源与分布

漏洞来自三种生成管道,按 patch(补丁)和 poc-san(崩溃PoC)两种任务模式统计:

生成方法 patch poc-san 总计
fuzz_guided 537 217 754
workflow_rag 136 12 148
workflow_llm 76 15 91
cve_reversal 90 0 90
合计 839 244 1083
  • fuzz_guided:由现有模糊测试工具可达位置注入的漏洞
  • workflow_:基于RAG或LLM候选生成工作流引入的漏洞
  • cve_reversal:从真实OSS-Fuzz CVE测试用例复现重构的任务(仅patch模式,无poc-san)

数据质量与过滤

  • poc-san 轨迹经过质量过滤:仅保留包含真实 selected_fuzzer 且提交了非空、非描述性、非仅diff的PoC文件的轨迹,排除了因参考种子崩溃导致的虚假成功。
  • patch 轨迹:基于真实的 git_patch 评分,不受此过滤影响。

任务与项目

  • 项目数量:71 个项目
  • 任务模式:两种——patch(生成修复补丁)和 poc-san(生成经过消毒器验证的崩溃PoC)
  • 语言:英文
  • 许可证:其他(未明确说明)
  • 标签:agent、tool-use、security、sec-bench
搜集汇总
数据集介绍
vuljector-secbench-trajectories 数据集图片
构建方式
Vuljector-secbench-trajectories数据集基于SEC-bench漏洞任务,由gpt-5.4-mini教师模型在faithful模式(include_hints=false)下自主求解生成的1083条无提示成功轨迹构成。每条轨迹以JSONL格式记录完整的消息序列,包含系统、用户、助手和工具角色的交互内容,并附有自然语言推理过程、bash或cmd工具调用信息及元数据。漏洞实例源自四种生成管道:fuzz_guided(基于现有模糊测试工具可达位置注入漏洞)、workflow_rag与workflow_llm(分别基于检索增强生成和大型语言模型候选工作流)、cve_reversal(基于真实OSS-Fuzz CVE测试用例重建任务)。poc-san模式轨迹经过严格质量过滤,确保提交真正的非空PoC文件,排除空内容或仅描述性提交。
特点
该数据集的核心特色在于其高保真度和纯净性:所有轨迹均未借助任何提示辅助,忠实反映了智能体在真实漏洞修复任务中完全自主的推理与操作过程。涵盖71个开源项目,支持两种任务模式——patch(生成修复补丁)和poc-san(生成经消毒器验证的崩溃PoC),共计1083条成功轨迹,其中patch任务839条,poc-san任务244条。数据经过秘密信息擦除处理,确保安全合规。每条轨迹包含完整的多轮对话与工具调用记录,并通过metadata.generation_method字段标注漏洞来源,便于研究者追踪不同生成策略对智能体行为的影响。
使用方法
数据集以单一文件all_trajectories.jsonl形式存储,默认作为训练集使用。用户可通过HuggingFace的数据集加载工具直接读取,每条记录包含唯一的id字段、完整的messages列表及详细的metadata元数据。messages列表中的助手消息包含reasoning字段用于捕捉自然语言推理过程,以及tool_calls字段记录bash或cmd工具调用参数。研究者可按project、vulnerability_id、task_mode、generation_method等元数据字段进行灵活筛选,例如仅加载fuzz_guided管道生成的patch任务轨迹,或分析特定项目的poc-san轨迹。数据集适用于训练和评估安全智能体的漏洞修复能力、工具使用规划以及多步推理行为。
背景与挑战
背景概述
在软件安全领域,自动化漏洞修复与验证是缓解日益严峻的网络安全威胁的关键技术方向。由安全研究团队构建的Vuljector SEC-bench Teacher Trajectories数据集,于2025年发布,专注于记录智能代理在解决SEC-bench漏洞任务中的完整执行轨迹。该数据集包含1083条由gpt-5.4-mini模型在无提示辅助模式下生成的忠实成功轨迹,覆盖71个开源项目,涉及漏洞补丁生成与崩溃验证两类核心任务。通过融合模糊测试引导、工作流检索增强生成、大语言模型生成及CVE逆向等多种漏洞注入管道,该数据集为研究基于大语言模型的安全代理行为提供了标准化基准,对推动自动化漏洞修复系统的可复现性评估与能力边界探索具有重要价值。
当前挑战
当前该数据集面临的核心挑战主要体现在两个层面。首先,在领域问题层面,自动化漏洞修复面临任务复杂性与成果验证的固有矛盾:补丁任务要求代理准确理解代码语义并生成语法正确的修复补丁,而崩溃验证任务则需代理构造出能够触发特定安全缺陷的真实可利用程序,两者均对模型的推理深度与工具调用能力构成严峻考验。其次,在数据集构建过程中,质量控制面临显著困难:例如SEC-bench平台原有的崩溃验证评估机制存在虚假成功现象,即基于参考种子的崩溃结果可能掩盖代理未提交有效漏洞利用代码的事实,因此在轨迹筛选与标签校准中需要额外设计严格的过滤逻辑以确保数据真实性。
常用场景
经典使用场景
在软件安全与自动化漏洞修复的交叉领域,Vuljector-SEC-bench-Trajectories数据集作为一份精心构建的智能体行为轨迹集合,为研究基于大语言模型的自动化漏洞修复系统提供了不可或缺的基准资源。该数据集记录了语言模型在‘无提示’条件下成功解决SEC-bench漏洞任务的全过程,涵盖包括模糊测试引导、工作流检索增强生成、工作流大模型生成以及真实CVE逆向在内的四种生成管道所产生的1083条完整轨迹。这些轨迹以多轮对话形式呈现,包含了系统指令、用户问题、带有推理过程的助手回复以及工具调用记录,使研究者能够深入分析模型在漏洞定位和修复过程中的决策逻辑。因此,该数据集最经典的使用场景是在安全智能体研究中作为监督训练与行为模仿的黄金标准数据源,用于训练或微调其他模型,使其习得高效、可靠的漏洞修复策略。
实际应用
在现实工程场景中,Vuljector-SEC-bench-Trajectories数据集的价值体现在多个层面。对于企业安全团队而言,该数据集可用于训练专属的自动化漏洞修复智能体,这些智能体能够理解代码库上下文、生成修复补丁,并通过工具调用验证修复效果,从而显著降低人工修复的安全成本和时间开销。在开源社区中,该数据集能够为持续集成与持续部署流水线中的漏洞闭环管理提供支持,使自动化工具能够针对模糊测试发现的漏洞快速生成并提交修复方案。此外,该数据集还可用于构建安全审计辅助系统,帮助审计人员快速定位疑似漏洞区域并生成建议修复方案。教育方面,数据集中的成功轨迹可以作为教学案例,帮助学生理解大语言模型如何结合工具使用和推理能力解决实际安全漏洞问题,从而培养兼具安全与人工智能技能的新兴人才。
衍生相关工作
Vuljector-SEC-bench-Trajectories数据集的发布已经并预计将持续衍生出一系列具有影响力的经典研究。在监督学习方向上,研究者可基于这些成功轨迹训练更强大的漏洞修复模型,例如通过行为克隆或逆强化学习方式,使小参数量的模型也能掌握复杂的多步骤推理能力。在评估基准上,该数据集为SEC-bench的性能比较提供了标准参照,促进了包括模型架构设计、提示策略优化以及工具调用机制等方向的系统性对比研究。此外,该数据集的轨迹结构启发了对智能体推理过程可解释性的深入探讨,出现了利用轨迹中的中间推理步骤来分析模型决策偏差与失败模式的工作。在泛化能力研究方面,衍生的相关研究致力于探究训练数据中不同生成管道(如fuzz_guided与workflow_rag)对模型在未见项目上修复性能的影响,进而推动更鲁棒、更通用的漏洞修复方案的设计与开发。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务