遇见数据集

forestofaudits-agent-grader-traces-20260608-backfilled

收藏
Hugging Face2026-06-23 更新2026-06-24 收录
官方服务:

资源简介:

Forest of Audits SFT Process Dataset 是一个专门用于智能合约安全审计监督式微调(SFT)的数据集。该数据集是首个基于ForestOfAudits跟踪包回填构建的SFT导出数据集,采用OpenAI风格的聊天消息JSONL格式。其主要目的是教授模型审计环境、终端操作空间以及安全审计过程中所需的提交工件(如检测报告、补丁方案、利用证明)。数据集包含8,633个过程步骤示例,这些示例来自可解析的检测、补丁和利用跟踪记录。此外,还单独提供了218个高质量或高置信度的最终答案示例,用于有控制的混合训练。数据来源于217条跟踪记录,覆盖41次独立审计,包含135次检测模式、56次补丁模式、24次利用模式和2次未知模式。数据集还记录了各种审计状态统计,包括72个缺失最终工件、88个过早终止、79个错误状态跟踪以及24次利用尝试中仅2次通过的情况。数据格式严格使用system、user和assistant三种角色,工具调用和工具输出被序列化为带标签的文本块,并保留了结果和质量元数据,便于后续加权或消融实验。该数据集适用于智能合约安全审计、过程监督学习、代码审计助手训练等任务。

The Forest of Audits SFT Process Dataset is a specialized dataset for supervised fine-tuning (SFT) in smart contract security auditing. It is the first SFT export dataset constructed based on backfilling from the ForestOfAudits trace package, using an OpenAI-style chat message JSONL format. Its primary purpose is to teach models about the audit environment, terminal operation space, and submission artifacts required during the security audit process (such as detection reports, patch solutions, and proof-of-exploit). The dataset contains 8,633 process step examples derived from parsable detection, patch, and exploit trace records. Additionally, it separately provides 218 high-quality or high-confidence final answer examples for controlled mixed training. The data originates from 217 trace records, covering 41 independent audits, including 135 detection modes, 56 patch modes, 24 exploit modes, and 2 unknown modes. The dataset also records various audit status statistics, including 72 missing final artifacts, 88 premature terminations, 79 error state traces, and only 2 passes out of 24 exploit attempts. The data format strictly uses system, user, and assistant roles, with tool calls and tool outputs serialized into labeled text blocks, and retains result and quality metadata to facilitate subsequent weighting or ablation experiments. This dataset is suitable for tasks such as smart contract security auditing, process supervision learning, and code audit assistant training.

创建时间:
2026-06-22
原始信息汇总

Forest of Audits SFT Process Dataset 数据集概述

该数据集是首个从回溯填充的 ForestOfAudits 追踪数据集中导出的 SFT(监督微调)数据集,采用 OpenAI 风格的聊天消息 JSONL 格式,专注于教学审计环境、终端操作空间及所需提交产物。

数据文件

  • train_sft_process_all_actions.jsonl:包含 8,633 个过程步骤示例,来自可解析的 detect、patch 和 exploit 追踪数据。
  • train_sft_gold_clean_final.jsonl:包含 218 个黄金或高置信度最终答案示例,为刻意混合而保持独立。
  • rejected_or_unparsed_records.jsonl:包含 74 个被拒绝或无法解析的记录,包括未知模式追踪和解析失败数据。
  • dataset_summary.json:源统计信息和输出计数。
  • audit_splits.json:审计级别的训练/验证/测试分割元数据。

源统计信息

  • 追踪数:217
  • 审计数:41
  • 模式分布:135 个 detect、56 个 patch、24 个 exploit、2 个 unknown
  • 缺失最终产物:72
  • 过早终止:88
  • 错误状态追踪:79
  • Exploit 通过数:24 个中有 2 个通过

数据格式说明

数据行仅使用 systemuserassistant 角色。工具调用和工具输出被序列化为带标签的文本块,并保留结果和质量元数据,便于后续加权或消融实验。

搜集汇总
数据集介绍
forestofaudits-agent-grader-traces-20260608-backfilled 数据集图片
构建方式
Forest of Audits SFT Process Dataset是基于回填的ForestOfAudits追踪数据包构建的首个监督微调(SFT)导出数据集。其数据来源涵盖41份智能合约审计记录,共包含217条审计追踪样本,细分为135条检测模式、56条修补模式与24条利用模式。构建过程中,通过解析可处理的检测、修补与利用追踪,提取了8,633条过程步骤样本;同时从高置信度的最终答案中筛选出218条黄金样本,并保留了74条被拒绝或解析失败的记录用于后续分析。所有样本均以OpenAI风格的聊天消息JSONL格式存储。
使用方法
该数据集适用于训练智能合约审计代理的监督微调,特别是教导模型理解审计环境、终端动作空间及所需提交产物。用户可通过加载训练过程步骤文件与黄金最终答案文件进行混合训练,利用保留的元数据实施奖励加权或消融分析。建议将审计级别的训练/验证/测试拆分元数据用作数据划分依据,同时结合被拒绝或解析失败的记录进行负样本学习或错误模式分析。数据集的JSONL格式可直接适配OpenAI微调接口及主流深度学习框架的标准数据加载方案。
背景与挑战
背景概述
在智能合约安全审计领域,自动化审计代理的构建依赖于高质量的过程监督数据。Forest of Audits SFT Process Dataset由相关研究团队于近期创建,旨在通过结构化审计轨迹数据,训练能够执行检测、补丁和利用三类操作的智能代理。该数据集基于41次真实审计的217条轨迹,涵盖135条检测、56条补丁和24条利用样本,并保留了源统计数据与审计分割元数据。其核心研究问题聚焦于如何将复杂的审计环境交互过程转化为可监督的序列化学习信号,从而提升代理在智能合约安全中的自主决策能力。作为首个从回填审计轨迹构建的过程监督数据集,它为后续的安全审计自动化研究奠定了数据基础,尤其在EVM安全基准测试和过程强化学习范式中具有潜在影响力。
当前挑战
该数据集面临的核心挑战在于多维度领域问题。首先,审计环境中的终端动作空间高度复杂,涉及检测、补丁和利用三类任务,其中利用模式仅有2次成功通过,表明利用任务的样本稀缺且难度极大,易导致模型学习偏差。其次,构建过程中存在显著的噪声干扰:72条轨迹缺失最终工件,88条存在过早结束,79条包含错误状态,这些异常数据对监督信号的质量构成威胁。此外,74条未解析或拒绝记录进一步加剧了数据清洗的复杂性,要求设计精密的过滤与加权策略以保留有效信息。最终,如何从这些碎片化、含噪的审计轨迹中提取鲁棒的过程监督特征,并平衡不同任务类型的损失权重,是训练高效安全审计代理的关键瓶颈。
常用场景
经典使用场景
在智能合约安全审计这一前沿领域,Forest of Audits SFT Process Dataset被广泛用于训练语言模型理解并模拟完整的审计流程。该数据集涵盖了检测、补丁修复和漏洞利用三种典型审计模式,提供了超过8600条过程步骤示例,使模型能够学习终端操作空间中的行动序列与提交工件的生成规则。研究人员通常将其作为监督式微调(SFT)的基础语料,以强化模型在智能合约安全场景下的指令跟随能力与多步推理能力,从而构建更智能的自动化审计代理。
解决学术问题
该数据集直面智能合约安全审计中缺乏高质量过程监督数据的痛点,为学术研究提供了首个结构化的审计追踪基准。传统方法多依赖最终答案进行训练,无法捕捉审计过程中的推理链条与错误修正步骤,而本数据集通过保留错误状态轨迹、过早终止案例及解析失败记录(共74条),使得研究者能够深入探索模型在复杂多步决策中的鲁棒性。其统计数据显示72条缺失最终工件与88条过早终止样本,这为研究审计代理的不确定性建模、失败恢复机制及质量加权策略提供了宝贵素材,显著推动了过程监督学习在代码安全领域的发展。
实际应用
在实际部署中,该数据集驱动的模型被用于开发自动化智能合约审计工具,辅助安全团队高效完成漏洞检测、补丁编写与利用验证。基于其训练出的审计代理能够解析Solidity代码并模拟真实审计环境中的终端操作,逐步生成结构化的审计报告。数据集包含明确的系统、用户和助理角色划分,使得模型可内嵌于交互式安全平台,提供实时反馈与迭代建议。此外,其保留的漏洞利用通过样本(2/24条)可用于训练防御性策略,提升合约部署前的安全评估效率。
数据集最近研究
最新研究方向
该数据集聚焦于智能合约安全审计领域的监督微调过程,通过整合后向填充的审计追踪数据,构建了面向智能合约安全审计环境、终端操作空间及提交工件的教学型数据集。其最新研究前沿主要围绕利用过程监督信号优化大语言模型在自动化审计决策中的表现,尤其针对检测、补丁与利用三种审计模式下的行为轨迹进行结构化建模。当前研究热点涉及从失败的审计轨迹中挖掘可修复的范式,以及通过高质量样本筛选提升模型在漏洞定位与利用验证阶段的鲁棒性。该数据集的发布为智能合约安全领域的人机协同审计范式提供了关键训练资源,有望推动链上安全分析的自动化进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务