遇见数据集

Bench-Dataset

收藏
github2026-06-25 更新2026-06-29 收录
官方服务:

资源简介:

Bench-Dataset是一个用于智能合约审计(FP/FN)的基准数据集,基于执行模式分为检测(detect)和利用(exploit)两部分。detect部分包含正常任务(47个)和复仇任务(24个,用于诱导误报),exploit部分包含11个任务(仅限lumos-v5)。每个任务自包含(manifest.yaml + code/自有库),数据集还包括映射和元数据文件(MAPPING.csv、catalog.csv)。

Bench-Dataset is a benchmark dataset for smart contract auditing (FP/FN). It is divided into two parts based on execution modes: detect and exploit. The detect section includes 47 normal tasks and 24 revenge tasks, which are used to induce false positives. The exploit section contains 11 tasks exclusively for lumos-v5. Each task is self-contained, with manifest.yaml, code and its own libraries. The dataset also includes mapping and metadata files: MAPPING.csv and catalog.csv.

创建时间:
2026-06-08
原始信息汇总

数据集概述:Bench-Dataset

Bench-Dataset 是一个针对智能合约审计的基准测试(Benchmark)数据集,主要用于评估审计工具在检测漏洞(FP/FN,即误报/漏报)方面的性能。数据集根据执行模式划分为两大子集:detect/(检测)和 exploit/(利用)。

数据集结构

  • data/tasks/detect/ — 检测任务,用于评估从源代码中发现漏洞的能力。包含所有问题。
    • normal/ (47个) — 基础问题,编号为 detect-task-001detect-task-047
    • revenge/ (24个) — 在原有问题上添加 near-miss FP(诱使误报)表面特征的变体。命名规则为 detect-task-<原始编号>-fp(例如 detect-task-001-fp 源自 detect-task-001)。
  • data/tasks/exploit/ (11个) — 利用任务,用于评估通过PoC(概念验证)实现实际资金盗取的能力。仅包含来自 lumos-v5 的11个问题,每个问题包含部署和成功条件(deployment + success_predicate)。这些任务与 detect/normal 中的对应 lumos-v5 任务一一对应(exploit-task-NNNdetect-task-NNN)。

每个任务均为自包含单元(包含 manifest.yamlcode/ 目录下的自有库)。任务的映射和元数据信息存储在 MAPPING.csvcatalog.csv 中。

数据内容示例

detect/normal (47个任务)
任务编号 原始来源 (套件/名称) 漏洞模式 (pattern) 影响 (impact) 严重性 (sev) TP FP
detect-task-001 lumos-v5/lumos-v5-001 effects-after-interaction-cross-market fund_loss 1
detect-task-002 lumos-v5/lumos-v5-002 balance-sync-credits-without-mint-and-assets-input-zero-burn fund_loss 2
detect-task-012 manyfp/crypto/english-auction bid fund_loss High 8 3
detect-task-013 manyfp/crypto/flash-loan flashLoanInstant fund_loss Critical 8 2
detect-task-036 manyfp/real-context/aave-v3-core multi-bug fund_loss Critical 10
detect-task-041 reentrancy/task-001-transient-rate-borrow read-only-reentrancy-oracle fund_loss 1
detect/revenge — FP变体 (24个任务)
任务编号 基任务 原始来源 (套件/名称) 漏洞模式 (pattern) 影响 (impact) 严重性 (sev) TP FP
detect-task-041-fp detect-task-041 reentrancy-fp/task-001-transient-rate-borrow-fp read-only-reentrancy-oracle fund_loss 1
detect-task-001-fp detect-task-001 fp-v4/lumos-v5/lumos-v5-001 effects-after-interaction-cross-market fund_loss 1
detect-task-030-fp detect-task-030 fp-v4/lumos-v4/lumos-v4-001 authorization_context_binding fund_loss 2
exploit — lumos-v5 (11个任务)
任务编号 原始来源 (套件/名称) 漏洞模式 (pattern) 影响 (impact) 严重性 (sev) TP FP
exploit-task-001 lumos-v5/lumos-v5-001 effects-after-interaction-cross-market fund_loss 1
exploit-task-007 lumos-v5/lumos-v5-007 unbounded-spend-rights-to-untrusted-receiver-on-forwarding-helper fund_loss 2
exploit-task-011 lumos-v5/lumos-v5-011 same-token-loan-recycled-as-deposit-collateral fund_loss 2

数据特点

数据集中的 manyfp 系列(crypto 6个,synthetic 7个)问题经过了特别处理:将无意义的重复填充代码替换为实际可运行的协议代码,并对核心(正确答案)进行冻结、确保参考PoC可通过、以及进行对抗性触发验证(全部通过,为“CLEAN”状态)。这保证了数据的有效性和基准测试的可靠性。

搜集汇总
数据集介绍
Bench-Dataset 数据集图片
构建方式
在区块链安全研究领域,智能合约审计基准测试的构建是一项极具挑战性的任务。Bench-Dataset 数据集以执行模式为纲,精心划分为检测(detect)与利用(exploit)两大维度。在检测分支中,数据集收纳了来自 lumos、manyfp、evmbench 等多个权威套件的 47 个基础漏洞样本,并匠心独运地设计了 24 个近失假阳性(near-miss FP)变体,通过在原有代码中注入误导性表面特征来考验工具的鲁棒性。利用分支则精选了 11 个 lumos-v5 测试用例,每个都附有完整的部署脚本与成功条件谓词,确保能够从概念验证层面真实评估工具对资金盗取漏洞的捕捉能力。每个任务均以自给自足的形式封装,内含 manifest.yaml 配置文件与独立代码库,配合 MAPPING.csv 和 catalog.csv 元数据文件形成完整的数据生态。
特点
该数据集最引人注目的特质在于其多层次、多维度的评估架构。检测与利用的双轨设计,使得研究者既能检验工具对源码漏洞的静态识别能力,又能验证其生成实际攻击载荷的动态执行效果。假阳性变体子集的引入更是点睛之笔,这些变体在保持核心漏洞特征不变的前提下,巧妙植入各类误导性代码结构,精准地暴露了当前审计工具在低误报场景下的普遍短板。数据集涵盖了重入、价格操纵、权限校验缺失、借贷清算错误、跨链消息绑定等十余种典型漏洞模式,其影响范围横跨资金损失与坏账两个维度,严重等级从高到危急一应俱全。所有来自 manyfp 的用例均经过了核心逻辑冻结、参考 PoC 验证及对抗性抽干测试的三重淬炼,确保了数据集的纯净度与权威性。
使用方法
使用 Bench-Dataset 进行模型评估时,研究者可依据具体需求灵活选取评估路径。对于需要进行漏洞检测能力测试的场景,可直接将 detect 目录下的任务代码输入目标审计工具,依据 catalog.csv 中标注的真实阳性(TP)数量计算检出率。若希望检验工具的假阳性控制水平,则可引入 revenge 子集中的变体任务,观察工具是否会因附加的误导表面而产生虚警。对于追求端到端攻击模拟评估的研究者,exploit 目录提供了完整的可利用环境,支持从部署到资金提取的全链路验证。数据集采用标准的 manifest.yaml 格式配置任务,兼容主流智能合约审计框架的输入规范,使用者仅需解析任务目录下的合约源码即可开始评估,无需繁琐的数据预处理工作。
背景与挑战
背景概述
智能合约安全审计是区块链生态系统的基石,其核心挑战在于精准识别代码中的漏洞模式并抵御日益复杂的逃逸攻击。Bench-Dataset数据集应运而生,由一支专注于去中心化金融安全的匿名研究团队于近期构建,旨在为智能合约审计工具提供一套系统化的基准测试框架。该数据集围绕两大核心任务展开:一是针对源代码中漏洞的检测(detect),二是利用漏洞概念验证(PoC)实现资金劫持的模拟攻击(exploit)。数据集精心汇聚了来自Lumos-v5、ManyFP、EVMbench等多个成熟安全测试套件的82个独立任务,涵盖跨市场交互、重入攻击、预言机操纵等十余种高危漏洞模式,并创新性地引入了24个近误假阳性变体(revenge)以评估工具的鲁棒性。作为首个融合真实协议代码、合成噪声与对抗性验证的审计基准,Bench-Dataset为衡量安全分析工具在精准度与抗干扰能力上的表现提供了不可替代的参照标准。
当前挑战
构建过程中面临的核心挑战在于如何模拟真实审计场景的复杂性。首先,需要消除合成数据集中无意义重复填充的影响,将其替换为可实际运行的真实协议代码片段,同时冻结核心逻辑并确保参考PoC可通过,这一过程需耗费大量人力进行协议逆向与代码重构。其次,针对24个近误假阳性变体的设计,需在不引入真实漏洞的前提下,通过细微的语义修改来误导基于规则的检测工具,这对数据集的构造精度要求极高。此外,为确保数据集的生态有效性,所有恶意模式样本必须通过对抗性验证——确认模型中不存在能够绕过检测的隐藏后门,且无法被恶意脚本通过简单模式匹配所利用。这些挑战共同决定了Bench-Dataset在塑造下一代审计工具方面的重要地位。
常用场景
经典使用场景
在智能合约安全审计领域,Bench-Dataset被广泛用于评估自动化漏洞检测工具的准确性与鲁棒性。该数据集精心构建了涵盖多种经典漏洞模式(如重入攻击、价格操纵、授权缺失等)的检测任务,并创新性地引入了「near-miss FP」变体,通过向原始漏洞代码中添加诱导误报的表面特征,来测试检测工具区分真实漏洞与虚假警报的能力。研究者通常利用该数据集对基于静态分析、符号执行或深度学习的方法进行基准测试,系统性地衡量其在精确率、召回率及F1分数上的表现,从而推动更可靠、更抗混淆的智能合约审计技术发展。
实际应用
在实际产业应用中,Bench-Dataset为智能合约安全审计工具的开发与迭代提供了关键的测试基准。安全服务公司可利用该数据集对内部审计模型进行压力测试,验证其在识别真实资金损失风险(如fund_loss与bad_debt)时的有效性,特别是在对抗恶意开发者故意植入的伪漏洞或混淆逻辑时的表现。此外,该数据集中的exploit子集通过提供可执行的PoC(概念验证)攻击流程,使得安全团队能够模拟完整的从漏洞检测到资金窃取的攻击链路,从而更精准地评估防护方案的响应能力,提升DeFi生态的整体安全性。
衍生相关工作
基于Bench-Dataset,学术界和工业界已经涌现出一系列衍生研究工作。研究者使用该数据集作为核心评测平台,提出了面向智能合约的上下文感知检测框架、基于图神经网络的漏洞模式识别方法,以及结合程序切片与整型约束求解的高精度审计方案。同时,该数据集中独创的「revenge」子集设计理念被后续工作广泛借鉴,催生了针对误报鲁棒性评估的新基准与消融实验范式。此外,部分工作利用数据集中细粒度的模式标签(如`authorization_context_binding`),训练出能够输出具体漏洞成因的细粒度分类器,推动了可解释智能合约审计的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务