遇见数据集

Bastet

收藏
arXiv2026-06-02 更新2026-06-05 收录
数据链接:
官方服务:

资源简介:

Bastet是由AIFT研究团队构建的专家标注去中心化金融智能合约漏洞数据集,旨在解决现有数据集因使用过时Solidity版本、自动化标注噪声及粗粒度标签导致的质量瓶颈。该数据集包含从2021年4月至2024年11月期间394份Code4rena审计报告中收集的4,402条漏洞发现,其中849条已由DeFiHackLabs社区的白帽安全专家通过双人共识流程完成精细标注,并建立包含46个标签和77个子标签的两层分类体系。数据集创建过程严格遵循基于真实审计发现、专家讨论共识的原则,确保标签准确反映漏洞根本原因。该数据集主要应用于智能合约安全检测领域,特别是为基于大语言模型的漏洞检测方法提供高质量评估基准,以识别传统静态分析工具难以捕捉的业务逻辑漏洞。

Bastet is an expert-annotated decentralized finance (DeFi) smart contract vulnerability dataset developed by the AIFT research team, designed to address the quality bottlenecks plaguing existing datasets stemming from outdated Solidity versions, automated annotation noise, and coarse-grained labels. This dataset includes 4,402 vulnerability findings collected from 394 Code4rena audit reports issued between April 2021 and November 2024. Of these, 849 findings have been precisely annotated through a two-person consensus workflow by white-hat security experts from the DeFiHackLabs community, and a two-tier classification system encompassing 46 primary labels and 77 sub-labels has been established for the dataset. The dataset construction process strictly adheres to the principles grounded in real audit findings and expert consensus, ensuring that the labels accurately reflect the root causes of vulnerabilities. This dataset is primarily applied in the field of smart contract security detection, particularly serving as a high-quality evaluation benchmark for large language model (LLM)-based vulnerability detection approaches to identify business logic vulnerabilities that traditional static analysis tools struggle to detect.

提供机构:
AIFT
创建时间:
2026-06-02
原始信息汇总

数据集名称

Bastet: A Fine-Grained Expert-Labeled Dataset for DeFi Smart Contract Vulnerability Detection

核心主题

一个针对去中心化金融(DeFi)智能合约漏洞检测的细粒度、专家标注数据集。

数据来源与规模

  • 数据收集:来源于 394 份 Code4rena 竞赛性审计报告,时间跨度从 2021 年 4 月到 2024 年 11 月。
  • 数据总量:总计包含 4,402 个发现(findings)。
  • 已标注数据:其中 849 个发现由 DeFiHackLabs 社区的白帽安全研究人员完成完整标注。

标注方法与特点

  • 标注人员:由多位人类专家(白帽安全研究人员)进行标注。
  • 标注流程:采用双标注者共识机制(two-annotator consensus workflow)生成标注,确保标签准确性基于真实世界的漏洞根本原因。
  • 标签体系:采用两层细粒度分类(two-layer taxonomy),包含 46 个标签(Tags)和 77 个子标签(Subtags)。

解决的关键问题

现有数据集普遍存在三个根本性问题,Bastet 均予以解决:

  1. 版本过时:现有数据集基于过时的 Solidity 版本(如 v0.4),无法反映现代 DeFi 合约。Bastet 的数据基于 2021-2024 年的真实世界审计结果。
  2. 标注不准确:现有数据集依赖自动化或大语言模型生成的标注,存在幻觉导致的标签噪声。Bastet 采用人工专家标注和讨论共识。
  3. 标签粒度粗糙:现有数据集采用单层粗粒度标签,无法捕捉真实世界业务逻辑漏洞的语义复杂性。Bastet 采用包含 46 个Tags和 77 个 Subtags 的双层分类法。

学科领域

计算机科学(Computer Science)> 密码学与安全(Cryptography and Security)

搜集汇总
数据集介绍
Bastet 数据集图片
构建方式
Bastet数据集源自2021年4月至2024年11月间Code4rena平台394份真实审计报告中的4,402个漏洞发现,其中849个发现由DeFiHackLabs社区的白帽安全专家通过两轮独立标注与讨论共识机制完成精细注释。所有标注均基于专家撰写的根因摘要,并采用自底向上的迭代方式构建了包含46个标签和77个子标签的双层分类体系,每个类别均源自至少两个真实样本的观察归纳。
特点
Bastet的核心特点在于其双层标签结构,能够精细区分漏洞根因机制(如滑点)与具体实现缺陷(如minOut设为零或缺失保护),克服了传统单层标签的语义模糊性。数据集覆盖现代Solidity版本及借贷、衍生品等多元DeFi协议,849个标注发现中182个携带多标签,如实反映了真实漏洞的复合根因结构。所有标签经双人共识确保可靠性,有效规避了自动标注带来的幻觉噪声问题。
使用方法
Bastet适用于训练和评估基于大语言模型的DeFi智能合约漏洞检测系统。研究者可利用其双层标签进行细粒度提示工程,针对特定根因模式(如状态更新不一致或价格操纵)设计检测策略;多标签特性支持对复合漏洞的联合推理评估。数据集以压缩包形式公开,包含合约代码、审计发现及对应CSV标签文件,需在CC BY-NC 4.0许可下使用。
背景与挑战
背景概述
随着去中心化金融(DeFi)协议的迅猛发展,智能合约漏洞已酿成巨额经济损失,仅2024年就有超过14.9亿美元的确认损失。然而,现有漏洞检测数据集普遍基于过时的Solidity v0.4版本,无法反映现代合约的复杂性;且依赖自动化或大语言模型生成标注,饱受幻觉驱动的标签噪声困扰;加之采用粗糙的单层标签体系,难以区分不同根因机制下的具体实现缺陷。为破解上述困境,来自AIFT的Wan-Hsuan Hsu等人联合DeFiHackLabs社区的白帽安全专家,于2026年构建了Bastet数据集。该数据集从2021年4月至2024年11月间的394份Code4rena竞赛审计报告中采集4,402条发现,其中849条经双标注者共识流程完成精细标注,并首创包含46个标签与77个子标签的双层分类体系。Bastet作为首个融合真实审计源、现代Solidity版本覆盖、专家共识标注与根因摘要的数据集,为LLM驱动的DeFi漏洞检测研究奠定了可靠基准,对推动该领域方法评估与模型改进具有里程碑意义。
当前挑战
Bastet数据集所应对的核心领域挑战在于:现有数据集因依赖陈旧合约版本与单层标签,无法使LLM检测器有效识别业务逻辑漏洞,测试时召回率在v0.8合约上骤降至13%,且自动化标注的标签噪声导致GPT-4等模型在严格评估下接近随机猜测。同时,DeFi漏洞根因判别需深厚的协议设计与经济机制知识,LLM易产生看似合理但事实错误的输出,而人类专家共识方可保障标注可靠性。在构建过程中,团队亦面临多重挑战:需从394份报告中筛选已由竞赛评委审核的真实发现以保证质量;需通过自底向上的迭代方式,在标注过程中动态定义并收敛出46个标签与77个子标签,确保每个类别均有至少两个真实观测支撑;还需设计双标注者独立标注后经讨论达成共识的严谨流程,以彻底消解自动管线无法避免的幻觉风险,最终实现100%标注发现经同行评审,为领域提供可复现的细粒度评估基准。
常用场景
经典使用场景
在智能合约漏洞检测领域,Bastet数据集被广泛用作评估大语言模型(LLM)在DeFi场景下安全分析能力的基准测试平台。研究人员通过其双层标签体系(46个Tags与77个Subtags)与真实审计报告源,可对模型的语义推理与业务逻辑缺陷识别性能进行细粒度校验,克服了传统数据集过度依赖旧版Solidity语法模式的局限。该数据集尤其适用于需要区分根本原因机制与具体实现缺陷的漏洞分类任务,为复杂商业逻辑漏洞的检测方法提供了可靠的地面真值支撑。
解决学术问题
该数据集系统性地解决了现有智能合约漏洞数据集中三项长期悬而未决的学术难题:首先,通过引入2021至2024年间的现代DeFi审计报告,替代了已过时的Solidity v0.4合约样本,提升了评估结果对真实世界代码的泛化能力。其次,采用双标注者共识机制与白帽专家社区参与,彻底消除了由大模型幻觉引发的标签噪声,使得评估指标能够真实反映检测模型的实际效能。最后,突破传统单层标签的粗粒度局限,通过构建根本原因与实现缺陷的双层分类体系,使得跨漏洞模式的语义差异得以细致刻画,为细粒度模型评测与训练提供了方法论基础。
衍生相关工作
Bastet数据集的发布催生了一系列标志性后续工作,推动了DeFi安全研究的范式演进。受其双层分类体系启发,研究者开始构建融合图神经网络与注意力机制的漏洞检测框架,力求在Subtag层面上实现准确的根本原因定位。同时,基于该数据集的原生多标签特性(每项发现可携带多个Tag与Subtag),学界涌现出关注多任务联合学习的模型架构,以捕捉不同漏洞类型间的交互逻辑。此外,部分工作将Bastet作为交互式对抗训练的基础种子集,用于生成能够抵御人为误导的鲁棒性检测系统,进一步拓展了数据集的学术外延。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务