遇见数据集

Agent-Friendly Smart Contract Audit Dataset

收藏
github2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

该仓库包含一个结构化的、对智能合约审计发现友好的数据集。每个发现以独立的Markdown文件存储,并附带紧凑的index.jsonl用于基于标题和元数据的搜索。

This repository contains a structured dataset tailored for smart contract audit findings. Each audit finding is stored as an independent Markdown file, and is accompanied by a compact index.jsonl file to facilitate searches based on titles and metadata.

创建时间:
2026-09-30
原始信息汇总

Agent-Friendly Smart Contract Audit Dataset 数据集概述

基本信息

  • 数据集名称:Agent-Friendly Smart Contract Audit Dataset
  • 数据集地址:https://github.com/nikolov9996/agent-friendly-smart-contract-audit-findings
  • 数据集类型:结构化智能合约审计发现集合
  • 灵感来源:Zaevlad audit findings dataset(https://huggingface.co/datasets/Zaevlad/audit-findings-dataset)

数据集用途

  • 面向智能体辅助搜索(agent-assisted search)
  • 面向防御性智能合约安全研究(defensive smart-contract security research)
  • 明确说明:不能替代独立的审计验证

关键词

smart-contract audit findings、Solidity vulnerabilities、DeFi security、vulnerability reports、proof-of-concept exploits、audit recommendations、searchable Markdown dataset、JSONL metadata index、agent-assisted security research

数据结构

agent_dataset/ ├── AGENTS.md ├── README.md ├── index.jsonl └── findings/ └── finding-XXXXXX.md

数据内容说明

  • 每一条审计发现(finding)以独立的 Markdown 文件存储
  • 提供紧凑的 index.jsonl,用于标题优先(title-first)和基于元数据(metadata-based)的搜索

贡献要求

  • 在添加记录前需参阅仓库级 AGENTS.md 和 CONTRIBUTING.md
  • 每项贡献必须包含来源 URL 或仓库链接,并保留来源出处(provenance)
搜集汇总
数据集介绍
Agent-Friendly Smart Contract Audit Dataset 数据集图片
构建方式
该数据集立足于智能合约安全审计领域,采用结构化、面向代理的设计理念,将分散的审计发现转化为可检索的知识库。构建过程以单条发现为粒度,每条记录独立存储为Markdown文件,同时生成精简的index.jsonl索引文件,以标题优先和元数据匹配的方式支持快速检索。在数据录入环节,遵循仓库级AGENTS.md与CONTRIBUTING.md的规范,要求每项贡献必须附带源URL或仓库链接,并严格保留来源信息,以此确保每条记录的溯源性与可靠性,形成一套兼顾人工审阅与自动化代理访问的审计发现集合。
特点
该数据集的核心特征在于其代理友好性与结构化程度。所有审计发现以Markdown格式独立存储,既便于人类阅读,也利于智能代理进行语义解析与内容抽取。配套的index.jsonl索引提供基于标题和元数据的轻量级搜索能力,使代理能够在不加载全文的情况下快速定位相关记录。数据集聚焦于Solidity漏洞、DeFi安全、漏洞报告、概念验证利用及审计建议等方向,覆盖智能合约安全审计的关键知识维度。同时,明确的溯源要求和来源链接保留了审计发现的原始语境,为后续验证与引用提供依据。
使用方法
使用该数据集时,代理或研究人员可先读取仓库根目录下的AGENTS.md与CONTRIBUTING.md,以了解数据组织规范与贡献要求。随后通过index.jsonl执行标题优先或元数据驱动的检索,快速筛选出与特定漏洞类型、项目或审计主题相关的条目,再定位至findings目录下对应的Markdown文件获取完整内容。该数据集适用于代理辅助的搜索任务与防御性智能合约安全研究,可作为审计知识检索与漏洞模式分析的参考资源。需要指出的是,该数据集并非独立审计验证的替代品,使用时应结合原始审计报告与专业判断。
背景与挑战
背景概述
智能合约安全审计是区块链生态系统的关键防线,随着DeFi与Web3应用的迅猛发展,合约漏洞引发的资产损失事件频发,催生了对系统化审计知识库的迫切需求。Agent-Friendly Smart Contract Audit Dataset应运而生,其设计灵感源自Zaevlad审计发现数据集,旨在构建面向智能体辅助搜索与防御性安全研究的结构化审计发现集合。该数据集以Markdown文件存储每条审计发现,辅以index.jsonl元数据索引,支持标题优先与元数据检索,并严格记录来源链接以保障可追溯性。这一资源为安全研究人员和自动化工具提供了可复用的漏洞模式与审计建议,推动了智能合约安全领域的知识积累与智能化分析进程。
当前挑战
该数据集所应对的核心领域问题在于智能合约漏洞的精准识别与知识复用,类似于ImageNet之于图像分类,其目标是为自动化审计智能体提供高质量的漏洞样本与检索基准。构建过程中面临多重挑战:其一,审计发现来源广泛且格式异构,需统一提取标题、漏洞类型、严重等级与概念验证等关键字段,同时确保来源URL的完整性与真实性;其二,智能合约漏洞的上下文高度依赖Solidity代码逻辑与DeFi业务场景,脱离具体环境的发现难以泛化,要求数据集在保持简洁Markdown结构的同时保留足够的语义信息;其三,数据集需兼顾智能体友好性与人类可读性,索引设计须支持高效元数据检索,而贡献流程须遵循AGENTS.md与CONTRIBUTING.md规范以维护数据质量与溯源完整性。
常用场景
经典使用场景
在智能合约安全审计领域,该数据集为代理辅助的安全研究提供了高度结构化的知识库。经典使用场景包括:安全研究员通过代理系统,利用`index.jsonl`的元数据索引进行标题优先检索,快速定位特定类型的Solidity漏洞或DeFi安全事件;代理依据Markdown文件中的详细审计发现、概念验证漏洞利用和审计建议,辅助生成审计报告或进行漏洞模式分析。这种设计极大提升了审计发现的可检索性和复用性,使智能合约安全分析更加高效。
实际应用
在实际应用中,该数据集被用于代理辅助的智能合约安全审计工作流。安全团队可利用代理系统快速检索历史审计发现,辅助识别新合约中的潜在漏洞;开发者可参考审计建议和概念验证攻击示例,优化合约安全性。此外,该数据集支持构建智能合约漏洞知识图谱,用于培训安全审计人员或作为自动化审计工具的评估基准,从而提升整个DeFi生态的安全防护水平。
衍生相关工作
受Zaevlad审计发现数据集启发,该数据集衍生了多项相关经典工作。例如,基于其结构化数据,研究者开发了代理辅助的漏洞检索与匹配系统;利用其概念验证漏洞利用,构建了智能合约攻击模拟环境;结合其审计建议,形成了智能合约安全编码规范。这些工作共同推动了代理友好型安全数据集在智能合约审计领域的标准化与广泛应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务