遇见数据集

solidity-findings

收藏
Hugging Face2026-08-05 更新2026-08-06 收录
官方服务:

资源简介:

该数据集是一个代码静态分析检测结果记录集,包含2874个训练样本。每个样本记录了由检测工具(detector)发现的代码问题,包括唯一标识(id)、schema版本(schema_version)、问题来源(source)、严重级别(severity)、关联文件路径(file)、受影响的行号列表(lines)以及问题代码片段(snippet)。数据集可用于训练或评估代码质量检测、安全漏洞识别等任务,同时也支持对检测工具结果进行结构化分析与处理。

This dataset is a record set of code static analysis detection results, containing 2874 training samples. Each sample records code issues found by a detection tool (detector), including a unique identifier (id), schema version (schema_version), issue source (source), severity level (severity), associated file path (file), affected line numbers list (lines), and the code snippet (snippet). The dataset can be used for training or evaluating code quality detection, security vulnerability identification, and other tasks, and also supports structured analysis and processing of detection tool results.

创建时间:
2026-07-30
原始信息汇总
字段 内容
数据集名称 solidity-findings
数据集地址 https://huggingface.co/datasets/nguyenan0808/solidity-findings
简介 该数据集包含 Solidity 智能合约的静态分析发现(findings),记录了每个发现的元数据(如 ID、来源、检测器、严重性、文件位置、代码片段等)。
用途 适用于智能合约安全分析、漏洞检测器评估、代码审计研究等场景。
数据规模 训练集包含 2147 个样本,数据集总大小约 7.86 MB,下载大小约 11.99 MB。
数据特征 - id: 字符串,唯一标识<br>- schema_version: 整数,模式版本号<br>- source: 字符串,来源信息<br>- detector: 字符串,检测器名称<br>- severity: 字符串,严重性等级<br>- file: 字符串,文件路径<br>- lines: 整数列表,相关行号<br>- snippet: 字符串,代码片段
数据划分 仅提供 train 分割,包含 2147 个样本,数据文件位于 data/train-*
搜集汇总
数据集介绍
solidity-findings 数据集图片
构建方式
该数据集名为solidity-findings,聚焦于智能合约安全审计领域,旨在为Solidity代码中的潜在漏洞提供结构化标注。其构建方式基于对合约源码的静态分析,整合了多种检测工具的输出结果,每条记录包含唯一标识符、模式版本、来源、检测器名称、风险等级、涉及文件、行号列表以及代码片段。数据以标准HuggingFace格式存储,仅包含训练集,共2147个样本,规模适中,便于模型训练与验证。
使用方法
使用该数据集时,研究者可直接通过HuggingFace库加载默认配置,获取包含2147条样本的训练集。每条样本的字段设计简洁明确,便于进行数据预处理与特征工程。适用于监督学习场景,尤其是智能合约漏洞检测与分类任务。研究者可依据severity字段进行分层采样,或结合snippet进行文本建模。数据集规模适中,CPU亦可快速完成实验,适合作为安全领域的基准测试集。
背景与挑战
背景概述
随着区块链技术的迅猛发展,智能合约作为其核心组件,在金融、供应链等多领域得到广泛应用,其安全性至关重要。然而,智能合约漏洞频发,导致巨额资产损失,对合约代码进行高效、准确的静态分析成为亟待解决的课题。在此背景下,solidity-findings数据集应运而生,由区块链安全研究团队于近年构建,旨在为Solidity智能合约的漏洞检测提供标准化基准。该数据集汇集了来自真实审计项目的2147个检测结果,涵盖多种漏洞类型、严重性等级及对应的源代码片段,为开发与评估智能合约静态分析工具提供了宝贵资源。其发布显著推动了智能合约安全分析领域的研究进展,成为众多学术研究与工业实践的重要参考,对提升区块链生态的整体安全性具有深远影响。
当前挑战
该数据集所应对的核心挑战在于智能合约安全分析技术的复杂性。传统软件漏洞检测方法难以直接适用于Solidity语言的独特语义及以太坊虚拟机环境,需针对性设计分析算法。具体而言,领域面临的主要挑战包括:精确识别跨函数调用及状态依赖的复杂漏洞模式,平衡误报与漏报率,以及适应合约代码的频繁更新与多样化编程风格。在数据集构建过程中,团队亦遭遇多重困难:从海量真实审计数据中筛选并标准化异构信息,需确保漏洞标注的准确性与一致性;同时,代码片段的提取需保留足够上下文以供分析,且需处理不同审计报告间的格式差异。此外,构建大规模、高质量且合理划分的数据集需投入大量人工与计算资源,但最终形成的solidity-findings有效缓解了这些难题,为研究社区提供了可靠实验基础。
常用场景
经典使用场景
在区块链智能合约安全研究领域,solidity-findings数据集作为一份精心标注的漏洞检测基准,广泛应用于智能合约静态分析工具的评估与训练。该数据集包含2147个真实世界的Solidity代码片段及其对应的漏洞类型、严重等级和检测器信息,为研究者提供了标准化的测试平台,用以验证不同分析模型(如基于模式匹配的经典工具与基于深度学习的现代方法)在识别重入攻击、整数溢出等典型漏洞时的精确率与召回率,从而推动智能合约安全检测技术的持续演进。
解决学术问题
该数据集直面智能合约漏洞标注数据稀缺的学术困境,为自动化漏洞检测模型的监督学习提供了高质量的训练语料。通过整合多种检测器对同一代码片段的多维标注,它促进了多标签分类、迁移学习及模型鲁棒性研究的开展,有效缓解了现有工具在跨项目、跨版本场景下泛化能力不足的问题,为构建更普适的智能合约安全分析框架奠定了数据基础,对保障区块链生态的信任机制具有深远意义。
实际应用
在实际应用层面,solidity-findings数据集可被无缝集成至DevSecOps流程中,作为持续集成/持续部署(CI/CD)管道内智能合约安全审计模块的验证基准。安全团队可依托该数据集对内部开发的静态分析工具进行回归测试,确保新版本不引入误报或漏报。同时,它亦可作为安全培训的教学资源,通过真实漏洞案例提升开发者的安全编码意识,助力企业在合约上线前有效规避因代码缺陷引发的资产损失风险,提升区块链应用的整体安全水位。
数据集最近研究
最新研究方向
该数据集聚焦于智能合约安全审计领域,汇集了2147条经过标注的Solidity代码缺陷实例,覆盖了漏洞类型、严重等级及源码片段等关键信息。当前研究前沿正从传统静态分析转向利用深度学习模型进行自动化漏洞检测与修复,此数据集为此类模型提供了高质量的训练与验证基础。随着DeFi生态的蓬勃发展,智能合约安全事件频发,该数据集在推动基于大语言模型的代码审计工具、提升漏洞识别精度以及构建可解释性AI审计系统方面具有重要意义,为构建更安全的区块链应用环境奠定了数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务