遇见数据集

rakshak-cwe-v3-data

收藏
Hugging Face2026-07-15 更新2026-07-16 收录
官方服务:

资源简介:

该数据集是一个专注于代码安全领域的对话数据集,旨在支持代码漏洞检测和分析相关任务。它由大量对话样本构成,每个样本包含一个消息序列,其中每条消息都有角色(如用户、助手等)和内容字段,模拟了围绕代码安全问题的交互式对话。此外,每个样本附带了丰富的元数据,包括CWE(通用弱点枚举)标识符、漏洞严重程度、编程语言、数据来源、样本是否包含漏洞的标记以及唯一标识符。这些元数据为深入分析漏洞特征和模型性能提供了关键上下文。数据集总大小约554MB,包含训练集(78,400个样本)和测试集(1,600个样本),适用于训练和评估用于代码安全分析、漏洞识别或安全助手开发的AI模型。

This is a dialogue dataset specialized in the code security domain, designed to support tasks including code vulnerability detection and analysis. It comprises numerous dialogue samples, each containing a message sequence where each message has fields for role (e.g., user, assistant) and content, simulating interactive conversations around code security issues. In addition, each sample is accompanied by rich metadata including CWE (Common Weakness Enumeration) identifiers, vulnerability severity levels, programming languages, data sources, labels indicating whether the sample contains vulnerabilities, and unique identifiers. This metadata provides critical context for in-depth analysis of vulnerability characteristics and model performance. The total size of the dataset is approximately 554 MB, which includes a training set with 78,400 samples and a test set with 1,600 samples. It is suitable for training and evaluating AI models for code security analysis, vulnerability recognition, or security assistant development.

创建时间:
2026-07-04
原始信息汇总

数据集名称

rakshak-cwe-v3-data

数据集描述

该数据集是一个用于安全相关任务的数据集,包含代码漏洞样本(CWE)及其元信息。

数据集结构

每条数据包含两个主要字段:

  • messages:对话消息列表,每条消息包含:
    • role(字符串):消息角色(如用户或助手)
    • content(字符串):消息内容
  • _meta:元信息结构,包含:
    • cwe(字符串):漏洞类型(CWE编号)
    • severity(字符串):严重程度
    • language(字符串):编程语言
    • source(字符串):数据来源
    • is_vulnerable(布尔值):是否包含漏洞
    • id(字符串):唯一标识符

数据划分

  • 训练集:78,400 条样本,大小约 517.9 MB
  • 测试集:1,600 条样本,大小约 10.6 MB
  • 总数据集大小:约 528.6 MB
  • 下载大小:约 174.4 MB

配置文件

  • 配置名称:default
  • 数据文件路径
    • 训练集:data/train-*
    • 测试集:data/test-*
搜集汇总
数据集介绍
rakshak-cwe-v3-data 数据集图片
构建方式
该数据集依托于软件安全领域中对常见弱点枚举(CWE)的深度分析而构建。其核心结构围绕对话式消息序列展开,每条样本均包含角色与内容字段,同时辅以详尽的元数据层,囊括了CWE分类标识、漏洞严重性等级、编程语言类型、数据来源以及漏洞存在性标记。数据集被明确划分为训练集与测试集,分别包含78,400条与1,600条样本,确保了模型评估的独立性与可靠性。
特点
此数据集最显著的特征在于其多维度标注体系,不仅提供了基础的对话内容,更通过元数据字段实现了对软件漏洞的精细化刻画。每个样本均关联了具体的CWE编号,使得模型能够精准学习不同漏洞类型的模式;严重性等级与编程语言信息的加入,进一步增强了数据集的适用广度。此外,布尔类型的漏洞标记为二分类任务提供了清晰的监督信号,而来源字段则确保了数据的可追溯性。
使用方法
该数据集适用于训练基于大语言模型的软件漏洞检测与分类系统。用户可直接利用对话消息序列作为输入特征,结合元数据中的标签进行监督学习,例如训练模型根据代码片段识别潜在的CWE漏洞。推荐使用HuggingFace的datasets库加载数据,通过指定default配置即可轻松获取分好训练集与测试集的数据。在建模时,可将messages字段作为序列输入,以_meta中的is_vulnerable或cwe字段作为预测目标,从而实现端到端的漏洞智能分析。
背景与挑战
背景概述
在软件安全领域,通用弱点枚举(CWE)作为漏洞分类的标准化体系,为安全分析提供了重要支撑。rakshak-cwe-v3-data数据集由安全研究机构于近期构建,旨在解决代码漏洞检测中的高质量标注数据匮乏问题。该数据集涵盖了78400条训练样本与1600条测试样本,每条数据均包含CWE类型、严重等级、编程语言及漏洞标记等结构化元信息,为基于大语言模型的代码安全分析提供了细粒度的监督信号。其核心研究问题聚焦于如何利用多维度标注数据提升模型对漏洞模式的泛化识别能力,对推动自动化安全审计工具的发展具有显著影响力。
当前挑战
当前数据集面临的核心挑战在于领域问题的复杂性:代码漏洞类型多样且成因各异,不同CWE类别间存在边界模糊现象,使得模型难以在有限标注样本中学习到稳健的判别边界。构建过程中,需平衡数据隐私与标注质量,源代码的敏感性和可获取性限制了样本多样性,同时人工标注漏洞类别与严重等级存在主观偏差风险。此外,多编程语言混合的数据分布可能导致模型对低频语言(如Go、Rust)的脆弱性检测能力不足,这些因素共同构成了数据集应用与扩展中的关键瓶颈。
常用场景
经典使用场景
在软件安全领域,rakshak-cwe-v3-data数据集被广泛用于训练和评估针对源代码漏洞检测的深度学习模型。该数据集以对话形式组织,包含角色与内容字段,并附带CWE编号、严重级别、编程语言及漏洞标签等元信息,为多分类或二分类任务提供了标准化的输入结构。研究者常利用其8万条训练样本和1600条测试样本,构建基于Transformer架构的预训练语言模型,以自动识别代码片段中潜在的脆弱点。
实际应用
在实际应用中,该数据集可支撑自动化安全审计工具的研发,帮助开发团队在代码提交前识别和修复安全缺陷。基于此数据集训练的模型可集成到CI/CD流水线中,实时扫描增量的代码变更,降低因软件漏洞导致的生产事故风险。此外,安全咨询公司可利用该数据集构建私有检测服务,为客户提供定制化的代码安全评估,从而提升整体软件开发生命周期的安全性。
衍生相关工作
围绕rakshak-cwe-v3-data衍生了一系列经典工作。例如,有研究者利用其结构化元信息设计了结合CWE类型的多任务学习模型,显著提升了对未见过漏洞变体的检出率。另有工作将其与CodeBERT等代码预训练模型结合,探索提示学习在漏洞检测中的应用。此外,该数据集还被用于构建漏洞根因定位的基准测试,推动了从“是否易受攻击”到“为何易受攻击”的深层次研究演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务