遇见数据集

CIRCL/vulnerability-attack-techniques

收藏
Hugging Face2026-07-13 更新2026-07-22 收录
官方服务:

资源简介:

该数据集将1,207个CVE(通用漏洞披露)映射到MITRE ATT&CK(企业版)技术,结合了MITRE威胁情报防御中心(CTID)手工整理的映射和来自CIRCL/vulnerability-scores的漏洞描述。其目的是训练和评估模型,这些模型可以根据漏洞描述建议候选的ATT&CK技术,帮助防御者了解预期的对手行为和检测方法。数据集包括多个字段:CVE标识符、漏洞标题、英文描述(模型输入)、利用技术、主要影响、次要影响、所有手工技术(训练目标)、CVE2CAPEC派生技术(非训练用)、标签来源和ATT&CK版本。标签来源于CTID的CVE和KEV映射,所有技术ID标准化为企业版ATT&CK v19.1。数据集还包含标签统计、已知限制(如规模较小和选择偏差)和使用示例。上游来源的许可包括Apache-2.0、CC BY 4.0和GPLv3。

This dataset maps 1,207 Common Vulnerabilities and Exposures (CVE) entries to MITRE ATT&CK (Enterprise Edition) techniques, combining manually curated mappings from the MITRE Cyber Threat Intelligence Defense Center (CTID) and vulnerability descriptions sourced from CIRCL/vulnerability-scores. Its purpose is to train and evaluate models that can recommend candidate ATT&CK techniques based on vulnerability descriptions, helping defenders understand expected adversary behaviors and detection methods. The dataset includes multiple fields: CVE identifiers, vulnerability titles, English descriptions (model inputs), exploitation techniques, primary impacts, secondary impacts, all manually curated techniques (training targets), CVE2CAPEC-derived techniques (for non-training use), tag sources, and ATT&CK version. The tags originate from CTID's CVE and KEV mappings, and all technique IDs are standardized to Enterprise Edition ATT&CK v19.1. The dataset also includes tag statistics, known limitations such as small scale and selection bias, and usage examples. The licenses of upstream sources include Apache-2.0, CC BY 4.0, and GPLv3.

提供机构:
CIRCL
搜集汇总
数据集介绍
CIRCL/vulnerability-attack-techniques 数据集图片
构建方式
在网络安全领域,将通用漏洞披露(CVE)映射至MITRE ATT&CK攻击技术链是威胁建模的关键环节。本数据集通过融合MITRE威胁信息防御中心(CTID)手工标注的映射关系与CIRCL/vulnerability-scores提供的漏洞描述,构建了包含1207个CVE条目的高质量资源。每条记录中的`techniques`字段均遵循CTID发布的“将ATT&CK映射至CVE以评估影响”方法论,由分析师为每个漏洞标注最多三类技术:利用方式、主要影响与次要影响。标注来源包括CTID的attack_to_cve项目(788个CVE)和KEV映射探索器(392个CVE),另含27个重叠条目。所有技术ID已被统一归一化至企业版ATT&CK v19.1标准,确保标签的一致性与时效性。
使用方法
该数据集通过HuggingFace的`datasets`库即可便捷加载,用户可通过`load_dataset("CIRCL/vulnerability-attack-techniques")`获取训练集与测试集。数据结构包含`id`、`title`、`description`、`exploitation_techniques`、`primary_impact`、`secondary_impact`等字段,其中`description`作为模型输入,`techniques`作为训练目标。考虑到数据规模有限(约1200个样本)且存在选择偏差(过度代表已遭野外利用的漏洞),模型输出应定位为辅助分析师筛选候选技术而非提供权威映射。建议在推理时利用`techniques_derived`作为候选集过滤条件,以提升建议的相关性。
背景与挑战
背景概述
在网络安全领域,漏洞评估与威胁情报的深度融合是提升防御能力的关键。传统上,CVSS评分量化了漏洞的严重性,CWE分类揭示了缺陷类型,但二者均未直接回答一个核心问题:攻击者会如何利用该漏洞?MITRE ATT&CK框架填补了这一空白,其以攻击者行为为中心的技术分类体系为安全团队提供了检测与响应的直接指引。然而,将CVE漏洞描述映射至ATT&CK技术项需要深厚的领域知识,且人工标注成本高昂。在此背景下,由CIRCL、MITRE威胁知情防御中心(CTID)等机构联合构建的vulnerability-attack-techniques数据集应运而生,发布于2024年后。该数据集整合了CTID手工标注的788条CVE映射与392条已知被利用漏洞(KEV)映射,并统一归一化至ATT&CK v19.1版本,旨在为自然语言处理模型提供训练数据,从而自动化地从漏洞描述中推断攻击者可能采用的技术行为,对推动安全智能体的自动化分析具有重要价值。
当前挑战
该数据集面临的挑战首要源于其核心研究问题的复杂性:漏洞描述本质上是软件缺陷的技术陈述,而ATT&CK技术则刻画了攻击者的行为模式,二者之间存在语义鸿沟。即便对人类标注者而言,同一漏洞可能对应多种解读,导致标注一致性难以保证。数据规模微小(约1,200条CVE)限制了模型的泛化能力,仅适用于概念验证。构建过程中,标签来源存在显著的样本选择偏差:CTID的映射数据集过度集中在已被野外利用的漏洞上(KEV集合本身就是选择性收录),使得模型可能偏向于学习与已利用漏洞相关的特征。此外,自动推导的CVE→CWE→CAPEC→ATT&CK链(techniques_derived列)会产生大量技术项膨胀(中位数每CVE映射4-20个技术),这些伪标签若被用于训练,将引入系统性噪声。如何设计轻量级模型以生成候选技术供分析师复审,而非追求权威性映射,成为实用化的关键瓶颈。
常用场景
经典使用场景
在网络安全的浩瀚疆域中,CVE漏洞描述与MITRE ATT&CK攻击行为模型之间横亘着一道沟通的鸿沟。该数据集恰如一座精心构建的桥梁,将1,207个CVE映射至企业ATT&CK v19.1的对战技术,其经典用途在于为安全分析师提供一个智能化的候选技术推荐引擎。通过接收漏洞描述作为输入,模型能够输出一个经过专家验证的攻击技术列表,涵盖利用手法、主要影响与次要影响三个维度,从而将模糊的漏洞信息转化为可操作的防御策略。这一过程填补了CVSS漏洞严重性评分、CWE漏洞类型分类与ATT&CK攻击行为分析之间的语义空白,使防御者得以从'漏洞是什么'跃迁至'攻击者将如何行动'的认知层级。
解决学术问题
在学术研究层面,该数据集瞄准了一个长期困扰学界的核心难题:如何将静态的漏洞特征映射为动态的对抗行为知识。传统研究中,CVE描述仅关注软件本身的缺陷,而ATT&CK框架描述的是攻击者利用这些缺陷的战术意图与具体手法,两者分属不同的语义空间。该数据集提供了专家手工标注的监督标签,使研究者能够基于自然语言处理技术训练文本分类模型,从漏洞描述中推断出预期的攻击技术。它解决了自动化映射中标签稀疏性、语义歧义性以及框架间术语不兼容等问题,为构建可解释的、面向威胁情报的漏洞分析系统奠定了数据基础,推动了从'漏洞通报'到'威胁预警'的范式转变。
实际应用
在实际应用场景中,该数据集已成为威胁情报平台和安全编排自动化响应(SOAR)系统的核心催化剂。安全运营中心(SOC)的分析师可利用基于此数据集训练的模型,在接收到新的CVE公告时,即刻获得一组候选的ATT&CK攻击技术建议,从而将原本需要数小时的人工分析流程压缩至分钟级。该数据集特别适用于漏洞管理流程中的优先级排序环节:当模型输出的攻击技术指向T1190(利用面向公众的应用)等高危战术时,系统可自动触发补丁部署、入侵检测规则更新等响应动作。此外,在安全培训与红蓝对抗模拟中,该数据集也能辅助生成更贴近真实攻击链的场景化演练方案。
数据集最近研究
最新研究方向
该数据集聚焦于网络安全领域的前沿交叉研究方向,即通过自然语言处理技术将通用漏洞披露(CVE)自动映射至MITRE ATT&CK攻击技术框架。其核心创新在于弥合了漏洞描述(如CVSS评分、CWE缺陷类型)与具体攻击行为之间的语义鸿沟,为安全运营团队提供了从脆弱性到防御策略的端到端推理路径。结合CTID专家标注的1200余条高质量映射,该数据集支持训练模型从漏洞文本中智能推荐候选攻击技术,尤其适用于自动化威胁情报分析与攻击链预测。这一研究方向紧扣当前安全行业对攻击面管理与主动防御的热点需求,为后续研发高置信度的自动化映射工具奠定了数据基础,有望显著提升安全运营中漏洞预警与攻击行为关联的效率与准确性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务