遇见数据集

threat-intelligence-dataset

收藏
github2026-06-26 更新2026-06-29 收录
官方服务:

资源简介:

一个用于教导语言模型进行网络安全威胁情报工作的指令调优数据集:包括读取CVE并解释实际风险、从ATT&CK技术剖析威胁行为者、将Sigma规则转换为警报分类指导、映射攻击链的杀伤链、为技术编写检测逻辑等。数据集基于真实来源构建,如MITRE ATT&CK、CISA KEV、CWE等,每个事实声明都经过验证,包含9,970个单轮示例和1,500个多轮对话,覆盖37个类别,旨在提高模型在网络安全领域的准确性和实用性。

This is an instruction-tuning dataset designed to train large language models (LLMs) to perform cybersecurity threat intelligence tasks. It covers tasks including reading Common Vulnerabilities and Exposures (CVE) entries and explaining their actual risks, analyzing threat actors via MITRE ATT&CK techniques, converting Sigma rules into alert classification guidelines, mapping the kill chain of attack chains, writing detection logic for cybersecurity techniques, and more. The dataset is built on authoritative real-world sources such as MITRE ATT&CK, CISA KEV, CWE, and others. All factual statements within the dataset have been verified. It contains 9,970 single-turn examples and 1,500 multi-turn conversations, spanning 37 categories, and aims to enhance the accuracy and practical applicability of models in the cybersecurity domain.

创建时间:
2026-06-26
原始信息汇总

数据集概述

该数据集是一个针对网络威胁情报(CTI)领域设计的指令微调数据集,旨在训练大语言模型执行各类CTI分析任务,如解读CVE风险、分析威胁行为体、理解Sigma规则、映射攻击链以及编写检测逻辑等。

核心特性

  • 数据真实性保障:所有生成记录均源自真实数据源(如MITRE ATT&CK、CISA KEV、CWE、OSV、abuse.ch等),且每个事实性引用(如技术ID、CVE编号、IOC)在生成后均经过验证,未通过验证的记录会被丢弃。
  • 数据规模与多样性
    • 包含 9,970条单轮对话1,500条多轮对话
    • 覆盖 37个类别,每个类别不少于150个示例。
    • 97.6%的指令各不相同,通过多样化措辞避免模型过拟合于特定提问方式。
  • 去重与平衡:使用嵌入技术去除近重复项,并对每个类别进行平衡处理。

文件结构

文件 记录数 说明
data/train.jsonl 9,172 单轮训练集(instruction/input/output格式)
data/eval.jsonl 798 按类别分层的保留评估集
data/train_blended.jsonl 12,229 训练集混合25%通用指令,防止模型遗忘安全领域外话题
data/train_multiturn.jsonl 1,500 多轮对话数据集,含两轮相互关联的问答

所有数据文件可通过以下方式从Hugging Face加载:

python from datasets import load_dataset

ds = load_dataset("reloading0101/threat-intelligence-dataset") # train + validation blended = load_dataset("reloading0101/threat-intelligence-dataset", "blended") # + 25% general chat = load_dataset("reloading0101/threat-intelligence-dataset", "multi_turn") # multi-turn

数据格式

  • 单轮记录:采用 instruction / input / output 结构,并附带元数据(如类别、任务类型、数据源引用)。
  • 多轮记录:使用标准 messages 列表格式,每轮助手回答均基于同一真实实体(如分析CVE后追问“是否应优先修补”)。

数据来源

  • 威胁情报框架:MITRE ATT&CK v19.1(企业、移动、ICS)、MITRE ATLAS、MITRE CWE。
  • 漏洞与评估:CISA KEV、FIRST.org EPSS、AttackerKB、OSV.dev。
  • 恶意软件与威胁数据:abuse.ch(Feodo、SSLBL、URLhaus、ThreatFox)、MalwareBazaar、Malpedia、ransomware.live、OpenPhish。
  • 安全框架:OWASP Top 10、API Top 10、STRIDE、NIST SP 800-61、Diamond Model、Pyramid of Pain。
  • 通用文本:databricks-dolly-15k用于混合训练。

构建流程

  1. 将各类数据源解析为统一的知识库(如技术-战术-缓解措施关联、组织-恶意软件关联、CVE-EPSS分数关联)。
  2. 基于知识库中的真实实体生成记录,发电机从不自行编造ID或关系。
  3. 使用本地模型对每条指令进行重述,避免相同任务使用相同措辞。
  4. 使用本地模型将回答改写为可读的分析师风格文本,并设立事实校验门控,防止模型偏离事实。
  5. 通过嵌入去除近重复项,平衡每个类别数量。
  6. 最终验证阶段重新检查每条记录中的ID与知识库的一致性,不匹配则丢弃。

37个类别

ai-ml-threats, api-security, attribution-analysis, botnet-infrastructure, campaign-analysis, cloud-saas-security, container-security, cryptojacking-mining, cyber-espionage-apt, dark-web-cybercrime, data-exfiltration, deception-technology, digital-risk-management, email-threats, geopolitical-threats, ics-ot-security, incident-response-forensics, insider-threats, malicious-campaigns, malware, mobile-iot-threats, network-based-threats, ransomware-operations, red-team-operations, security-monitoring-detection, social-engineering-fraud, supply-chain-attacks, threat-actors, threat-hunting, threat-intelligence, threat-intelligence-feeds, threat-intelligence-operations, threat-modeling, ttps-mitre-attack, vulnerabilities-cves, web-application-security, zero-day-exploits

微调建议

  • 适用于已指令微调的模型(如Llama 3.x Instruct、Qwen2.5 Instruct),推荐使用LoRA或QLoRA进行领域适配。
  • 建议在 train_blended.jsonl 上训练(混合25%通用指令),避免模型过度专业化而丧失对话能力;评估时使用纯CTI的 eval.jsonl,并按类别细分模型薄弱点。
  • 训练参数参考:LoRA rank 16-32,学习率1e-4至2e-4,cosine调度,2-3个epoch,序列长度2048,仅训练答案部分(mask掉prompt)。

局限说明

  • 对ATT&CK框架依赖较强:约61%的记录引用ATT&CK,模型可能偏好使用该框架进行表述。
  • 部分类别规模较小:如挖矿、邮件、社会工程等类别因真实源材料有限,仅150-175条示例。
  • 以单轮对话为主:多轮对话仅占较小部分。
  • 回答风格偏向报告结构:适合分析任务,但不适用于开放式聊天。

伦理与许可

  • 仅用于防御性安全、教育和研究目的,不含可利用漏洞、武器化代码、PII或私有数据。
  • 指标为保留/合成范围或公开报告的检测用指标。
  • 采用 CC BY 4.0 许可,同时要求对底层数据源(如ATT&CK、CISA、Dolly等)的原始许可给予适当引用。

重要链接

  • Hugging Face 数据集页面:https://huggingface.co/datasets/reloading0101/threat-intelligence-dataset
  • 许可协议:https://creativecommons.org/licenses/by/4.0/

引用格式

bibtex @misc{cti-instruction-tuning-dataset, title = {Cyber Threat Intelligence Instruction-Tuning Dataset}, author = {Reloading}, year = {2026}, url = {https://huggingface.co/datasets/reloading0101/threat-intelligence-dataset} }

搜集汇总
数据集介绍
threat-intelligence-dataset 数据集图片
构建方式
该数据集的构建摒弃了传统模板填充式的方法,转而采用自底向上的严谨策略。首先,从MITRE ATT&CK、CISA KEV、CWE、OSV、abuse.ch、Sigma等权威且真实的威胁情报源中解析出结构化的知识库,将技术、战术、缓解措施、恶意软件与漏洞间的关联关系清晰锚定。随后,生成器只从这个知识库中抽取真实实体来编排记录,绝不虚构任何ID、名称或关系。接着,一个本地模型对每条指令进行意译,使相同任务具备差异化的表达。另一个本地模型在事实核查门的监控下将答案改写为流畅的分析师散文,若出现事实漂移则立即回退。最后,通过嵌入向量移除近重复项并均衡类别分布,再经过一轮对所有ID的最终校验,确保每条记录都经得起溯源验证。
使用方法
该数据集专为已经过指令微调的基础模型(如Llama 3.x Instruct、Qwen2.5 Instruct)进行领域适应而设计,推荐使用LoRA或QLoRA技术高效微调。建议使用包含百分之二十五通用指令的混合数据(train_blended.jsonl)进行训练,以防止模型过度专业化而丧失通用对话能力。评估时则应使用纯CTI数据的eval.jsonl,并分类别拆解评分以精准定位模型弱点。合理的超参数起点为:LoRA秩16至32,学习率1e-4至2e-4搭配余弦调度,训练2至3个轮次并监控验证损失,序列长度设为2048,并在训练时屏蔽提示词部分仅对答案进行优化。
背景与挑战
背景概述
在网络安全态势日益严峻的当下,威胁情报(CTI)作为主动防御的核心能力,其自动化分析需求与日俱增。大语言模型(LLM)在安全领域的应用虽展现出巨大潜力,却受限于高质量、可验证的训练数据匮乏。由独立安全研究者Reloading于2026年发布的threat-intelligence-dataset,正是为解决这一关键瓶颈而生。该数据集基于MITRE ATT&CK、CISA KEV、CWE等权威来源,通过严格的实体验证与去重流程,构建了涵盖37个安全任务类别、近一万两千条指令与对话样本的高质量语料库。其核心研究问题聚焦于:如何通过可验证的威胁情报数据,使语言模型具备真实的CVE风险评估、攻击者画像、检测逻辑编写等专业能力。该数据集已成为网络安全LLM领域的重要基准,推动了从模板填充式数据向事实驱动式数据的范式转变。
当前挑战
该数据集面临的核心挑战源于威胁情报领域的复杂性与数据构建的严苛标准。领域问题层面,主要挑战在于:1)解决LLM在CTI任务中常见的“事实幻觉”现象,即模型生成看似专业却与真实漏洞、攻击技术不符的虚假分析;2)覆盖威胁情报分析全链条(从漏洞解析到检测规则生成)的高质量、可验证指导数据极度稀缺;3)各类威胁实体(如CVE、ATT&CK技术)间的关联关系需保持精确映射。构建过程层面,挑战包括:1)从MITRE、CISA等异构数据源中提取并校验实体间真实关系,确保未经验证的ID、名称或关联被严格剔除;2)在保持37个类别(部分仅有150余条真实样本)平衡性的同时,避免通过填充伪数据破坏准确性;3)通过嵌入去重与本地模型改写环节,确保指令多样性(97.6%不同表述)与答案事实正确性之间的微妙平衡,防止模型在改写过程中偏离源数据事实。
常用场景
经典使用场景
在网络安全与威胁情报的交叉领域中,该数据集被广泛用于对大型语言模型进行指令微调,以赋予其专业化、事实驱动的威胁分析能力。其典型场景聚焦于让模型能够理解并阐释CVE漏洞的实际风险、基于ATT&CK技术矩阵对威胁行为者进行剖析、将Sigma规则转化为可操作的告警分诊指导,以及绘制攻击活动的杀伤链全貌。通过这些高保真、可验证的样本,模型得以从复制报告模板的表象跃升至具备真实情报研判逻辑的专家级水准,为安全运营中心(SOC)等机构提供智能辅助。
解决学术问题
该数据集精准解决了现有CTI数据集普遍存在的“虚假关联”与“事实脱节”问题——以往数据集常包含虚构的IP地址、噪声哈希或不匹配的MITRE技术ID,导致模型学到的仅是形式上的报告腔调而非准确知识。通过严格追溯至MITRE ATT&CK、CISA KEV、CWE等真实信源,并经过逐条事实校验与近重复剔除,该数据集合成了一种高信噪比的训练基准。它不仅推动了威胁情报领域知识图谱与生成式模型的深度融合,还确立了“可追溯事实驱动内容生成”的范式,对提升AI在安全领域的可解释性与可靠性具有里程碑意义。
实际应用
在实际部署中,该数据集赋能了一系列防卫型安全工具与流程的智能化升级。将微调后的模型集成至安全编排自动化与响应(SOAR)平台后,可实现对海量警报的自动分级与上下文丰富化;在漏洞管理环节中,模型能基于EPSS评分与CISA KEV状态,生成优先级排序的修复合议;此外,其还可辅助红队操作方案的设计、网络狩猎查询的编写,以及面向管理层的非技术性风险沟通。该数据集尤其适合作为企业级安全大模型领域适配(Domain-Adaptation)的核心语料,将通用语言模型转化为专职的威胁情报分析师。
数据集最近研究
最新研究方向
该数据集聚焦于利用大语言模型(LLM)进行网络威胁情报(CTI)的指令微调,前沿方向涵盖自动化漏洞风险解读、威胁行为者画像、告警分诊指南生成、杀伤链映射与检测逻辑编写等核心任务。其独特价值在于严格源于MITRE ATT&CK、CISA KEV、EPSS等真实威胁数据源,摒弃了传统CTI数据集中伪造指标与事实错配的弊病,通过双重验证与语义去重机制确保了数据的高保真度。当前,随着APT攻击高发与零日漏洞泛化,该数据集使安全分析师能够利用微调后的模型快速响应CVE漏洞、关联供应链攻击脉络,并自动化产出可操作的威胁情报。其37个细粒度分类与多轮对话设计,为构建跨领域、高精度的安全LLM提供了坚实基座,推动CTI从手工研判向智能辅助决策的范式跃迁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务