遇见数据集

AD-GEN

收藏
github2026-06-03 更新2026-06-04 收录
数据链接:
官方服务:

资源简介:

AD-GEN是一个将COMISET语料库中的大规模Windows Sysmon遥测数据转换为以进程为中心、保护隐私、压缩且经过验证的ATT&CK对齐叙事记录的数据集,专为基于LLM的SOC自动化、ATT&CK感知指令调优、威胁狩猎助手开发、端点行为推理和安全叙事生成而设计。

AD-GEN is a dataset that converts large-scale Windows Sysmon telemetry data from the COMISET corpus into process-centric, privacy-preserving, compressed, and validated ATT&CK-aligned narrative records. It is specifically designed for LLM-based SOC automation, ATT&CK-aware instruction tuning, threat hunting assistant development, endpoint behavior reasoning, and security narrative generation.

创建时间:
2026-05-28
原始信息汇总

数据集概述

数据集名称: AD-GEN (Evidence-Preserving Generation of Validated ATT&CK-Aligned Narratives from Large-Scale Endpoint Telemetry)

数据集目的: 将大规模 Windows Sysmon 遥测数据(来自 COMISET 语料库)转换为以进程为中心、保护隐私、压缩且经过验证的 ATT&CK 对齐叙事记录,专为 LLM 驱动的 SOC 自动化、ATT&CK 推理和指令微调设计。

适用场景:

  • 基于 LLM 的 SOC 自动化
  • 感知 ATT&CK 的指令微调
  • 威胁猎助手开发
  • 端点行为推理
  • 安全叙事生成

数据集规模

指标 LAB 环境 REAL 环境 总计
原始 Sysmon 事件 49,914,325 202,304,790 252,219,115
压缩后事件 21,360,985 31,571,618 52,932,603
Step 2 叙事 49,745 185,978 235,723
Step 3 LLM 输出 50,671 190,109 240,780
Step 4 验证后输出 50,622 190,085 240,707

压缩统计

环境 原始事件 压缩后事件 压缩比 事件减少率
LAB 49,914,325 21,360,985 2.34× 57.20%
REAL 202,304,790 31,571,618 6.41× 84.39%
总体 252,219,115 52,932,603 4.76× 79.01%

风险分布

风险等级 数量 百分比
234,046 97.26%
3,131 1.30%
2,607 1.08%
严重 847 0.35%

主要 MITRE ATT&CK 战术

战术 ID 战术名称 频率
TA0004 Privilege Escalation 3,157
TA0005 Defense Evasion 2,511
TA0003 Persistence 2,451
TA0002 Execution 1,763
TA0007 Discovery 727
TA0006 Credential Access 603

数据格式

每条记录以 JSONL 格式存储。示例结构包含字段:

  • sample_id:样本唯一标识
  • environment:环境类型(LAB / REAL)
  • source_dataset:来源数据集(COMISET)
  • narrative:叙事文本
  • sysmon_hints:Sysmon 提示的 ATT&CK 技术 ID
  • label:标签对象,包含:
    • risk_level:风险等级
    • mitre_tactics:ATT&CK 战术 ID 列表
    • mitre_techniques:ATT&CK 技术 ID 列表
    • recommended_actions:推荐的 SOC 操作列表(如 check_threat_intel, get_file_metadata 等)
    • summary:行为摘要
    • analyst_rationale:分析师推理依据
    • verdict:判决结果(如 suspicious
    • label_source:标签来源(llm_validated

支持的 SOC 操作包括:check_threat_intel, get_file_metadata, query_registry, get_network_flow, terminate_process, isolate_host, no_action


标签质量

指标 LAB REAL
解析成功率 100.00% 100.00%
Schema 有效性 99.93% 99.98%
判决一致性 95.98% 98.64%
验证后未知战术占比 0.032% 0.007%
验证后未知技术占比 0.041% 0.013%
无效操作数 0 0

跨模型审计

  • 审计样本量:300
  • 审计模型数:3(GPT-5.5, Claude Opus 4.8, Gemini 3.5 Flash)
  • GPT-5.5 综合评分:0.748
  • Claude Opus 4.8 综合评分:0.748
  • 最小证据支持评分:>0.72
  • 最小 ATT&CK 对齐评分:>0.72

独立审计表明,验证后的 ATT&CK 对齐标签具有可靠性和一致性。


文件与仓库结构

AD-GEN ├── README.md ├── LAB │ └── NEW_LAB.jsonl # 来自 COMISET 实验室环境的 AD-GEN 记录 ├── REAL │ └── NEW_REAL.jsonl # 来自 COMISET 真实大学网络环境的 AD-GEN 记录 ├── docs │ └── pipeline.png # AD-GEN 转换流程概览图 └── Conversion ├── Conversion.py # 记录格式转换工具 └── react_soc_prompt.txt # 生成时使用的 ReAct 风格 SOC 标记提示


重要说明

  • AD-GEN 标签是经验证的合成分析师标签,非人工裁决的取证真实标签。
  • 数据源自 COMISET Windows 端点遥测语料库,不声称是原始遥测源。
  • 数据集仅供研究使用(指令微调、弱监督、SOC 助手开发、ATT&CK 感知推理、端点叙事建模),在操作使用前建议进行额外专家审查。

许可信息

  • 源代码:MIT 许可
  • 数据集:CC BY-NC 4.0 许可

联系方式

Dinh Phuong Nam
胡志明市国家大学信息技术大学 (UIT)
胡志明市技术大学 (HUTECH)
GitHub: @namhop88

搜集汇总
数据集介绍
AD-GEN 数据集图片
构建方式
在网络安全领域,大规模端点遥测数据是分析攻击行为的重要基础,但原始数据体量庞大且缺乏语义结构,难以直接服务于自动化安全运营。AD-GEN数据集从COMISET语料库中提取海量Windows Sysmon日志,首先通过事件压缩技术将原始事件降维,减少冗余信息,随后基于进程上下文对事件进行聚合,生成初步的行为叙述。接着,利用大语言模型对叙述进行语义增强,生成结构化的ATT&CK对齐分析结果,最后经过自动化验证流程确保标签的格式合规性和内部一致性,最终形成包含风险等级、MITRE ATT&CK战术技术、推荐响应动作及分析师推理逻辑的高质量记录。
使用方法
使用AD-GEN数据集时,用户可直接从GitHub仓库下载LAB和REAL目录下的JSONL格式文件,每条记录包含样本标识、环境类型、自然语言叙述、Sysmon线索、风险标签及推荐SOC行动。数据集支持多种安全应用场景,例如基于ReAct模式的SOC自动化提示脚本可直接用于生成对抗性分析指令,转换脚本则便于将记录调整至其他格式。研究人员可将其用于训练大语言模型进行ATT&CK推理、开发威胁狩猎助手或评估端点行为叙事生成能力,但需注意标签为合成分析结果,在运营使用前应结合专家复审以确保决策准确性。
背景与挑战
背景概述
AD-GEN数据集的创建源于对大规模端点遥测数据进行结构化叙事生成的需求,旨在弥合原始系统监控事件与可解释性威胁分析之间的鸿沟。该数据集由Dinh Phuong Nam和Nguyen Tan Cam等研究人员于2026年开发,基于COMISET语料库中约2.52亿条Windows Sysmon事件,通过创新的流水线生成了超过24万条经过验证的ATT&CK对齐叙事记录。其核心研究问题聚焦于如何在大规模端点数据中保留证据完整性的同时,生成支持LLM驱动的安全运营中心自动化的压缩化、隐私保护型叙事。AD-GEN对网络安全领域的影响力体现在其提供了首个经过严格验证的、可直接用于指令微调与SOC助手开发的结构化数据集,显著推动了ATT&CK框架在自动化威胁猎捕中的应用。
当前挑战
AD-GEN所解决的领域挑战在于将原始端点遥测数据转化为具备ATT&CK语义的叙事记录,这一过程面临多重困难:首先,源数据规模庞大且噪声密集,需在压缩率高达4.76倍的同时确保关键证据不被丢失;其次,隐私保护与叙事完整性之间存在固有张力,要求在不泄露敏感信息的前提下生成可审计的分析师推理过程。构建过程中的挑战则包括:设计高精度的验证机制以保证标签质量,在LAB与REAL两种环境下分别达到99.93%与99.98%的架构有效性;跨模型审计显示,虽然独立前沿语言模型给出了一致性评价,但标签本质为合成分析结论而非人工审计结果,这要求额外专家复审。此外,非恶意行为的样本占比超过97%,使得从稀疏攻击信号中提取可靠模式成为技术难点。
常用场景
经典使用场景
在网络安全领域,端点安全分析长期受困于海量日志数据与深度学习模型缺乏高质量标注数据之间的矛盾。AD-GEN数据集的出现为此提供了突破性解决方案,其经典使用场景集中于大语言模型(LLM)驱动的安全运营中心(SOC)自动化。研究者利用该数据集的2.5亿条原始Sysmon事件经压缩转换后的约5.3万条精简记录,以及经专家级LLM验证的24万余条ATT&CK对齐叙事文本,开展基于提示学习的威胁检测任务。例如,通过输入包含进程行为序列的叙事段,模型可输出对应的风险等级、MITRE ATT&CK战术技术标签及推荐的响应动作,从而在指令微调框架下训练具备端点行为推理能力的智能安全助手。
解决学术问题
该数据集的构建精准回应了安全日志分析领域中长期存在的三大核心学术困境:缺乏大规模、已验证的ATT&CK对齐标注数据,日志数据隐私保护与信息保真度之间的权衡,以及自然语言叙事与结构化威胁情报之间的语义鸿沟。具体而言,AD-GEN通过隐私保护的压缩算法将Sysmon事件压缩79%至4.76倍,同时保留关键证据链,有效解决了海量日志中高质量标注样本稀缺的问题。其基于ReAct范式的标签生成与多模型一致性审计机制(GPT-5.5与Claude Opus 4.8评分均达0.748),为弱监督学习、指令微调及ATT&CK推理研究提供了可复现的基准,推动了安全领域大语言模型评估规范的确立。
实际应用
在真实的网络安全运营场景中,AD-GEN为安全分析师提供了一套从原始日志到可执行决策的端到端范式。其实际应用涵盖了多个关键环节:在威胁狩猎方面,分析师可借助数据集中的叙事文本快速定位异常进程活动序列,结合“get_file_metadata”、“query_registry”、“isolate_host”等预定义SOC动作进行即时响应;在自动化告警分析中,该数据集支持的96%以上一致性情解决策标签可用于训练分类模型,降低误报率。此外,数据集中的“check_threat_intel”、“terminate_process”等动作提示为开发基于ReAct模式的自动化事件响应Agent提供了标准接口,使安全团队能高效处理大规模端点事件,显著缩短从检测到处置的MTTR周期。
数据集最近研究
最新研究方向
AD-GEN作为首个将大规模Windows Sysmon遥测数据转化为经ATT&CK验证的结构化叙事记录的数据集,为网络安全领域的大语言模型驱动安全运营中心自动化开辟了全新路径。当前前沿研究聚焦于利用其24万余条高质量标注样本,结合LLM进行威胁狩猎辅助、端点行为推理和安全叙事生成,尤其关注在真实网络环境中验证ATT&CK战术与技术推理的准确性。该数据集通过保留证据链的压缩策略,解决了原始遥测数据量庞大且缺乏语义的问题,为自动化告警研判、入侵路径重构和弱监督学习提供了可靠基准,标志着安全运营从规则匹配向认知智能的重要跨越。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务