AD-GEN
收藏资源简介:
AD-GEN是一个将COMISET语料库中的大规模Windows Sysmon遥测数据转换为以进程为中心、保护隐私、压缩且经过验证的ATT&CK对齐叙事记录的数据集,专为基于LLM的SOC自动化、ATT&CK感知指令调优、威胁狩猎助手开发、端点行为推理和安全叙事生成而设计。
AD-GEN is a dataset that converts large-scale Windows Sysmon telemetry data from the COMISET corpus into process-centric, privacy-preserving, compressed, and validated ATT&CK-aligned narrative records. It is specifically designed for LLM-based SOC automation, ATT&CK-aware instruction tuning, threat hunting assistant development, endpoint behavior reasoning, and security narrative generation.
数据集概述
数据集名称: AD-GEN (Evidence-Preserving Generation of Validated ATT&CK-Aligned Narratives from Large-Scale Endpoint Telemetry)
数据集目的: 将大规模 Windows Sysmon 遥测数据(来自 COMISET 语料库)转换为以进程为中心、保护隐私、压缩且经过验证的 ATT&CK 对齐叙事记录,专为 LLM 驱动的 SOC 自动化、ATT&CK 推理和指令微调设计。
适用场景:
- 基于 LLM 的 SOC 自动化
- 感知 ATT&CK 的指令微调
- 威胁猎助手开发
- 端点行为推理
- 安全叙事生成
数据集规模
| 指标 | LAB 环境 | REAL 环境 | 总计 |
|---|---|---|---|
| 原始 Sysmon 事件 | 49,914,325 | 202,304,790 | 252,219,115 |
| 压缩后事件 | 21,360,985 | 31,571,618 | 52,932,603 |
| Step 2 叙事 | 49,745 | 185,978 | 235,723 |
| Step 3 LLM 输出 | 50,671 | 190,109 | 240,780 |
| Step 4 验证后输出 | 50,622 | 190,085 | 240,707 |
压缩统计
| 环境 | 原始事件 | 压缩后事件 | 压缩比 | 事件减少率 |
|---|---|---|---|---|
| LAB | 49,914,325 | 21,360,985 | 2.34× | 57.20% |
| REAL | 202,304,790 | 31,571,618 | 6.41× | 84.39% |
| 总体 | 252,219,115 | 52,932,603 | 4.76× | 79.01% |
风险分布
| 风险等级 | 数量 | 百分比 |
|---|---|---|
| 低 | 234,046 | 97.26% |
| 中 | 3,131 | 1.30% |
| 高 | 2,607 | 1.08% |
| 严重 | 847 | 0.35% |
主要 MITRE ATT&CK 战术
| 战术 ID | 战术名称 | 频率 |
|---|---|---|
| TA0004 | Privilege Escalation | 3,157 |
| TA0005 | Defense Evasion | 2,511 |
| TA0003 | Persistence | 2,451 |
| TA0002 | Execution | 1,763 |
| TA0007 | Discovery | 727 |
| TA0006 | Credential Access | 603 |
数据格式
每条记录以 JSONL 格式存储。示例结构包含字段:
sample_id:样本唯一标识environment:环境类型(LAB / REAL)source_dataset:来源数据集(COMISET)narrative:叙事文本sysmon_hints:Sysmon 提示的 ATT&CK 技术 IDlabel:标签对象,包含:risk_level:风险等级mitre_tactics:ATT&CK 战术 ID 列表mitre_techniques:ATT&CK 技术 ID 列表recommended_actions:推荐的 SOC 操作列表(如check_threat_intel,get_file_metadata等)summary:行为摘要analyst_rationale:分析师推理依据verdict:判决结果(如suspicious)label_source:标签来源(llm_validated)
支持的 SOC 操作包括:check_threat_intel, get_file_metadata, query_registry, get_network_flow, terminate_process, isolate_host, no_action。
标签质量
| 指标 | LAB | REAL |
|---|---|---|
| 解析成功率 | 100.00% | 100.00% |
| Schema 有效性 | 99.93% | 99.98% |
| 判决一致性 | 95.98% | 98.64% |
| 验证后未知战术占比 | 0.032% | 0.007% |
| 验证后未知技术占比 | 0.041% | 0.013% |
| 无效操作数 | 0 | 0 |
跨模型审计
- 审计样本量:300
- 审计模型数:3(GPT-5.5, Claude Opus 4.8, Gemini 3.5 Flash)
- GPT-5.5 综合评分:0.748
- Claude Opus 4.8 综合评分:0.748
- 最小证据支持评分:>0.72
- 最小 ATT&CK 对齐评分:>0.72
独立审计表明,验证后的 ATT&CK 对齐标签具有可靠性和一致性。
文件与仓库结构
AD-GEN ├── README.md ├── LAB │ └── NEW_LAB.jsonl # 来自 COMISET 实验室环境的 AD-GEN 记录 ├── REAL │ └── NEW_REAL.jsonl # 来自 COMISET 真实大学网络环境的 AD-GEN 记录 ├── docs │ └── pipeline.png # AD-GEN 转换流程概览图 └── Conversion ├── Conversion.py # 记录格式转换工具 └── react_soc_prompt.txt # 生成时使用的 ReAct 风格 SOC 标记提示
重要说明
- AD-GEN 标签是经验证的合成分析师标签,非人工裁决的取证真实标签。
- 数据源自 COMISET Windows 端点遥测语料库,不声称是原始遥测源。
- 数据集仅供研究使用(指令微调、弱监督、SOC 助手开发、ATT&CK 感知推理、端点叙事建模),在操作使用前建议进行额外专家审查。
许可信息
- 源代码:MIT 许可
- 数据集:CC BY-NC 4.0 许可
联系方式
Dinh Phuong Nam
胡志明市国家大学信息技术大学 (UIT)
胡志明市技术大学 (HUTECH)
GitHub: @namhop88





