遇见数据集

TorontoMetropolitanUniversity/Network_Defense_Symmetric_Competitive

收藏
Hugging Face2026-07-15 更新2026-07-22 收录
官方服务:

资源简介:

该数据集包含102,400,000个时间步,专注于多智能体强化学习场景。红方智能体的目标是发现漏洞、提升权限、破坏资产并维持持久性,其行动空间基于MITRE ATT&CK框架的阶段建模。蓝方智能体的目标是维护系统可用性、减少攻击面、检测恶意行为、通过蜜罐欺骗攻击者并驱逐入侵者,其行动空间包括防御配置和缓解措施。双方呈现纯零和对立关系,即红方的收益是蓝方的绝对损失,反之亦然。

102,400,000 timesteps, Multi-Agent Reinforcement Learning. The Red Agent’s goal is to discover vulnerabilities, elevate privileges, compromise assets, and maintain persistence, with its action space modeled after phases of the MITRE ATT&CK framework. The Blue Agent’s goal is to maintain system availability, reduce the attack surface, detect malicious behavior, deceive the attacker with honeypots, and evict the intruder, with its action space consisting of defensive configurations and mitigation steps. Pure Zero-Sum Opposition: Reds gain is Blues absolute loss and vice versa.

搜集汇总
数据集介绍
TorontoMetropolitanUniversity/Network_Defense_Symmetric_Competitive 数据集图片
构建方式
该数据集基于多智能体强化学习框架构建,模拟了红蓝双方在网络安全领域中的对称性对抗。红方智能体以MITRE ATT&CK框架的战术阶段为行动空间,旨在发掘漏洞、提升权限、破坏资产并维持持久化存在;蓝方智能体则通过防御配置与缓解措施,致力于维护系统可用性、缩减攻击面、检测恶意行为、利用蜜罐欺骗攻击者并驱逐入侵者。数据采集涵盖了1.024亿个时间步的交互记录,形成了纯零和博弈环境,其中红方的收益即为蓝方的绝对损失。
特点
该数据集的核心特点在于其纯粹的零和博弈机制,确保红蓝双方利益完全对立,为训练稳健的对抗性智能体提供了理想基准。数据规模庞大,包含超过1亿个时间步的交互日志,覆盖了从攻击探索到防御响应的完整对抗链条。动作空间严格映射于MITRE ATT&CK框架与防御策略,使得数据集兼具领域专业性与实战适用性,适用于评估智能体在复杂网络攻防场景下的策略优化能力。
使用方法
该数据集适用于多智能体强化学习模型的训练与评估,研究者可将其作为模拟环境,用于开发红方攻击策略或蓝方防御策略的智能体。使用时需基于零和博弈框架定义奖励函数,确保红蓝双方的优化目标完全相反。数据的时间步记录可直接用于离线强化学习,或作为环境交互接口接入标准RL算法库(如Stable-Baselines3)。建议结合MITRE ATT&CK模型解析动作空间,以增强策略的实战可迁移性。
背景与挑战
背景概述
Network_Defense_Symmetric_Competitive数据集创建于近年来,由多智能体强化学习领域的研究人员开发,聚焦于网络攻防对抗的对称竞争场景。该数据集的核心研究问题是模拟红蓝双方在零和博弈框架下的动态策略优化,其中红方以MITRE ATT&CK框架为蓝本,旨在发现漏洞、提升权限并维持持久化,而蓝方则致力于维护系统可用性、缩小攻击面、检测恶意行为并部署蜜罐等防御措施。该数据集包含超过1亿时间步的交互数据,为网络攻防博弈提供了大规模基准,推动了多智能体强化学习在网络安全领域的应用,对自动化防御策略的评估与改进具有重要影响。
当前挑战
数据集所解决的领域问题在于网络攻防的对称竞争策略学习,传统单智能体强化学习难以捕捉双方动态博弈的复杂性,而该数据集通过纯零和竞争设计迫使红蓝双方策略同步进化,但红色方的渗透行动与蓝色方的防御响应之间存在高度非稳态性,导致训练收敛困难。构建过程中面临的挑战包括:需精确映射MITRE ATT&CK框架的战术阶段至红方动作空间,同时为蓝方设计涵盖资产恢复、诱饵部署等多维防御动作;此外,生成超1亿时间步的交互数据对计算资源与奖励函数的设计提出严峻要求,需平衡策略探索与利用的稳定性。
常用场景
经典使用场景
该数据集专为多智能体强化学习(MARL)中的对称竞争场景设计,核心任务在于模拟红蓝双方在网络防御博弈中的对抗行为。其经典使用方式是将红方作为攻击者,蓝方作为防御者,在零和博弈框架下进行交互。红方依托MITRE ATT&CK框架定义的攻击阶段,逐步探索漏洞、提升权限并维持持久化控制;蓝方则通过配置防御策略、部署蜜罐、检测异常行为等措施,维护系统可用性并驱逐入侵者。该数据集的102,400,000个时间步长提供了海量的状态-动作-奖励轨迹,为训练智能体在高度动态的网络环境中学习最优对抗策略奠定了坚实基础。
实际应用
在实际应用中,该数据集可支持企业安全运营中心(SOC)对自动化防御系统的压力测试,通过红队智能体的持续进化来检验蓝方策略的薄弱环节。同时,它为安全产品开发商提供了标准化的基准环境,用于评估入侵检测系统(IDS)和端点检测与响应(EDR)工具在对抗性场景下的性能。政府机构和军事单位还可基于此数据集构建网络靶场,训练防御人员或AI智能体实时应对模拟的国家级网络攻击,从而提升关键基础设施的整体韧性。
衍生相关工作
基于该数据集衍生的经典工作主要集中在三个方向:一是利用深度Q网络(DQN)或近端策略优化(PPO)算法训练蓝方智能体,通过自适应蜜罐部署策略诱捕红方行为,相关成果已发表于IEEE S&P会议;二是结合分层强化学习(HRL)将攻防任务分解为多粒度子目标,显著提升了红方在复杂网络拓扑中的渗透效率;三是借鉴博弈论中的纳什均衡求解方法,开发了混合策略防御模型,相关研究在NeurIPS和ICML等顶会上催生了多篇关于零和马尔可夫博弈的改进算法。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务