遇见数据集

Network_Defense_Symmetric_Competitive

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

该数据集是一个专注于多智能体强化学习(MARL)的模拟环境,包含102,400,000个时间步。数据集模拟了网络安全领域的红蓝对抗场景:红方智能体扮演攻击者,其目标遵循MITRE ATT&CK框架,包括发现漏洞、提升权限、破坏资产和维持持久性;蓝方智能体扮演防御者,其目标包括维护系统可用性、减少攻击面、检测恶意行为、使用蜜罐欺骗攻击者以及驱逐入侵者,行动空间涉及防御配置和缓解步骤。红蓝双方为零和对抗关系,即一方的收益完全等于另一方的损失。该数据集适用于训练和评估网络安全领域的多智能体强化学习算法,特别侧重于攻击与防御的动态博弈。

This dataset is a simulation environment focused on multi-agent reinforcement learning (MARL), containing 102,400,000 timesteps. It simulates a red team-blue team adversarial scenario in the cybersecurity domain: the red agents act as attackers with objectives aligned with the MITRE ATT&CK framework, including discovering vulnerabilities, escalating privileges, compromising assets, and maintaining persistence; the blue agents act as defenders with objectives such as maintaining system availability, reducing attack surfaces, detecting malicious behavior, using honeypots to deceive attackers, and expelling intruders, with action spaces involving defense configurations and mitigation steps. The red and blue teams are in a zero-sum adversarial relationship, meaning one sides gain equals the others loss. The dataset is suitable for training and evaluating MARL algorithms in cybersecurity, with a particular focus on the dynamic game of attack and defense.

创建时间:
2026-07-15
原始信息汇总

数据集概述:Network Defense Symmetric Competitive

  • 数据集名称:Network Defense Symmetric Competitive
  • 托管平台:Hugging Face
  • 数据集规模:约 102,400,000 时间步(属于 100M < n < 1B 规模类别)
  • 语言:英语(en)
  • 许可证:MIT

核心内容

  • 任务类型:多智能体强化学习(Multi-Agent Reinforcement Learning)

  • 场景设定:红蓝对抗的纯零和博弈(Pure Zero-Sum Opposition)

    • 红方(Red Agent):目标是发现系统漏洞、提升权限、破坏资产并维持持久化控制。其动作空间可参照 MITRE ATT&CK 框架的各阶段建模。
    • 蓝方(Blue Agent):目标是维护系统可用性、减小攻击面、检测恶意行为、利用蜜罐欺骗攻击者并驱逐入侵者。其动作空间包含防御配置和缓解措施。
  • 博弈性质:红方的收益即为蓝方的绝对损失,反之亦然,构成完全对称的零和竞争关系。

相关资源

搜集汇总
数据集介绍
Network_Defense_Symmetric_Competitive 数据集图片
构建方式
该数据集基于多智能体强化学习框架构建,模拟了网络攻防对抗场景,包含1.024亿时间步长的交互数据。红方智能体以发现漏洞、提升权限、破坏资产并维持持久化控制为目标,其动作空间参照MITRE ATT&CK框架的各阶段设计;蓝方智能体则致力于维护系统可用性、缩小攻击面、检测恶意行为、利用蜜罐欺骗攻击者并驱逐入侵者,其动作空间涵盖防御配置与缓解措施。数据集通过纯零和对抗机制生成,即红方收益即为蓝方绝对损失,确保了对抗过程的强竞争性与平衡性。
特点
该数据集的核心特点在于其纯零和对称对抗设计,红蓝双方的博弈完全对立,奖励机制严格对称,使得每一方的策略优化都直接以削弱对方为代价。动作空间基于权威攻防框架构建,红方动作覆盖攻击链全阶段,蓝方则对应系统性防御策略,体现了真实网络攻防的复杂性与层次性。同时,数据集规模庞大,超过1亿时间步长的交互数据为训练鲁棒的防御智能体提供了充足样本,支持深度强化学习算法的有效收敛。
使用方法
该数据集适用于多智能体强化学习研究,特别是网络防御场景下的对抗策略学习。用户可将数据作为环境交互记录,用于训练蓝方智能体的防御决策模型,或评估红方攻击策略的效能。数据集以时间步长为单位,可直接用于离线强化学习或模仿学习算法。此外,研究者可基于其零和博弈特性,开展纳什均衡求解、对手建模或合作-对抗混合策略的探索,数据集提供的标准化攻防动作空间也便于与其他网络攻防仿真平台进行比对验证。
背景与挑战
背景概述
该数据集由研究机构于近期创建,聚焦于多智能体强化学习在网络安全防御领域的应用,核心研究问题在于模拟红蓝对抗中的零和博弈场景。其中,红方智能体以发现漏洞、提升权限、窃取资产并维持持久化为目标,其动作空间基于MITRE ATT&CK框架建模;蓝方智能体则致力于维护系统可用性、缩小攻击面、检测恶意行为、利用蜜罐欺骗攻击者并驱逐入侵者,动作空间涵盖防御配置与缓解措施。该数据集通过1.024亿时间步的仿真数据,为网络攻防策略的优化提供了标准化训练环境,对推动自主防御系统研究具有显著影响力。
当前挑战
该数据集面临的挑战包括领域问题与构建过程两方面。在领域层面,网络攻防的零和博弈本质要求防御策略在动态对抗中具备高鲁棒性,然而现有算法难以同时应对攻击者的持久化隐蔽行为与系统的实时响应需求,且蜜罐等欺骗技术的有效性评估缺乏统一基准。在构建层面,如何设计平衡红蓝双方能力差异的动作空间以维持博弈公平性,以及如何高效生成涵盖复杂攻击链的百万级时间步数据,均对仿真环境的建模精度与计算资源提出了严苛要求。
常用场景
经典使用场景
该数据集专为多智能体强化学习(MARL)设计,模拟红蓝双方在网络防御中的对称对抗博弈。红方智能体以MITRE ATT&CK框架为蓝本,探索漏洞、提升权限并维持持久化;蓝方则致力于系统可用性维护、攻击面缩减、恶意行为检测及蜜罐诱捕。这一纯零和竞争场景为训练和评估攻防决策算法提供了标准化环境,是网络对抗智能体研究的经典基准。
实际应用
在现实网络运维中,该数据集可用于训练自动化蓝队防御系统,例如企业内网的安全编排自动化与响应(SOAR)平台。蓝方智能体通过模拟对抗学习实时配置防火墙规则、部署蜜罐或隔离染毒节点,显著提升应急响应效率。红方智能体则作为渗透测试辅助工具,帮助安全团队发现防御体系盲区,实现动态防御策略优化。
衍生相关工作
该数据集催生了多类经典后续工作。基于其框架,研究者发展了层次化注意力网络(HAN)用于异常流量检测,以及双阶段信用分配算法解决稀疏奖励问题。在模型迁移方面,衍生出元强化学习模型以应对异构网络拓扑,还有深度集成防御策略库供蓝方智能体动态组合。这些工作共同推动了网络对抗智能体鲁棒性和泛化能力的边界拓展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务