遇见数据集

omnimcp_cyber_ddos_mitigation_teaser

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

OmniMCP: Cyber DDoS Mitigation (Free Teaser Edition) 是一个免费评估版的多轮代理函数调用数据集,专为网络分布式拒绝服务(DDoS)缓解场景设计。该数据集由精心构造的合成样本组成,涵盖 SYN 洪水 PCAP 分析、Flowspec 规则等主题,旨在训练具备工具使用和函数调用能力的智能体。数据集特点包括:100% 经过 Pydantic AST 验证,无语法错误;每一步工具调用前包含原生思维链推理(<thought> 块);模拟真实 API 故障与自愈恢复;完全不含个人数据,符合 GDPR 要求。数据规模小于1000样本,语言为英文,采用 Apache 2.0 许可证。数据集包含 instruction、thought_process、final_output 等字段,可通过 Python 使用 pandas 加载 Parquet 格式文件。该免费版本可用于研究评估,完整生产版需购买商业许可。

OmniMCP: Cyber DDoS Mitigation (Free Teaser Edition) is a free evaluation version of a multi-turn agent function calling dataset, designed for network Distributed Denial of Service (DDoS) mitigation scenarios. The dataset consists of carefully constructed synthetic samples covering topics such as SYN flood PCAP analysis and Flowspec rules, aiming to train agents with tool use and function calling capabilities. Features include: 100% validated by Pydantic AST, no syntax errors; native chain-of-thought reasoning (<thought> blocks) before each tool call; simulation of real API failures and self-healing recovery; completely free of personal data, GDPR compliant. Dataset size is less than 1000 samples, language is English, licensed under Apache 2.0. The dataset includes fields such as instruction, thought_process, final_output, and can be loaded using Python with pandas from Parquet files. This free version is for research evaluation; the full production version requires a commercial license.

创建时间:
2026-08-31
原始信息汇总

数据集概述

OmniMCP - Cyber Ddos Mitigation (Free Teaser Edition) 是一个免费的评估版数据集,专注于网络分布式拒绝服务(DDoS)攻击缓解场景下的多轮智能体函数调用(Multi-Turn Agent Function-Calling)训练任务。

基本信息

属性 内容
语言 英语 (en)
许可证 Apache 2.0
标签 cyber_ddos_mitigation、synthetic-data、function-calling、tool-use、fine-tuning、agentic-ai、multi-turn
数据集规模 n<1K(少于1000条样本)

内容与特点

  • 每个样本包含 instructionthought_processfinal_output 三个核心字段。
  • 本数据集定位为 OmniMCP 模块化生态系统 中的“砖块”(Brick)层级产品,面向 DDoS 防御的单一问题求解。
  • 核心场景涵盖 SYN-Flood PCAP 分析Flowspec 规则生成 等 DDoS 缓解技术。
  • 所有数据均为合成数据,通过严格的 OpenAPI 模式验证,保证 0.0% 语法与解析错误
  • 在每次工具调用前提供原生思维链(Chain-of-Thought)推理步骤。
  • 训练样本包含真实 API 故障、连接池超时和错误恢复场景,而非简单的理想路径。
  • 数据完全符合 GDPR / DSGVO 规范,不含任何个人数据(使用 RFC 2606 与 RFC 5737 文档化占位地址)。
  • 附带欧盟 EU AI Act 第 50 条与第 53 条 的合成数据来源声明。

用途与加载方式

该免费评估版数据集适用于研究及模型评估场景,可通过 Parquet 文件加载使用:

python import pandas as pd

df = pd.read_parquet("omnimcp_cyber_ddos_mitigation_teaser.parquet") print(f"Loaded {len(df)} verified training turns!") print(df[["instruction", "thought_process", "final_output"]].head())

许可说明

  • 免费评估版:采用 Apache 2.0 许可证,面向研究与评估免费开放。
  • 完整商业包:覆盖 OmniMCP 企业商业 EULA,包含完整的商业变现与模型部署授权,通过外部商店获取。
搜集汇总
数据集介绍
omnimcp_cyber_ddos_mitigation_teaser 数据集图片
构建方式
在网络安全领域,针对分布式拒绝服务(DDoS)攻击的自动化缓解需要融合协议解析、流量特征识别与实时策略生成。该数据集采用合成数据生成策略,以多轮代理函数调用为框架,模拟DDoS缓解场景中的诊断与响应流程。每条样本经由Pydantic AST校验,确保与OpenAPI模式严格对齐,并通过<thought>块注入逐步推理逻辑,使工具调用前具备可解释的决策链条。数据生成过程中排除真实个人数据,使用RFC 2606及RFC 5737规定的保留域名与文档IP,满足欧盟《通用数据保护条例》合规要求。
特点
该数据集呈现四大核心特征:其一,语法与解析错误率极低,所有函数调用均通过Pydantic抽象语法树验证,显著优于公开网络抓取数据集;其二,原生支持链式思维推理,每次工具调用前均包含结构化诊断逻辑;其三,预置生产环境自愈模式,涵盖API故障、连接池超时及错误恢复路径,而非仅限理想化场景;其四,数据来源完全去标识化,且附带欧盟《人工智能法案》第50条与第53条要求的合成数据溯源声明,具备商业部署合规基础。
使用方法
该数据集以Parquet格式分发,可直接通过Pandas等数据分析工具加载。典型使用流程为读取Parquet文件后,访问instruction、thought_process与final_output等字段,用于监督微调或评估面向DDoS缓解的代理函数调用能力。该免费预览版遵循Apache 2.0许可证,适用于研究与评估目的。若需投入商业部署或获取完整生产级套件,用户需通过Gumroad平台获取涵盖企业级最终用户许可协议的全量数据包,其中包含跨域多轮场景与完整商业授权。
背景与挑战
背景概述
分布式拒绝服务(DDoS)攻击持续威胁全球网络基础设施的可用性与安全性,传统防护策略依赖静态阈值和人工规则,难以应对大规模、多向量、动态演化的攻击流量。omnimcp_cyber_ddos_mitigation_teaser数据集于2024年前后由OmniMCP项目团队构建,作为模块化企业AI体系中的“砖块”级资源,聚焦于基于函数调用的多轮智能体训练,旨在使语言模型能够自主执行SYN泛洪PCAP分析、Flowspec规则生成等DDoS缓解任务。该数据集以合成数据方式规避隐私风险,为网络防御领域的智能体研发提供了可复用的微调基准,推动了自动化安全运营中心(SOC)向认知智能方向演进。
当前挑战
该数据集所应对的核心领域挑战在于:DDoS攻击的瞬时性、多态性与对抗性要求模型在秒级时间内完成流量特征解析、攻击类型判别与缓解策略生成,而传统监督学习范式缺乏对工具调用链与诊断推理过程的建模能力。构建过程中面临的难题包括:合成多轮对话需严格保证工具调用语法与OpenAPI模式的一致性,同时注入真实生产环境中的连接超时、API失败等异常状态以支持自愈训练;此外,须确保零个人数据泄露并符合GDPR及欧盟AI法案的合成数据溯源要求。如何在极少量样本下维持思维链推理的严谨性与函数调用的零语法错误率,仍是该数据集面向实际部署的主要挑战。
常用场景
经典使用场景
在自动化网络安全防御的学术探索与工程实践中,该数据集最经典的应用场景聚焦于训练和微调具备多轮工具调用能力的智能体,用以模拟和执行DDoS攻击缓解的完整决策链条。借助其中蕴含的SYN-Flood数据包捕获分析、动态Flowspec规则下发以及流量清洗策略编排等多轮交互样本,研究者能够构建端到端的攻防演练环境,使智能体在每一步工具调用前生成可解释的思维链推理,并在复杂网络对抗中习得从异常检测到策略响应的连贯操作序列。
解决学术问题
该数据集直击传统网络安全研究中高质量标注数据匮乏、多轮工具调用轨迹难以规模化获取的痛点,为基于函数调用的大模型智能体研究提供了结构严谨、语法零错误的训练素材。它有效缓解了学术文献中攻防决策过程难以被细粒度监督的问题,使得DDoS缓解策略的自动化推理与执行能够被可复现地评估。其影响在于推动网络防御研究从静态规则匹配向动态、可解释的智能体决策范式转变,并为后续多部门企业级AI层级架构的研究奠定 bricks 级别的标准化基础。
衍生相关工作
围绕该数据集,衍生出一系列紧密关联的经典工作,构成了OmniMCP模块化生态中网络安全方向的核心支柱。基于其数据范式,进一步拓展出面向零日攻击隔离的自主主机网络隔离模型、针对IAM密钥泄漏的自动化令牌吊销智能体、以及用于告警降噪和日志关联的SIEM分诊系统。这些工作协同演进为更完整的自主网络防御村庄,并与AgentOps运行时自愈、Token预算看门狗等组件深度集成,形成了从单一brick到多部门联动的企业级AI安全运营研究谱系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务