遇见数据集

omnimcp_cyber_siem_triage_teaser

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

OmniMCP: Cyber Siem Triage (Free Teaser Edition) 是一个经过验证的多轮代理函数调用数据集,专注于网络安全SIEM(安全信息和事件管理)分类任务。该数据集由合成数据构成,规模小于1000个样本,语言为英语,采用Apache 2.0许可证。每个样本包含三个字段:instruction(指令)、thought_process(思维链推理过程,包含在<thought>块中)、final_output(最终输出)。数据集的核心特点包括:0%语法和解析错误(所有数据均通过Pydantic AST严格验证,符合OpenAPI模式)、原生链式思维推理、针对生产环境中的真实API故障和恢复进行预训练,以及完全符合GDPR/DSGVO隐私要求(无任何个人数据)。该数据集适用于微调基于代理的AI模型,用于网络安全告警分类、日志关联和威胁检测等任务。作为免费评估版,它为用户提供了体验完整OmniMCP模块化生态系统的入口。

OmniMCP: Cyber Siem Triage (Free Teaser Edition) is a validated multi-turn agentic function calling dataset focused on cybersecurity SIEM (Security Information and Event Management) triage tasks. It is composed of synthetic data, with a size less than 1000 samples, in English language, under Apache 2.0 license. Each sample contains three fields: instruction, thought_process (chain-of-thought reasoning enclosed in <thought> blocks), and final_output. Key features: 0% syntax and parsing errors (all data strictly validated via Pydantic AST against OpenAPI schema), native chain-of-thought reasoning, pre-trained on real-world API failures and recoveries in production, and fully compliant with GDPR/DSGVO privacy requirements (no personal data). The dataset is suitable for fine-tuning agent-based AI models for cybersecurity alert triage, log correlation, and threat detection. As a free teaser edition, it provides users with an entry point to experience the full OmniMCP modular ecosystem.

创建时间:
2026-08-31
原始信息汇总

OmniMCP: Cyber Siem Triage (Free Teaser Edition) 数据集概述

基本信息

  • 数据集名称: OmniMCP - Cyber Siem Triage (Free Teaser Edition)
  • 语言: 英语 (en)
  • 许可证: Apache-2.0
  • 数据集规模: 小于1K条样本 (n<1K)
  • 数据类型: 合成数据 (Synthetic Data)
  • 标签: cyber_siem_triage, function-calling, tool-use, agentic-ai, multi-turn, fine-tuning, unsloth, axolotl, ollama

内容简介

这是一个用于**网络安全SIEM分诊(Security Information and Event Management Triage)**场景的、经过验证的多轮智能体函数调用(Function-Calling)数据集。该数据集为免费评估预览版(Teaser),用于训练或微调AI模型在多轮对话中执行网络安全告警分诊、日志关联等任务。

数据集特点 (USP)

  • 零语法与解析错误: 100%通过Pydantic AST校验,符合严格的OpenAPI规范。
  • 原生思维链推理: 每次工具调用前均包含<thought>块中的逐步诊断逻辑。
  • 生产级自愈能力: 覆盖真实的API故障、连接池超时及错误恢复场景,而非简单的理想路径。
  • 数据合规性: 100%符合GDPR/DSGVO要求,不含任何个人数据(使用RFC 2606的示例邮箱与RFC 5737的文档IP)。
  • 欧盟AI法案就绪: 包含符合欧盟AI法案第50条和第53条的合成数据来源声明。

数据加载示例

使用Python的pandas库可直接加载Parquet文件: python import pandas as pd df = pd.read_parquet("omnimcp_cyber_siem_triage_teaser.parquet") print(df[["instruction", "thought_process", "final_output"]].head())

数据字段包括:instruction(指令)、thought_process(思维过程)、final_output(最终输出)。

所属生态系统

该数据集是OmniMCP模块化生态系统的一部分,属于四层架构中的Level 1 (The Brick) 层级中的网络安全防御SIEM分诊模块。其完整商业版本(CyberDefense SIEM Triage)可在Gumroad平台以99欧元购买,涵盖告警噪声抑制、日志关联等更多专业场景。

许可与商业权利

  • 免费预览版 (Teaser): 基于Apache 2.0许可证发布,可免费用于研究与评估。
  • 完整生产包及更高层级产品: 受OmniMCP企业商业EULA保护,包含完整的商业盈利与模型部署权利,需通过Gumroad购买。
搜集汇总
数据集介绍
omnimcp_cyber_siem_triage_teaser 数据集图片
构建方式
在网络安全运营领域,SIEM告警分诊长期受困于噪声泛滥与误报频仍,合成数据集的构建因而成为提升智能体实战能力的关键路径。该数据集以模块化企业AI层级中的“砖块”定位为基准,围绕CyberDefense SIEM Triage场景,通过模拟多轮工具调用与函数调用轨迹,生成具备链式推理特征的训练样本。构建过程严格遵循Pydantic AST校验与OpenAPI模式约束,将告警噪声抑制、日志关联等任务分解为可验证的指令-思维-输出三元组。全部样本经RFC 2606与RFC 5737规范脱敏,确保零个人数据泄露,并附带欧盟AI法案第50条与第53条合成数据溯源声明,形成从架构设计到合规审计的完整构建链条。
特点
该数据集的核心特质在于其原生链式思维推理与生产级自愈能力的深度融合。每一轮工具调用前均嵌入<thought>诊断逻辑块,使模型在分诊决策中呈现可解释的步骤化推理,而非黑箱式响应。相较于通用公开数据集中常见的语法与解析错误,该数据集宣称实现0.0%的语法与解析失败率,得益于对严格OpenAPI模式的AST级验证。其合成样本覆盖真实API故障、连接池超时及错误恢复路径,超越理想化成功场景,赋予模型应对非预期状态的自愈韧性。此外,数据集以Apache 2.0许可发布,体量精简,适合快速评估与微调,同时保持与完整生产套件一致的模块化基因。
使用方法
研究人员与开发者可通过Python生态中的pandas库直接加载Parquet格式的验证样本,调用read_parquet接口即可获得包含指令、思维过程与最终输出的结构化数据框,进而用于监督微调或智能体行为评估。该数据集兼容Unsloth、Axolotl及Ollama等主流微调与推理框架,便于在本地或云端环境快速开展函数调用与工具使用实验。加载后,用户可借助head方法预览字段分布,并依据instruction、thought_process与final_output的对应关系构建多轮对话训练样本。需注意,该免费预告版仅限研究与评估用途,商业部署与模型 monetization 权利须依据OmniMCP企业商业EULA另行获取。
背景与挑战
背景概述
在网络安全运营领域,安全信息和事件管理(SIEM)系统产生的海量告警长期困扰着安全分析师,告警疲劳与误报泛滥导致真实威胁被淹没。为应对这一痛点,OmniMCP项目推出了面向网络安全SIEM分类的合成数据集,作为其模块化企业级AI生态中的评估性资源。该数据集以多轮代理函数调用为核心范式,将思维链推理与工具调用紧密结合,旨在训练能够自主完成告警降噪、日志关联与事件分类的智能体。其免费预览版遵循Apache 2.0协议,为研究人员提供了经Pydantic严格校验的高质量样本,推动了代理式AI在安全运营场景中的可复现研究。
当前挑战
该数据集所应对的领域问题在于SIEM告警分类的自动化,即在噪声极高的安全日志中准确识别真实威胁并执行恰当的响应动作,这要求模型具备跨轮次上下文理解与动态工具调用能力。构建过程中的挑战则更为严峻:如何生成既符合真实攻击模式又完全规避个人数据的合成样本,如何确保每一次函数调用都通过OpenAPI模式校验而杜绝语法错误,以及如何在多轮对话中维持思维链推理的逻辑连贯性,都是数据集设计者必须攻克的难题。此外,模拟API失败与连接超时等生产级异常,同时保持样本的多样性与分布平衡,进一步加剧了构建的复杂度。
常用场景
经典使用场景
在网络安全运营领域,安全信息与事件管理(SIEM)系统每日产生海量告警,安全分析师需从中甄别真实威胁。该数据集精准定位于多轮代理函数调用场景,模拟安全分析师与AI代理协同完成告警分诊的完整流程。每一轮交互均要求模型在<thought>区块内生成链式推理,随后以结构化函数调用形式执行日志关联、告警抑制或升级操作,从而训练代理在复杂安全事件中自主决策的能力。
衍生相关工作
作为OmniMCP模块化生态中的CyberDefense SIEM Triage砖块,该数据集衍生出恶意软件沙箱分析、零日主机隔离、IAM令牌吊销及DDoS缓解等一系列安全专用微调数据集。这些衍生工作共同构成自主网络防御村庄,并与LangGraph状态机、Agent自我修复等砖块协同,推动了多代理安全编排与自愈式安全运营架构的经典研究。
数据集最近研究
最新研究方向
在网络安全运营中心(SOC)智能化转型的浪潮中,SIEM告警分流正从传统规则驱动向基于大语言模型的自主智能体范式跃迁。该数据集聚焦多轮函数调用与工具编排,支撑智能体在告警降噪、日志关联及威胁研判等任务中的链式推理与自适应决策。当前研究前沿着力于将思维链推理嵌入工具调用流程,使模型在真实API故障、连接超时等非理想条件下具备自愈能力,并探索多智能体协同的分布式安全编排架构。伴随欧盟AI法案对合成数据透明度与合规性提出明确要求,此类经模式验证、零个人数据污染的高质量合成语料,正成为推动安全大模型从实验走向生产部署的关键基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务