遇见数据集

omnimcp_cyber_token_revocation_teaser

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

OmniMCP - Cyber Token Revocation (Free Teaser Edition) 是一个免费预告版的多轮智能体函数调用数据集,专门用于网络令牌撤销(Cyber Token Revocation)场景。该数据集属于OmniMCP模块化生态系统中的砖块(Brick)级别,旨在训练AI模型执行自动化的IAM(身份与访问管理)密钥失效操作。数据集为合成数据,包含小于1000个样本,所有样本均经过Pydantic AST验证,确保零语法错误,并内置了逐步的思维链推理(Chain-of-Thought)逻辑,涵盖生产环境中的真实API故障、连接池超时和错误恢复场景。数据内容完全符合GDPR/DSGVO隐私法规,不含任何个人数据。数据格式为Parquet,包含 instruction、thought_process、final_output 等字段,可直接使用Python Pandas加载。该版本采用Apache 2.0许可证,适用于免费的研究和评估。

OmniMCP - Cyber Token Revocation (Free Teaser Edition) is a free teaser multi-turn agent function calling dataset specifically designed for Cyber Token Revocation scenarios. It belongs to the Brick level of the OmniMCP modular ecosystem, aiming to train AI models for automated IAM (Identity and Access Management) key revocation operations. The dataset is synthetic, containing less than 1000 samples, all validated by Pydantic AST to ensure zero syntax errors, and includes built-in step-by-step Chain-of-Thought reasoning covering real-world API failures, connection pool timeouts, and error recovery scenarios. The data fully complies with GDPR/DSGVO privacy regulations and contains no personal data. It is in Parquet format with fields such as instruction, thought_process, and final_output, and can be loaded directly with Python Pandas. This version is released under the Apache 2.0 license for free research and evaluation.

创建时间:
2026-08-31
原始信息汇总

数据集概述

OmniMCP: Cyber Token Revocation (Free Teaser Edition) 是一个专注于网络安全领域中**令牌撤销(Token Revocation)**场景的免费评估数据集,属于 OmniMCP 模块化生态系统的组成部分。


基本信息

属性 内容
数据集名称 OmniMCP - Cyber Token Revocation (Free Teaser Edition)
语言 英语(en)
许可证 Apache 2.0
数据集大小 n<1K(少于1000条样本)
适用任务 函数调用(Function Calling)、工具使用(Tool Use)、智能体微调(Fine-tuning)、多轮对话(Multi-turn)
标签 cyber_token_revocation、synthetic-data、agentic-ai、unsloth、axolotl、ollama 等

内容简介

该数据集为合成数据,聚焦于**自动化的 IAM 密钥失效(Automated IAM Secret Invalidation)**场景,旨在帮助开发者对智能体模型进行微调,使其能够在检测到安全威胁时自动执行令牌/凭证撤销操作。

数据集中的样本包含:

  • instruction(指令)
  • thought_process(思维过程)
  • final_output(最终输出)

数据集特色(USP)

  • 零语法与解析错误:所有数据均经过 100% Pydantic AST 验证,严格遵守 OpenAPI 架构。
  • 原生思维链推理:在每次工具调用前均包含<thought>块,提供逐步诊断逻辑。
  • 生产级自愈能力:预训练数据覆盖真实的 API 故障、连接池超时和错误恢复场景,而非简单的成功路径。
  • 100% GDPR/DSGVO 合规:不含任何个人数据。
  • 符合欧盟 AI 法案:附带第 50 条和第 53 条的合成数据来源声明。

快速加载示例

python import pandas as pd

加载 Parquet 格式的验证数据集

df = pd.read_parquet("omnimcp_cyber_token_revocation_teaser.parquet") print(f"Loaded {len(df)} verified training turns!") print(df[["instruction", "thought_process", "final_output"]].head())


商业与授权信息

  • 本 Teaser 版本:以 Apache 2.0 许可证免费发布,可用于研究与评估。
  • 完整生产版与 Village 级别产品:需通过 OmniMCP Enterprise Commercial EULA 获取商业授权,支持完整的商业变现与模型部署权利。
  • 完整版及相关模块可通过 Gumroad 商店 购买,包括 CyberDefense Token Revocation Brick(99 €)等产品。
搜集汇总
数据集介绍
omnimcp_cyber_token_revocation_teaser 数据集图片
构建方式
面向网络安全的令牌吊销与IAM密钥失效场景,该数据集采用受控合成范式构建。通过模拟真实企业身份认证基础设施的异常事件链,以Pydantic模型对多轮函数调用轨迹执行AST级语法与模式校验,确保每一条工具调用指令均与严格OpenAPI架构吻合。生成过程嵌入逐步诊断逻辑,在<thought>区块中保留推理路径,并引入连接池超时、API失败等故障注入,使样本覆盖从告警触发到密钥失效的完整运维闭环,最终形成经0.0%解析错误验证的少样本评估型数据。
特点
该数据集以多轮代理式函数调用为核心特征,原生集成思维链推理,在每次工具调用前提供逐步诊断依据。其突出优势在于生产级自愈训练信号,涵盖真实API失败与超时恢复路径,而非单层理想化调用。数据全面遵循GDPR/DSGVO要求,采用RFC 2606及RFC 5737保留域名与文档IP,杜绝个人数据。同时附带欧盟AI法案第50与53条合成来源声明,具备企业级合规与商业部署就绪性,且规模精炼,适合作为免费评估样本。
使用方法
使用者可通过Python生态直接加载Parquet格式文件,利用pandas读取并检视指令、思维过程与最终输出字段。该数据集适配Unsloth、Axolotl、Ollama等微调与推理框架,可作为多轮工具调用代理的监督微调语料。在安全运营自动化场景中,加载后的样本可用于训练令牌吊销决策模型,通过思维链字段监督推理路径,并以最终输出字段对齐工具调用API。研究者亦可将其作为评估基准,检验代理在故障恢复与合规约束下的函数调用准确性。
背景与挑战
背景概述
在自主智能体与工具调用(Tool-Use)范式迅速演进的背景下,评估大语言模型在多轮交互中执行安全敏感操作的能力成为一项关键课题。OmniMCP - Cyber Token Revocation(Free Teaser Edition)由OmniMCP项目团队构建,属于其模块化企业级AI数据集生态中的网络安全专精模块,核心聚焦于自动化IAM密钥失效与凭证撤销这一典型安全运维场景。该数据集以经过Pydantic AST严格校验的多轮函数调用样本,为智能体在真实API故障、超时与错误恢复情境下的微调与评测提供了高保真合成语料,对推动Agentic AI在安全运营中心(SOC)中的可信落地具有参考价值。
当前挑战
凭证撤销作为网络安全领域的高危操作,其核心难题在于智能体须在动态权限边界与最小权限原则约束下,准确判断何时、对哪些主体执行令牌失效,任何误判都可能引发服务中断或安全缺口。构建过程中面临多重挑战:真实IAM系统的调用日志因涉密而难以获取,需依赖合成数据还原多轮工具交互的因果链;撤销操作往往跨越多个API与状态机,样本须保持严格的模式一致性与零语法错误,同时避免引入个人数据以满足GDPR及EU AI Act的合规要求;此外,如何让模型在故障注入与超时恢复等非理想路径中习得稳健的决策逻辑,而非仅拟合理想化的顺利流程,构成该数据集在可信度与泛化性上的持续挑战。
常用场景
经典使用场景
在网络安全运维与身份治理领域,自动化令牌撤销是SOAR平台和智能代理的关键能力。该数据集以多轮函数调用范式,模拟安全分析师在检测到凭据泄露、异常登录或横向移动迹象后,通过对话式代理调用IAM接口批量失效API密钥、会话令牌与OAuth授权的完整流程。每一轮交互都包含思维链推理与结构化工具调用,使模型学会在真实攻击压力下权衡最小权限原则与业务连续性,成为训练网络安全代理的经典语料。
衍生相关工作
该数据集作为OmniMCP模块化生态中的CyberDefense砖块,其衍生工作涵盖多个方向。基于相同架构,研究者扩展出DDoS缓解、零日隔离与SIEM告警分诊等兄弟数据集,形成完整的自主网络防御村庄。在方法层面,它启发了将LangGraph状态机与自愈代理结合的工具调用框架,以及面向令牌预算的看门狗机制。这些工作共同推动了代理在安全运营中的可组合性与生产级部署能力。
数据集最近研究
最新研究方向
在代理式人工智能与函数调用技术迅猛演进的背景下,面向身份与访问管理的安全自动化正成为垂域大模型微调的前沿阵地。该数据集聚焦网络令牌吊销这一零信任架构中的关键环节,以多轮对话形式构建包含思维链推理的高质量合成样本,推动模型从被动响应向主动诊断与自动处置演进。伴随IAM泄露事件频发及MCP协议生态的兴起,此类数据为智能体在CyberDefense场景下的工具编排与自愈能力提供了可验证的评测基准,对提升企业安全运营的自动化闭环水平及合成数据在合规审计中的可信应用具有示范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务