遇见数据集

emgena_agent_infinite_loop_killer_mcp_teaser

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

该数据集是 Agent Safety(智能体安全)领域的评估预告集,专注于解决无限规划循环与成本爆炸问题。它包含50个经过验证的场景以及一个可执行的MCP服务器,用于测试和演示智能体在运行过程中的安全性。数据集的核心功能包括:通过实时状态转换图监控检测循环规划死锁、失控工具调用递归以及预算消耗。该数据集在Cursor IDE和Claude Desktop上经过验证,具备确定性IDE防护;支持100% AST语法验证(零语法错误);并声称符合欧盟AI法案(Articles 50 & 53)及企业最终用户许可协议(EULA)。数据集规模小于1000个样本,语言为英文,许可证为Apache-2.0。

This dataset is an evaluation preview set in the field of Agent Safety, focusing on solving infinite planning loops and cost explosion problems. It contains 50 validated scenarios and an executable MCP server for testing and demonstrating the safety of agents during operation. The core functions include monitoring and detecting loop planning deadlocks, uncontrolled tool call recursion, and budget consumption through real-time state transition graphs. The dataset has been validated on Cursor IDE and Claude Desktop, with deterministic IDE protection; supports 100% AST syntax verification (zero syntax errors); and claims compliance with the EU AI Act (Articles 50 & 53) and the Enterprise End User License Agreement (EULA). The dataset size is less than 1000 samples, the language is English, and the license is Apache-2.0.

创建时间:
2026-09-22
原始信息汇总

数据集概述

基本信息

  • 数据集名称:Agent Safety - Infinite Planning Loop & Cost Explosion Terminator (Evaluation Teaser)
  • 数据集地址:https://huggingface.co/datasets/emgena/emgena_agent_infinite_loop_killer_mcp_teaser
  • 语言:英语(en)
  • 许可证:apache-2.0
  • 数据规模:n<1K
  • 标签:mcp、cursor、claude、agent-safety、sre、emgena

数据集内容

  • 类型:官方免费评估预览版(Evaluation Teaser)
  • 构成:50 个已验证场景(50 Verified Scenarios)+ 可执行 MCP 服务器(Executable MCP Server)

领域概述与安全特性

  • 功能:实时状态转移图监控器,用于检测循环规划死锁、失控的工具调用递归以及预算消耗。
  • 确定性的 IDE 内防护栏:已在 Cursor IDE 和 Claude Desktop 中验证。
  • 100% AST 语法验证:零语法错误。
  • EU AI Act 与 EULA 合规:依据第 50 条和第 53 条,已认证可用于企业部署。

相关链接

  • 完整生产包与商业 EULA(Gumroad):https://bacardy.gumroad.com/l/nudqhh
  • 优惠信息:结账时使用优惠码 LAUNCH20 可减免 €20
搜集汇总
数据集介绍
emgena_agent_infinite_loop_killer_mcp_teaser 数据集图片
构建方式
该数据集立足于智能体安全这一前沿领域,针对自主规划过程中易出现的无限循环与成本失控等失效模式,构建了一套基于实时状态转移图监测的评估框架。其构建依托于可执行的MCP服务器与五十个经严格验证的场景实例,每个场景均通过抽象语法树进行百分之百的句法校验,以确保零语法错误。数据实例源自对Cursor IDE与Claude Desktop等真实集成开发环境的系统性测试,涵盖了周期性规划死锁、工具调用递归失控及预算耗竭等典型风险模式,从而形成一份兼具确定性与可复现性的评测素材。
特点
该数据集的核心特征在于其面向智能体安全保障的专精定位。它是官方发布的免费评估预告版,包含五十个已验证场景并附带可执行的MCP服务器,规模控制在千条以下。其突出优势表现为确定性的集成开发环境内护栏机制,已在Cursor IDE与Claude Desktop中得到验证,且完全符合欧盟人工智能法案第五十条与第五十三条的企业部署要求,遵循Apache-2.0开源许可。数据集以无限规划循环与成本爆炸终结器为标识,精准聚焦于智能体运行时的状态监控与风险抑制。
使用方法
使用者可将该数据集作为智能体安全评估的入门级基准,借助附带的MCP服务器在Cursor IDE或Claude Desktop中直接运行五十个验证场景,以检验智能体规划模块对循环死锁及递归失控的抵御能力。评估过程中,实时状态转移图监测器将记录规划路径与工具调用序列,辅助识别潜在的预算耗竭风险。该预告版适用于初步验证与演示目的,完整的生产级包及商业最终用户许可协议需通过Gumroad平台获取,结账时可使用优惠码LAUNCH20享受折扣。
背景与挑战
背景概述
随着基于大语言模型的自主智能体在复杂任务规划与工具调用中的广泛应用,其规划循环失控与调用成本爆炸问题日益凸显,成为制约智能体安全部署的关键瓶颈。在此背景下,emgena_agent_infinite_loop_killer_mcp_teaser数据集于2025年发布,由EMGENA团队构建,旨在为实时检测智能体无限规划循环与资源耗尽风险提供标准化评估基准。该数据集聚焦于状态转移图监控与递归调用死锁识别,其核心研究问题在于如何以确定性护栏机制阻断智能体在Cursor IDE与Claude Desktop等环境中的非预期循环行为。该工作为智能体安全领域提供了早期可执行评测资源,对推动AI系统合规与成本控制具有参考价值。
当前挑战
该数据集所应对的领域问题在于,自主智能体在开放工具调用环境中极易陷入循环规划与递归调用,导致运算资源枯竭与部署成本失控,而现有安全机制缺乏对状态转移路径的细粒度实时监控能力。构建过程中面临的核心挑战包括:如何生成并验证覆盖多类循环模式的确定性场景,确保50个场景均能触发可复现的异常状态;如何在不依赖具体模型内部实现的前提下,设计通用且可执行的MCP服务器以支撑跨IDE与桌面客户端的护栏验证;以及如何满足欧盟AI法案第50条与第53条关于透明性与风险管理的合规要求,同时维持对AST语法零错误的严格约束。
常用场景
经典使用场景
在自主智能体系统的运行监测领域,该数据集充当实时状态转移图监视器的评测基准,通过五十个经严格校验的场景,系统性地呈现智能体在规划推理过程中陷入循环性死锁、工具调用递归失控以及预算急剧消耗等典型失效模式。其经典用法在于让受测的智能体框架在Cursor IDE与Claude Desktop环境中执行这些预置场景,借助确定性内嵌式护栏对状态转移路径进行逐节点比对,从而判定规划链路是否存在无法收敛的闭环,并量化每次工具调用所引发的成本累积曲线。
衍生相关工作
围绕该数据集衍生的经典工作主要体现为可执行MCP服务器的配套实现,即将状态转移图监视逻辑封装为符合模型上下文协议的服务组件,供不同智能体框架直接调用。此外,其完整生产包与商业许可催生了一系列面向智能体安全护栏的工程化实践,包括抽象语法树层面的百分之百语法校验模块,以及针对预算骤增的熔断策略。这些衍生成果共同构成了从评测语料到可部署防护组件的转化链路,推动了智能体安全领域的工具化进程。
数据集最近研究
最新研究方向
针对自主智能体在复杂任务规划中陷入无限循环与资源耗尽的风险,该数据集聚焦于实时状态转移图监控与确定性防护机制的前沿探索。基于MCP协议与Cursor、Claude等开发环境的实证验证,研究致力于在IDE内嵌层面拦截循环规划死锁与递归工具调用,以AST句法验证保障零语法错误,并契合欧盟人工智能法案合规要求。这一方向为智能体安全部署提供了可执行评估基准,推动了企业级护栏技术的标准化与成本控制策略的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务