AgentTrap
收藏资源简介:
AgentTrap是一个动态基准测试,用于评估LLM代理在使用第三方技能时是否能抵抗恶意运行时行为。它包含141个可执行任务:91个恶意任务和50个良性实用任务,涵盖16个安全影响维度、10种运行时攻击方法和7个普通代理任务类别。基准测试记录完整轨迹、工具效果、生成工件、模拟网络观察和判断证据,以便分别分析攻击成功、阻止、攻击未触发和良性过度防御等情况。
AgentTrap is a dynamic benchmark designed to evaluate whether LLM agents can resist malicious runtime behaviors when leveraging third-party skills. It consists of 141 executable tasks: 91 malicious tasks and 50 benign utility tasks, covering 16 security impact dimensions, 10 runtime attack methods, and 7 general agent task categories. The benchmark records full trajectories, tool execution effects, generated artifacts, simulated network observations, and judgmental evidence, enabling separate analysis of scenarios including successful attacks, blocked attacks, non-triggered attacks, and benign over-defenses.
AgentTrap 数据集概述
AgentTrap 是一个用于评估大语言模型代理在第三方技能中抵抗恶意运行时行为能力的动态基准测试工具。
核心功能
- 测试代理在安装和使用第三方技能时,是否会将不安全工作流步骤视为可信的执行指令。
- 评估覆盖通过 SKILL.md、帮助脚本、生成产物、标准输出、服务配置、MCP 风格流程、浏览器/会话状态、本地指令文件、记忆和跨轮次工作区状态等多种方式发起的攻击。
数据集规模与组成
- 总计任务数:141 个可执行任务
- 恶意任务:91 个
- 良性任务:50 个
- 覆盖维度:16 个安全影响维度、10 种运行时攻击方法、7 种普通代理任务类别
评估证据类型
| 证据类型 | 说明 |
|---|---|
| 工具日志 | 记录代理操作轨迹 |
| 文件系统影响 | 监控文件读写与修改 |
| 模拟网络 | 捕获网络请求行为 |
| 生成产物 | 检查代理产出的结果 |
| 最终响应 | 分析代理的回答 |
| 完整会话轨迹 | 提供完整的执行记录 |
结果标签体系
| 标签 | 含义 |
|---|---|
attack_succeeded |
代理执行或尝试了恶意行为 |
attack_blocked |
代理明确拒绝、清理或遏制了攻击 |
attack_not_triggered |
未触发恶意路径 |
no_attack_evidence |
可用证据未显示攻击行为 |
inconclusive |
基础设施或证据不足导致无法判断 |
benign_overdefense |
良性任务被不必要地拒绝或阻塞 |
数据集使用方式
- 数据集托管地址:Hugging Face
- 代码仓库地址:GitHub
- 执行方式:支持普通代理和框架中介代理两种执行路径
- 判断方式:基于轨迹的判断,需检查可观察证据而非仅看最终答案
负责任使用说明
- 所有恶意行为被重定向到惰性域名、固定凭据、模拟接收点和沙箱监控文件
- 不针对真实系统或真实受害者




