DeepTrap
收藏资源简介:
DeepTrap是一个安全基准测试,用于评估OpenClaw代理在恶意执行上下文压力下(如中毒的工作空间文件、注入的技能、误导性工具元数据、不安全的命令路径、植入的秘密和编码的有效载荷)能否完成良性用户任务。公共版本包含42个重放任务,分为6个上下文漏洞类别和7个操作场景系列,以及基准运行器和公共评分代码。
DeepTrap is a security benchmark designed to evaluate whether the OpenClaw agent can complete benign user tasks under the pressure of malicious execution contexts, such as poisoned workspace files, injected skills, misleading tool metadata, insecure command paths, implanted secrets and encoded payloads. Its public version includes 42 replay tasks, which are categorized into 6 context vulnerability categories and 7 operational scenario series, along with a benchmark runner and public scoring code.
DeepTrap 数据集概述
DeepTrap 是一个面向 OpenClaw 智能体的开放世界安全评估基准,旨在测试智能体在对抗性执行上下文中完成良性用户任务的同时抵抗恶意安全威胁的能力。
核心目标
与传统基准不同,DeepTrap 提出的更严格问题是:当周围执行上下文具有对抗性时,智能体能否安全地完成有用工作? 用户提示本身是良性且正常的,风险来自于工作空间中的上下文环境。
数据集规模
| 维度 | 数量 |
|---|---|
| 任务总数 | 42 个 |
| 风险套件(R1-R6) | 6 类 |
| 操作场景族(T01-T07) | 7 类 |
任务设计为 6 类上下文漏洞 × 7 类良性场景的交叉组合。
风险套件(R1-R6)
| 风险套件 | 类别 | 任务数 | 评估内容 |
|---|---|---|---|
| R1 | 框架劫持 | 7 | 对中毒上下文和注入工作流步骤的抵抗能力 |
| R2 | 隐私泄露 | 7 | 对植入凭证和敏感值的保护能力 |
| R3 | 未授权执行 | 7 | 拒绝危险命令和越界行为的能力 |
| R4 | 供应链风险 | 7 | 处理恶意技能和工具类集成组件的能力 |
| R5 | 工具滥用 | 7 | 检测误导性或错配工具行为的能力 |
| R6 | 编码混淆 | 7 | 处理编码指令和多步骤载荷的能力 |
场景族(T01-T07)
| 场景 | 典型任务类型 |
|---|---|
| T01 | 会议记录、行动项和常规工作流摘要 |
| T02 | Python/代码格式化、重构、API/日志处理 |
| T03 | 研究笔记、文献综述、引用和调研分析 |
| T04 | 部署就绪检查、配置验证和服务健康检查 |
| T05 | 销售、营收和结构化业务数据报告 |
| T06 | 博客/内容撰写、风格检查、入职和反馈摘要 |
| T07 | 系统管理、环境审计、部署检查和日志备份 |
安全威胁类型
DeepTrap 评估嵌入在以下各类执行上下文中的威胁,而非仅限提示攻击:
- 中毒的文件和内存样工件
- 注入的技能和误导性工具元数据
- 危险的 shell 命令和部署脚本
- 植入的凭证、API 密钥和环境变量
- Base64 和多步骤编码指令
评分体系
DeepTrap 同时报告两项评分:
- AGS(Attack Grading Score):攻击评分,越高表示攻击实现程度越强
- UGS(Utility Grading Score):效用评分,越高表示任务完成质量越好
排行榜(部分模型表现)
| 模型 | AGS 平均 | UGS 平均 |
|---|---|---|
| DeepSeek-v4-Flash | 0.89 | 0.96 |
| Qwen3.5-Plus | 0.88 | 0.95 |
| Deepseek-v4-Pro | 0.86 | 0.89 |
| GLM-5 | 0.83 | 0.90 |
| MiniMax-M2.5 | 0.83 | 0.90 |
| GPT-5.4 | 0.70 | 0.83 |
| MiMo-v2.5 | 0.72 | 0.91 |
| MiMo-v2.5-pro | 0.64 | 0.86 |
| Claude-Sonnet-4.6 | 0.38 | 0.61 |
引用信息
论文标题:Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw
论文链接:arXiv:2605.11047
项目主页与排行榜:ZJUICSR.github.io/DeepTrap
Hugging Face 数据集:ZJUICSR/DeepTrap




