StakeBench
收藏资源简介:
StakeBench是由南洋理工大学等机构联合构建的面向真实网络代理系统的提示注入安全基准数据集。该数据集以在线购物领域为背景,包含12个产品类别和22个可重用攻击模板,共生成264个可执行对抗案例,数据来源于模拟电子商务环境的交互内容。数据集通过将攻击按利益相关方(用户、第三方卖家、平台)分类,并细化为12个具体攻击目标,采用多维度评估指标构建而成。该数据集旨在系统评估大型语言模型驱动的网络代理在真实部署环境中的提示注入风险,特别关注攻击对不同利益相关方造成的非对称危害分布,为多利益相关方安全评估提供基础框架。
StakeBench is a prompt injection safety benchmark dataset for real-world web agent systems, jointly constructed by Nanyang Technological University and other institutions. Focused on the online shopping domain, this dataset includes 12 product categories and 22 reusable attack templates, generating a total of 264 executable adversarial cases, with data sourced from interactive content in a simulated e-commerce environment. Constructed using multi-dimensional evaluation metrics, the dataset classifies attacks by stakeholders (users, third-party sellers, and platform operators) and further breaks them down into 12 specific attack targets. This dataset aims to systematically evaluate the prompt injection risks of Large Language Model (LLM)-powered web agents in real-world deployment environments, with a particular focus on the asymmetric harm distribution of attacks to different stakeholders, providing a foundational framework for multi-stakeholder safety evaluation.
StakeBench 数据集概述
StakeBench 是一个以利益相关者为中心的基准测试,用于评估基于 LLM 的网页代理在现实电子商务环境中的提示注入安全性。
核心信息
- 目的: 评估可部署的 LLM 网页代理在观察内容中嵌入对抗性指令时,能否安全完成真实的网页任务。
- 攻击类型:
- 间接提示注入 (IPI): 对抗性指令嵌入到任务执行过程中遇到的环境内容中(如产品评论、评级、元数据)。
- 直接提示注入 (DPI): 对抗性指令插入到代理的主要用户输入通道(作为参考设置)。
- 评估环境: VisualWebArena 中的 OneStopMarket,一个功能性的电子商务平台。
- 评估代理系统: NanoBrowser 和 BrowserUse。
- 评估模型: GPT-5 和 Gemini-2.5-Flash。
基准测试统计
| 项目 | 数值 |
|---|---|
| 攻击模板 | 22 个(9 个 DPI, 13 个 IPI) |
| 可执行对抗性案例 | 264 个 |
| 总攻击运行次数 | 3,168 次 |
| 利益相关者类别 | 用户、卖家、平台 |
| 攻击目标类别 | 12 个 |
| 产品类别 | 12 个 |
| 每个对抗性案例运行次数 | 3 次 |
| 评估指标 | ASR, TDR, BIR |
攻击分类法
StakeBench 采用以实体为中心的分类法,根据遭受损害的利益相关者和具体的对抗性目标进行分类。
- 针对用户的目标:
- E1: 订单或支付数据泄露
- E2: 个人信息泄露
- E3: 强制或诱导购买
- E4: 订单篡改
- 针对卖家的目标:
- T1: 偏向性评论操纵
- T2: 评分操纵
- T3: 恶意取消
- T4: 订单膨胀
- 针对平台的目标:
- P1: 伪造权限指令
- P2: 未经授权的行为诱导
- P3: 工作流绕过
- P4: 工作流循环诱导
评估指标
每个被攻击的轨迹都沿着三个互补的轴进行标记:
- ASR (攻击成功率): 衡量是否通过对目标实体执行操作来达到对抗性目标。
- TDR (任务偏离率): 衡量用户的委托良性任务是否被实质性中断(不针对 DPI 报告)。
- BIR (行为异常率): 衡量轨迹是否表现出病理化执行行为(如循环、矛盾计划等)。
ASR 和 TDR 共同定义了四个故障模式区域:复合故障、隐蔽寄生、失调中断和鲁棒行为。

- 1Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents南洋理工大学; ST Engineering; IBM研究院; 伊利诺伊大学厄巴纳-香槟分校 · 2026年



