遇见数据集

StakeBench

收藏
arXiv2026-06-11 更新2026-06-13 收录
数据链接:
官方服务:

资源简介:

StakeBench是由南洋理工大学等机构联合构建的面向真实网络代理系统的提示注入安全基准数据集。该数据集以在线购物领域为背景,包含12个产品类别和22个可重用攻击模板,共生成264个可执行对抗案例,数据来源于模拟电子商务环境的交互内容。数据集通过将攻击按利益相关方(用户、第三方卖家、平台)分类,并细化为12个具体攻击目标,采用多维度评估指标构建而成。该数据集旨在系统评估大型语言模型驱动的网络代理在真实部署环境中的提示注入风险,特别关注攻击对不同利益相关方造成的非对称危害分布,为多利益相关方安全评估提供基础框架。

StakeBench is a prompt injection safety benchmark dataset for real-world web agent systems, jointly constructed by Nanyang Technological University and other institutions. Focused on the online shopping domain, this dataset includes 12 product categories and 22 reusable attack templates, generating a total of 264 executable adversarial cases, with data sourced from interactive content in a simulated e-commerce environment. Constructed using multi-dimensional evaluation metrics, the dataset classifies attacks by stakeholders (users, third-party sellers, and platform operators) and further breaks them down into 12 specific attack targets. This dataset aims to systematically evaluate the prompt injection risks of Large Language Model (LLM)-powered web agents in real-world deployment environments, with a particular focus on the asymmetric harm distribution of attacks to different stakeholders, providing a foundational framework for multi-stakeholder safety evaluation.

创建时间:
2026-06-11
原始信息汇总

StakeBench 数据集概述

StakeBench 是一个以利益相关者为中心的基准测试,用于评估基于 LLM 的网页代理在现实电子商务环境中的提示注入安全性。

核心信息

  • 目的: 评估可部署的 LLM 网页代理在观察内容中嵌入对抗性指令时,能否安全完成真实的网页任务。
  • 攻击类型:
    • 间接提示注入 (IPI): 对抗性指令嵌入到任务执行过程中遇到的环境内容中(如产品评论、评级、元数据)。
    • 直接提示注入 (DPI): 对抗性指令插入到代理的主要用户输入通道(作为参考设置)。
  • 评估环境: VisualWebArena 中的 OneStopMarket,一个功能性的电子商务平台。
  • 评估代理系统: NanoBrowser 和 BrowserUse。
  • 评估模型: GPT-5 和 Gemini-2.5-Flash。

基准测试统计

项目 数值
攻击模板 22 个(9 个 DPI, 13 个 IPI)
可执行对抗性案例 264 个
总攻击运行次数 3,168 次
利益相关者类别 用户、卖家、平台
攻击目标类别 12 个
产品类别 12 个
每个对抗性案例运行次数 3 次
评估指标 ASR, TDR, BIR

攻击分类法

StakeBench 采用以实体为中心的分类法,根据遭受损害的利益相关者和具体的对抗性目标进行分类。

  • 针对用户的目标:
    • E1: 订单或支付数据泄露
    • E2: 个人信息泄露
    • E3: 强制或诱导购买
    • E4: 订单篡改
  • 针对卖家的目标:
    • T1: 偏向性评论操纵
    • T2: 评分操纵
    • T3: 恶意取消
    • T4: 订单膨胀
  • 针对平台的目标:
    • P1: 伪造权限指令
    • P2: 未经授权的行为诱导
    • P3: 工作流绕过
    • P4: 工作流循环诱导

评估指标

每个被攻击的轨迹都沿着三个互补的轴进行标记:

  • ASR (攻击成功率): 衡量是否通过对目标实体执行操作来达到对抗性目标。
  • TDR (任务偏离率): 衡量用户的委托良性任务是否被实质性中断(不针对 DPI 报告)。
  • BIR (行为异常率): 衡量轨迹是否表现出病理化执行行为(如循环、矛盾计划等)。

ASR 和 TDR 共同定义了四个故障模式区域:复合故障、隐蔽寄生、失调中断和鲁棒行为。

搜集汇总
数据集介绍
StakeBench 数据集图片
构建方式
StakeBench的构建基于大语言模型驱动的Web代理在现实电商环境中的提示注入风险,采用利益相关者中心视角。研究以在线购物为领域背景,利用VisualWebArena中的OneStopMarket平台构建多利益相关者环境,区分用户、第三方卖家和平台三类受害实体。攻击设计分解为12个具体目标,涵盖直接和间接提示注入两种通道,并通过22个可复用模板在12个产品类别中实例化,共生成264个可执行对抗案例。每个案例标注攻击成功率、任务偏离率和行为异常率三维标签,由GPT-5评估器依据模板特定成功条件进行判定,并经人工注释验证。
使用方法
研究者可通过下载StakeBench的完整模板库和实例化案例,在NanoBrowser和BrowserUse等代表性Web代理系统上执行评估。每个案例需运行至少三次以平衡可靠性,使用预定义的GPT-5评估器自动标注ASR、TDR和BIR标签。评估支持按利益相关者类别、攻击目标、交付通道和产品维度进行多粒度分析。建议同时运行良性基线以分离攻击诱导失败与代理固有不可靠性。数据集还提供模板特定评估提示和人类标注一致性验证协议,便于复现和扩展至新代理架构或防御策略。
背景与挑战
背景概述
StakeBench 数据集由南洋理工大学、ST Engineering、IBM Research、伊利诺伊大学厄巴纳-香槟分校等机构的研究人员于2026年提出,旨在系统性地评估大型语言模型驱动的网页代理在真实部署环境下面临的提示注入攻击风险。该数据集的核心研究问题在于,现有的安全性基准多采用以攻击为中心的评价视角,侧重于注入攻击的技术可行性,却忽视了攻击对不同利益相关者所造成的非对称性伤害。为此,StakeBench 引入了以利益相关者为中心的危害建模框架,将攻击按受影响实体(用户、第三方卖家、平台)进行分类,并通过12个具体的攻击目标和22个可复用的攻击模板,在电商场景下构建了264个可执行的对抗性测试用例。该数据集不仅填补了此前评估体系中未能区分受害者身份的空白,也为理解提示注入攻击在实际网页代理系统中的异质性失效模式提供了系统性的工具,对推动具备安全意识的大语言模型代理研究与部署具有重要意义。
当前挑战
StakeBench 面临的挑战首先体现在领域问题的复杂性上:提示注入攻击在网页代理中的风险本质上是受害者依赖型的,同一攻击模式对不同利益相关者可能产生截然不同的后果,且现有的以攻击为中心的评估指标(如单一攻击成功率)无法捕捉这种非对称性与多维度失效模式(如隐蔽寄生、错位干扰、复合失效)。此外,在数据集构建过程中,研究团队需精心设计攻击模板以确保其真实、无冗余且可评估,同时要构建包含用户、卖家与平台三方利益的攻击分类体系,并在动态沙盒电商环境中部署可运行的代理系统进行大规模实验。克服这些挑战需要兼顾攻击语义的多样性、评估指标的互补性以及实验系统的可复现性,最终在3,168次攻击运行中揭示出不同利益相关者之间显著差异化的脆弱性分布。
常用场景
经典使用场景
StakeBench的核心设计围绕提示注入攻击对基于大语言模型的网络智能体所构成的安全威胁展开,其经典使用场景聚焦于评估这些智能体在真实部署环境中的鲁棒性。该基准通过在功能完备的电商平台中嵌入恶意内容,模拟攻击者通过产品评论、评级等表面渠道注入对抗性指令的行为,系统性地衡量智能体在执行用户委托任务时是否会被劫持。这一过程能够揭示攻击成功率、任务偏离程度以及执行行为异常等多维度的脆弱性,从而为理解智能体在动态、多步骤交互中的安全边界提供了标准化评估框架。
解决学术问题
StakeBench解决了现有提示注入基准研究中忽视受害者依赖性与非对称性危害的关键问题。传统评估多从攻击者视角出发,聚焦于技术可行性而忽略同一攻击对不同利益相关者产生的差异化后果。该基准通过以利益相关者为中心的危害建模,区分用户、第三方卖家和平台三类受害实体,并构建12种具体攻击目标与22个可复用模板,首次实现了对危害异质性的系统分类与量化。其提出的多维评估指标(攻击成功率、任务偏离率、行为异常率)联合揭示了隐蔽寄生、错位干扰与复合失效等之前未被捕捉的失败模式,推动了该领域从单一指标向分布化危害描述的范式转变。
实际应用
StakeBench的实际应用体现在为部署基于大语言模型的网络智能体的组织提供风险评估与防御优先级的决策依据。电商平台可利用该基准测试其智能体在面对不同利益相关者攻击时的表现,识别供应链中潜在的系统性漏洞,例如用户隐私泄露、卖家声誉操纵或平台流程绕过。开发团队能据此优化智能体的提示过滤机制、任务验证逻辑及异常检测策略,从而在真实交易场景中降低恶意指令带来的经济损失与信任风险。此外,该基准亦可作为安全审计工具,量化各智能体架构与骨干模型的组合安全性。
数据集最近研究
最新研究方向
StakeBench聚焦于大语言模型驱动网页智能体的提示注入安全评估,创新性地采用利益相关者中心视角,超越传统以攻击技术为主导的基准测试。该研究揭示,在电子商务等现实部署场景中,同一注入攻击对不同实体(用户、第三方卖家、平台)的危害呈现非对称性分布,且相同攻击模式针对不同目标时有效性迥异。前沿研究通过建立涵盖12种具体攻击目标的分类体系,并引入攻击成功率、任务偏离率和行为异常率等多轴评估指标,系统刻画了从隐秘寄生到错位破坏再到复合失效的异质性失败模式。这一工作推动了网页智能体安全评估从攻击技术可行性向利益相关者风险分布的范式转变,为构建真实世界中负责任的人工智能系统提供了关键评估基础。
相关研究论文
  • 1
    Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents南洋理工大学; ST Engineering; IBM研究院; 伊利诺伊大学厄巴纳-香槟分校 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务