LongPIBench
收藏数据链接:
官方服务:
资源简介:
LongPIBench是由宾夕法尼亚州立大学和杜克大学联合创建的长期上下文提示注入基准测试,旨在评估大语言模型在真实长文本场景下的安全漏洞。该基准涵盖论文评审、简历筛选、代码审查和邮件摘要四个应用场景,每个场景包含合成数据集(共400条)和真实数据集,上下文长度从数千到数万Token不等。数据集通过GPT-5分阶段迭代生成,确保长文档的结构连贯性和格式真实性。该基准揭示了现有防御措施在长上下文中的显著失效,即使简单启发式攻击也能达到100%成功率,为设计针对长文本的鲁棒防御提供了关键评估平台。
提供机构:
宾夕法尼亚州立大学; 杜克大学创建时间:
2026-08-28
搜集汇总
数据集介绍

构建方式
LongPIBench的构建围绕四个真实应用场景展开,即论文同行评审、简历筛选、代码审查和电子邮件摘要。每个场景均配备了合成数据集与真实世界数据集,其中合成数据集采用分阶段生成工作流,借助GPT-5逐节迭代生成内容,以保证长文档的连贯性与结构完整性,并通过标准模板(如ICLR风格)渲染以模拟现实格式;真实世界数据集则分别选自ICLR 2024拒稿论文、公开简历语料、GitHub拉取请求审查记录及安然电子邮件语料,确保评估覆盖自然分布。所有数据集均将上下文长度扩展至数千至数万token,以揭示长上下文环境下的提示注入风险。
特点
LongPIBench的显著特点在于其长上下文设定,填补了现有基准在数千token以上场景的评估空白。基准包含了8种攻击策略,涵盖六种启发式攻击与两种基于优化的攻击(如GCG及其通用变体),并针对每个场景设计了具体且可量化的攻击目标,例如操纵论文评分或诱导批准代码变更。此外,基准还集成了九种检测防御与六种预防防御,支持综合评估。其设计支持消融研究,可独立考察文档模板、注入位置及上下文长度等因素的影响,突显了长上下文下防御性能的系统性退化。
使用方法
LongPIBench可应用于评估与比较不同提示注入攻击与防御在长上下文场景下的有效性。研究人员可通过统一接口加载合成或真实数据集,并根据研究目标选择相应的攻击方法,注入到指定文档位置,并以攻击成功率(ASR)作为主要评价指标。对于防御评估,可配置检测或预防机制,并通过误报率(FPR)与漏报率(FNR)或ASR来衡量防御性能。基准附带的代码库支持自定义扩展,便于用户集成新的攻击、防御或模型,从而推动长上下文提示注入领域的发展。
背景与挑战
背景概述
随着大型语言模型(LLMs)在现实世界中的广泛应用,如学术同行评审、简历筛选、代码审查和电子邮件摘要,提示注入攻击已成为一个严峻的安全威胁。然而,现有的提示注入基准主要关注短上下文输入,通常只有几十到几百个token,忽视了现代LLM应用中常见的长上下文场景(数千至数万个token)。为弥合这一关键缺口,LongPIBench于2026年由宾夕法尼亚州立大学和杜克大学的研究团队联合构建,覆盖四个真实应用场景,每个场景包含合成数据集和真实数据集,系统性地评估了多种攻击与防御方法。该基准揭示了在长上下文条件下,即便是简单的启发式攻击也能实现高成功率,且现有最先进的防御手段大幅失效,从而为研究社区提供了更贴近实际部署的评估框架,推动了提示注入领域的发展。
当前挑战
LongPIBench面临的核心挑战在于多维度的问题:首先,现有提示注入基准多局限于短上下文,难以反映长上下文场景下攻击与防御的真实表现,导致防御效果被显著高估;其次,在长上下文设置中,注入的指令仅占输入的一小部分,检测和预防难度剧增,现有防御方法如指令预防、分隔符隔离等,在长文中攻击成功率几乎无下降;此外,构建过程中需生成上下文长度从数千到数万个token的合成数据,并整合真实数据集(如ICLR论文、真实简历、GitHub代码审查和Enron邮件),同时需定义任务特定的攻击目标和成功标准,确保评估的准确性和可复现性;最终,优化型攻击(如GCG)在长上下文中表现出高迁移性,进一步加剧了防御难度,使得现有防御体系难以有效抵御。
常用场景
经典使用场景
LongPIBench作为首个专门针对长上下文场景的提示注入基准,其经典使用场景集中在四个高保真度的实际应用领域:论文同行评审、简历筛选、代码审查及邮件摘要。这些场景均涉及数千至数万token的文档级上下文处理,典型如LLM辅助的学术会议审稿系统(如AAAI的AI审稿平台)或企业级邮件自动回复助手。在该基准中,研究者可系统性地评估现有提示注入攻击与防御方法在长文档处理中的表现,尤其关注注入指令深埋于长文本中时,模型能否坚守原始任务指令。通过合成与真实混合的数据集设计,LongPIBench确保了评估的可控性与生态效度,成为衡量长上下文安全性的标准测试平台。
衍生相关工作
LongPIBench的发布催生了多项衍生研究工作。其基准框架被扩展至智能体安全评估,如AgentDyn引入动态长上下文任务,MPIB针对医疗领域提示注入,NetInjectBench面向网络运维智能体,这些工作均借鉴了LongPIBench的场景设计与评估方法论。在攻击侧,RL-Hammer和PISmith等强化学习攻击方法利用LongPIBench作为训练与评估环境,验证其跨长文档的迁移性。在防御侧,PromptLocate与SecInfer的后续改进版本以LongPIBench为关键测试集,致力于在长上下文中维持低ASR。此外,PIArena等平台整合了LongPIBench的数据与攻击库,为社区提供统一的可扩展评估生态。
数据集最近研究
最新研究方向
在长上下文场景下,针对大语言模型的提示注入攻击与防御评估正成为安全领域的前沿焦点。现有基准多聚焦于短输入,难以反映真实部署中数万token文档的威胁态势。LongPIBench应运而生,开创性地构建了涵盖论文评审、简历筛选、代码审查及邮件摘要四种实际应用场景的长上下文基准,并通过合成与真实数据集揭示:即便简单的启发式攻击在长文本中也能达到极高成功率,而诸多在短上下文表现卓越的防御机制,如MetaSecAlign 8B,其鲁棒性显著退化。该基准系统性地暴露了现有防御在长上下文环境下的脆弱性,并指出攻击成功率与注入位置、文档格式等因素的关联,为设计面向真实场景的长上下文安全防御体系提供了关键评测基石,对推动LLM安全研究向实际部署纵深发展具有里程碑意义。
相关研究论文
- 1LongPIBench: A Long-Context Benchmark for Prompt Injection宾夕法尼亚州立大学; 杜克大学 · 2026年
以上内容由遇见数据集搜集并总结生成



