遇见数据集

paired_emails_dataset, LLMail-Inject dataset

收藏
github2026-05-19 更新2026-05-28 收录
官方服务:

资源简介:

该数据集包含4,200个配对电子邮件场景(攻击和良性),用于评估当前防御措施(如注入分类器和SecAlign安全训练)的局限性。LLMail-Inject数据集则用于安全警报评估。

This dataset contains 4,200 paired email scenarios (attack and benign), which is developed to assess the limitations of current defensive measures such as injection classifiers and SecAlign security training. The LLMail-Inject dataset is specifically designed for security alert evaluation.

创建时间:
2026-05-15
原始信息汇总

数据集详情总结

概述

该数据集仓库来自论文《AI Agents May Always Fall for Prompt Injections》(Sahar Abdelnabi 和 Eugene Bagdasarian),旨在研究AI智能体在提示注入攻击下的脆弱性。论文提出通过**情境完整性(Contextual Integrity, CI)**理论重新审视提示注入问题,并提供了四个实证贡献,每个贡献对应一个独立的实验目录。


目录结构与实验

1. defense_evaluation/ — 当前防御机制的局限性(论文§3)

  • 数据集
    • paired_emails_dataset.json:4,200对配对的电子邮件场景(攻击/良性各一)。
    • llmail_inject_dataset.json:来自LLMail-Inject基准的安全警报检测场景。
  • 实验内容
    • 评估注入分类器(PromptGuard 1 和 PromptGuard 2)在配对数据集上的表现。
    • 评估邮件智能体(包括闭源前沿模型和SecAlign-70B)在条件委派系统提示下的行为。
    • 评估LLaMA-3.3-70B与Meta SecAlign-70B在安全警报检测(flagging)上的表现。
  • 关键发现:情境化的注入可以绕过现有分类器,因为其在浅层语法/语义特征上与正常邮件无异。

2. ci_redteaming/ — 基于CI的红队攻击(论文§5.1)

  • 攻击类型
    • 上下文参数攻击:采用PAIR风格的迭代循环,攻击者LLM构造邮件以操纵智能体推断错误的上下文参数(如扩大收件人范围),攻击成功率(ASR)达96.7%。
    • 规范评估攻击:攻击者生成基于价值的论证,嵌入邮件中说服智能体认为违反规范是合理的。
  • 实验内容:包括攻击优化、最佳攻击提取、以及跨模型的可迁移性评估。

3. norm_grounding/ — 规范推断需要情境历史(论文§5.2)

  • 数据集dataset.json,包含300个多轮委派场景,覆盖四个领域(法律、医疗、金融、人力资源)和三种升级类型。
  • 实验内容:评估智能体在拥有/去除对话历史(情境基础)时,能否正确推断规范、执行范围内的请求并拒绝范围外的请求。
  • 关键发现:去除情境历史会降低智能体的规范遵守能力。

4. flow_separation/ — 同时信息流的分离(论文§5.3)

  • 数据集flow_separation_scenarios.json,包含100个双信息流邮件线程场景,覆盖50个专业领域。
  • 实验内容:智能体需要同时处理两个信息流——F1(授权请求,需执行)和F2(未授权请求,需拒绝)。评估两种条件(无边界陈述 vs. 有明确边界陈述)下的效用(是否执行F1)和安全违规率(是否因F2调用了send_email)。

数据集汇总

数据集 文件路径 规模与描述
配对电子邮件场景 defense_evaluation/paired_emails_dataset.json 4,200对(攻击/良性),用于邮件助理智能体评估
LLMail-Inject场景 defense_evaluation/llmail_inject_dataset.json 用于安全警报检测评估
规范基础场景 norm_grounding/dataset.json 300个多轮委派场景,4个领域,3种升级类型
流分离场景 flow_separation/flow_separation_scenarios.json 100个双流邮件线程场景,覆盖50个专业领域

主要发现

  • 当前主流的防御范式(数据-指令分离)无法检测通过情境操纵实施的攻击,并且会降低情境适当行为。
  • 通过CI理论重新框架化后,攻击者总能构造一个情境使被阻止的流看起来合法,而防御者收紧规范则会阻塞真正合法的流。
  • 当前研究仅应对了未来攻击表面中不断缩小的一部分;CI提供了一个评估情境敏感失败的原则性框架,可用于设计CI感知的对齐方法。
搜集汇总
数据集介绍
paired_emails_dataset, LLMail-Inject dataset 数据集图片
构建方式
该数据集包含两个核心子集:paired_emails_dataset和LLMail-Inject dataset。paired_emails_dataset通过大型语言模型生成4,200对电子邮件场景,每对包含一个善意请求和一个恶意攻击邮件,攻击邮件通过声称授权或操纵上下文规范来诱导代理回复。LLMail-Inject dataset则基于微软的LLMail-Inject基准,专门用于评估安全警报检测能力。数据集生成采用条件委托系统提示,设置宽松与严格两种委托策略,并交叉两种电子邮件变体,以系统性地测试数据与指令分离范式的防御局限。
特点
数据集的创新性体现在其理论深度与攻击的复杂性。基于情境完整性理论,数据集涵盖了三种攻击类型:通过误导信息流来欺骗代理、通过操纵规范参数来诱导违规行为,以及通过混合多个信息流来绕过边界控制。paired_emails_dataset中的攻击邮件能够规避PromptGuard等商用注入检测分类器,因为其在上下文中看起来与合法邮件无异。此外,数据集还包含多轮委托场景和双重信息流场景,系统性地评估了规范推理和流分离能力。
使用方法
研究人员可通过运行defense_evaluation目录下的评估脚本使用该数据集。在分类器评估中,使用PromptGuard 1和2对4,200对邮件进行评分,计算精确率、召回率和F1值。在代理评估中,配置环境变量和模型后端(如Anthropic、OpenAI或Azure OpenAI),使用eval_agent.py脚本让语言模型扮演邮件助手,执行send_email工具并判断是否被攻击成功。flagging目录下的脚本专门评估模型是否能够正确标记安全警报,并通过compare_checkpoints.py对比基准模型和安全对齐模型的表现。
背景与挑战
背景概述
随着大语言模型驱动的AI代理在任务自动化和信息处理中的广泛应用,提示注入攻击已成为制约其可靠部署的核心安全隐患。2026年,由Sahar Abdelnabi和Eugene Bagdasarian引领,研究团队基于上下文完整性理论,创造性地构建了paired_emails_dataset和LLMail-Inject数据集。该数据集由4,200对精心设计的攻击与良性邮件场景构成,旨在系统揭示现有防御范式在检测上下文操控型攻击时的根本性失效。研究发端于一个关键洞察:当前数据-指令分离的防御策略不仅难以识别隐藏于语境中的恶意指令,反而会损害代理对合法上下文的适切响应。这一成果为AI安全领域提供了评估提示注入脆弱性的理论基石与实证基准。
当前挑战
该数据集所聚焦的核心挑战在于提示注入攻击的隐蔽性与防御的复杂性。一方面,现有注入分类器(如PromptGuard)依赖浅层语义特征,无法区分高度语境化的攻击指令与合法文本,导致攻击成功率居高不下,特别是在上下文参数操控和规范评估操控场景中,攻击成功率高达96.7%。另一方面,数据构建过程面临双重挑战:如何模拟真实邮件对话中同时存在的多重信息流,以及如何在受控实验中精准刻画规范边界模糊性导致的授权泄露。此外,防御方收紧规范可能误拒合法请求,而攻击者总能构造看似合规的上下文,使得完全防御在理论上被证明不可行,这为可靠AI代理的安全对齐提出了严峻挑战。
常用场景
经典使用场景
paired_emails_dataset与LLMail-Inject dataset在大型语言模型(LLM)智能体的安全评估中扮演着举足轻重的角色,其经典使用场景聚焦于prompt注入攻击的防御能力测评。通过构建包含4200对精心设计的攻击性与良性电子邮件场景的配对数据集,研究者能够系统性地评估前沿模型(如Claude、GPT系列及开源LLaMA模型)在充当邮件助手智能体时对恶意指令的识别与抵抗力。该数据集可同时支持两类核心评估:一是衡量模型是否会执行攻击者嵌入的‘发送邮件’指令(即攻击成功率),二是检测模型能否在响应中正确生成安全警报(即注入检测能力),从而全面刻画智能体在真实邮件交互场景下的脆弱性边界。
实际应用
在实际应用层面,该数据集为部署LLM智能体的企业级系统提供了关键的安全质量保障工具。例如,在邮件自动化处理场景中,系统管理员可直接利用该数据集对拟上线的智能体模型进行安全审计:评估其面对‘伪授权请求’(如冒用CEO身份要求发送机密附件)时的误操作风险,以及能否在安全警报中提供实质性告警而非空洞的‘无异常发现’回应。数据集还特别设计了跨场景泛化能力测试,通过检测模型在不同专业领域(法律、医疗、金融、人力资源)的流动分离任务表现,确保智能体在复杂多变的真实邮件流中既能高效执行授权请求(维持业务效用),又能坚决拒绝第三方数据窃取(保障信息安全)。
衍生相关工作
该数据集衍生了一系列开创性的后续研究工作,极大地推动了prompt注入安全领域的理论纵深与方法创新。基于其生成的4200对场景,研究者开发了CI引导的红队测试框架(CI-grounded red-teaming),采用PAIR迭代攻击算法对智能体的上下文参数推断规范评估环节进行定向突破,实现了高达96.7%的攻击成功率。更进一步,衍生的规范推理研究(norm grounding)系统揭示了会话历史对模型正确推断任务规范的关键作用——缺乏背景信息的模型在4个专业领域的300个多轮对话场景中规范遵从度显著下降。流动分离实验(flow separation)则开创性地构建了双信息流评估范式,通过100个邮件线程场景证明,即使明确设置授权边界,智能体仍容易将第二流的未授权请求误判为合法操作,这些工作共同构成了理解LLM智能体安全鸿沟的知识图谱。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务