遇见数据集

MuhammadAnas1657/llmail-inject-challenge

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含大量攻击提示,这些提示是已关闭的LLMail-Inject: Adaptive Prompt Injection Challenge挑战中收集的。挑战旨在模拟LLM集成电子邮件客户端(LLMail服务)中的提示注入防御规避,攻击者需通过精心设计的电子邮件绕过防御,使LLM执行未授权的操作(如发送电子邮件)。数据集涵盖两个阶段(Phase1和Phase2),包括不同场景(如无检索的电子邮件汇总、基于检索的问答和数据外泄)、多种防御机制(如Spotlighting、PromptShield、LLM-as-a-judge、TaskTracker及其组合)和不同LLM模型(如Phi-3-medium-128k-instruct和GPT-4o mini)。数据格式包括原始提交记录、带标签的唯一提交、元数据(如场景描述、系统提示)和测试用电子邮件,用于研究自适应提示注入攻击的检测和防御。

This dataset contains a large number of attack prompts collected as part of the now closed LLMail-Inject: Adaptive Prompt Injection Challenge. The challenge simulates prompt injection defense evasion in an LLM-integrated email client (the LLMail service), where attackers craft emails to bypass defenses and cause the LLM to perform unauthorized actions (e.g., sending emails). The dataset covers two phases (Phase1 and Phase2) with various scenarios (e.g., email summarization without retrieval, retrieval-based Q&A, and data exfiltration), multiple defense mechanisms (e.g., Spotlighting, PromptShield, LLM-as-a-judge, TaskTracker, and their combination), and different LLM models (e.g., Phi-3-medium-128k-instruct and GPT-4o mini). The data format includes raw submissions, labeled unique submissions, metadata (e.g., scenario descriptions, system prompts), and emails for false positive testing, aimed at studying adaptive prompt injection attacks for detection and defense research.

提供机构:
MuhammadAnas1657
搜集汇总
数据集介绍
MuhammadAnas1657/llmail-inject-challenge 数据集图片
构建方式
LLMail-Inject 数据集源自一项面向自适应提示注入挑战的竞赛活动,其构建方式兼具系统性与对抗性。参赛者扮演攻击者角色,向模拟的 LLM 集成电子邮件客户端(LLMail 服务)发送精心构造的恶意邮件,旨在绕过系统内置的多重防御机制,诱使 LLM 执行未授权的操作(如发送指定邮件)。数据集覆盖两大赛段,共包含 64 个挑战关卡,每个关卡由四种检索场景(如无检索摘要、含检索摘要及数据窃取等)、五种防御策略(包括 Spotlighting、PromptShield、LLM-as-a-judge、TaskTracker 及组合防御)与两种 LLM 模型(开源 Phi-3 与闭源 GPT-4o mini)组合而成。最终收集了来自多支参赛团队的原始提交记录,经去重与标注后形成结构化数据,以 JSONL 格式存储,并配套提供场景元数据、系统提示词及防御响应标记。
特点
该数据集最显著的特征在于其丰富的对抗性与真实性维度,为研究提示注入攻击与防御提供了高质量基准。一方面,数据涵盖了四类差异化检索配置(从简单的两封邮件摘要到带相关度排序的十封邮件检索与数据窃取任务),模拟了真实邮件客户端中 LLM 助手的多样化交互场景;另一方面,防御体系设计全面,包含了基于标记、分类器、语言模型判别及内部激活差异检测等多种前沿防御手段,且攻击者需在知晓防御机制的条件下实施自适应攻击。此外,数据集提供了多层次的细粒度标注,包括邮件是否被检索、防御是否触发、API 调用是否成功及参数是否匹配等布尔型目标标记,并辅以 LLM 法官的判定理由与分类标签,使得研究人员能够从攻击成功性、绕过的防御类型及攻击策略偏好等多个维度进行深入分析。
使用方法
研究者可直接通过 Hugging Face 平台的 datasets 库加载该数据集的主文件(raw_submissions_phase1.jsonl 与 raw_submissions_phase2.jsonl),获取包含邮件主题、正文、提交时间、团队标识及目标状态等字段的原始攻击记录。若要开展更精细的分析,可下载标注后的唯一提交数据集(labelled_unique_submissions_*.json),其中每条数据附有攻击成功标记及其原因(如 API 触发或 LLM 法官判别)。此外,配套的 scenarios.json 与系统提示词文件提供了场景的完整配置(如良性邮件内容、攻击目标描述、用户查询语句),便于研究者重建挑战环境。该数据集主要适用于评估与对比各类提示注入防御方法的鲁棒性、训练或微调面向注入检测的 LLM 分类器,以及研究攻击策略的演化规律与自适应特性。
背景与挑战
背景概述
LLMail-Inject Challenge数据集由微软研究院于2025年创建,主要研究人员包括Sahar Abdelnabi等人,旨在系统评估大语言模型(LLM)在集成邮件客户端场景下对抗间接提示注入攻击的能力。该数据集基于一项大规模的众包竞赛,模拟了攻击者通过精心构造的邮件诱导LLM执行未授权操作(如发送指定邮件)的过程,涵盖了多种防御机制(如Spotlighting、PromptShield、LLM-as-a-judge、TaskTracker)及不同LLM(包括开源与闭源模型)的交互。数据集收录了超过46万条攻击尝试记录,为研究LLM在现实应用中的安全性提供了宝贵的基准,推动了提示注入攻防领域的发展。
当前挑战
该数据集所解决的领域挑战是LLM集成应用中的间接提示注入攻击问题,即攻击者如何在不被用户知晓的情况下,通过注入恶意指令操纵模型执行有害操作。构建过程中面临的挑战包括:设计涵盖四种不同检索配置和多种防御组合的40个测试场景,确保攻击的适应性和评估的全面性;对防御机制(如TaskTracker基于模型内部激活的检测)进行精确配置与调优;收集大规模、多样化的攻击样本,并对其有效性进行细粒度标注(如API调用成功与否、是否绕过防御);管理竞赛的两阶段迭代,持续更新防御措施以应对更强大的攻击,同时保持评估的公平性与可重复性。
常用场景
经典使用场景
LLMail-Inject Challenge 数据集专为评估和提升大型语言模型在集成邮件助理场景下对间接提示注入攻击的鲁棒性而设计。研究者可利用该数据集模拟攻击者向受害者用户发送恶意邮件,旨在诱导LLM执行未经用户授权的操作,如调用API发送邮件或窃取敏感数据。数据集中涵盖四种检索配置迥异的场景,从无检索的双邮件摘要到含检索的十封邮件数据窃取,并搭配了多种防御机制与底层模型。这使其成为衡量自适应提示注入攻击有效性、测试防御系统抗性的黄金标准测试集。
解决学术问题
该数据集聚焦于解决LLM实际部署中因间接提示注入引发的安全与信任危机这一核心学术难题。传统研究多关注直接提示注入,而LLM作为邮件助理需处理外部第三方邮件,这对防御机制提出了严峻挑战。数据集系统性地考察了面对已知防御的攻击者如何构建自适应攻击,以及Spotlighting、PromptShield、TaskTracker等防御策略的协同效能。其意义在于为安全对齐、鲁棒泛化及可控文本生成等研究提供了扎实的实证基础,推动了对抗性机器学习与可信AI理论的纵深发展。
衍生相关工作
基于本数据集,学界与工业界衍生出多项代表性工作。例如,研究者利用其标注数据训练了更精准的提示注入检测分类器,改进了基于模型内部激活变化的TaskTracker框架;同时涌现出针对多轮对话场景与检索增强生成环境的防御蒸馏策略。挑战赛中优胜的攻击手法被系统化整理,反哺了对抗样本生成理论。数据集的公开亦促进了提示注入领域的标准化评估,催生了如PromptBench等综合评测基准,进一步推动LLM安全生态的健康发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务