Bordair Multimodal Prompt Injection Dataset
收藏资源简介:
Bordair多模态提示注入数据集包含101,032个标记样本(50,516个攻击样本和50,516个良性样本),覆盖跨模态、多轮、对抗性后缀、越狱模板、间接注入、工具操作、代理和规避攻击等四种数据集版本。该数据集用于训练和评估提示注入检测器,所有样本均标记为(expected_detection: true/false),并可直接用于二元分类器。
The Bordair Multimodal Prompt Injection Dataset comprises 101,032 labeled samples, consisting of 50,516 adversarial samples and 50,516 benign samples. It features four dataset versions that cover cross-modal, multi-turn, adversarial suffix, jailbreak template, indirect injection, tool manipulation, agent and evasion attack scenarios. This dataset is designed for training and evaluating prompt injection detectors, with all samples annotated using the (expected_detection: true/false) labeling scheme and readily applicable to binary classification tasks.
Bordair Multimodal Prompt Injection Dataset 概述
数据集基本信息
- 数据集名称:Bordair Multimodal Prompt Injection Dataset
- 样本总数:101,032 个已标注样本
- 攻击样本:50,516 个
- 良性样本:50,516 个
- 平衡比例:攻击与良性样本严格 1:1
- 主要用途:训练和评估提示注入检测器
- 标签字段:
expected_detection: true/false - 数据来源:所有攻击样本均溯源至同行评审论文或已记录的行业研究
- 数据格式:结构化,可直接用于二元分类器
方法论与范围
- 提示注入定义:嵌入在LLM输入中的文本,旨在覆盖、劫持或重定向模型行为,使其偏离操作员指定的任务。遵循 Greshake et al. 2023 (arXiv:2302.12173) 和 OWASP LLM01:2025 的定义。
- 范围限定:仅涵盖运行时注入(攻击者可在推理时置于模型上下文窗口中的文本)。明确排除训练时攻击、无注入成分的模型提取攻击、无特定任务劫持框架的纯越狱攻击以及不针对LLM的通用社会工程攻击。
数据集构建层次
- 种子载荷层(手写,共 681 个种子):为每个攻击类别手工编写注入种子,基于同行评审论文和已记录的真实事件。每个种子均标注其学术来源和攻击参考。
- 程序化扩展层(v2,14,358 个样本):使用 PyRIT v0.12.1 的 162 个越狱模板和 13 种编码转换器对种子进行扩展。包含来自已发表文献的 GCG 对抗性后缀。
- 跨模态传递层(v1 + v4 跨模态,35,687 个样本):通过 7 种图像方法、4 种文档类型 × 5 种隐藏位置、6 种音频方法以及多模态组合传递注入种子。遵循 FigStep (arXiv:2311.05608) 和 CrossInject (arXiv:2504.14348) 的威胁模型。
- 良性样本层(50,516 个):良性提示来自已发布的学术和行业数据集。良性多模态样本将这些文本提示与真实的图像描述、文档段落和音频转录配对。包含 130 个手写的边缘案例,在真实的良性上下文中使用攻击相关词汇以减少训练中的误报。
标签分配
- 所有攻击载荷:
expected_detection: true - 所有良性样本:
expected_detection: false - 标签通过构建过程分配,而非人工逐条审查。正确性保证在类别层面。
- 未故意引入对抗性标签噪声。
质量控制
- 去重:良性文本池包含 0 个重复文本。新的跨模态良性样本检查完整键重复元组。
multimodal_image_document.json中存在一个已知的重复簇(1,340 条条目),已在benign/summary.json中记录。 - 池/攻击文本重叠:零良性池文本以原文形式出现在攻击载荷文本中。
- 来源可追溯性:每个攻击样本都包含
attack_source和attack_reference字段,指向其学术或行业来源。 - 可复现性:所有样本均从固定的随机种子(seed=42)确定性生成。包含生成脚本,重新运行可产生完全相同的已发布载荷。
与相关数据集的比较
| 数据集 | 样本数 | 模态 | 来源基础 | 与本数据集的关键差距 |
|---|---|---|---|---|
| deepset/prompt-injections | ~500 | 文本 | 社区收集 | 单模态,类别覆盖窄 |
| jackhhao/jailbreak-classification | ~2,600 | 文本 | Reddit/社区越狱 | 仅越狱,无间接/智能体/跨模态 |
| rubend18/ChatGPT-Jailbreak-Prompts | ~79 | 文本 | 社区越狱 | 非常小,无良性分割 |
| Tensor Trust | 126K | 文本 | 对抗性游戏(攻击 vs 防御) | 攻击/防御框架,非注入 vs 良性二元分类 |
| HackAPrompt | 600K+ | 文本 | 竞赛条目 | 竞赛特定目标,无多模态传递 |
| InjectAgent | 1,054 | 文本 | 智能体工具调用场景 | 仅关注智能体/工具,无跨模态 |
| 本数据集 | 101,032 | 文本、图像、文档、音频 | 同行评审论文 + 行业研究 | 涵盖以上所有 + 2025 智能体类别 |
本数据集是唯一公开可用的、涵盖跨模态传递、智能体攻击类别以及大规模 1:1 平衡良性分割的提示注入数据集。
已知局限性
- 多模态攻击的文本表示:
image_content、doc_content和audio_content字段表示解析器将提取的内容,并非实际的图像、文档或音频二进制文件。 - 手写种子:v3 和 v4 类别的种子由数据集作者编写,并非从真实的攻击者基础设施收集。
- 静态良性池:良性文本池来自 Alpaca 和 WildChat,偏向英语和相对较短的提示。非英语良性提示覆盖有限。
- 无评分者间信度度量:标签通过构建分配,无人对单个样本进行标注,因此无评分者间一致性分数。
- ASR 数据来自源论文:文档中引用的攻击成功率数据来自原始论文,这些论文测试的是发布时当前的模型。针对当代前沿模型的数据可能不同。
- v4 类别数量较少:14 个 v4 种子类别在跨模态扩展前平均每个 20 个样本。
数据集版本
| 版本 | 生成器 | 攻击载荷 | 良性 | 总计 | 主要覆盖范围 |
|---|---|---|---|---|---|
| v1 | generate_payloads.py |
23,759 | 23,759 | 47,518 | 跨模态分割攻击(文本+图像/文档/音频) |
| v2 | generate_v2_pyrit.py |
14,358 | -- | 14,358 | 多轮编排、GCG 后缀、越狱模板 |
| v3 | generate_v3_payloads.py |
187 | -- | 187 | 间接注入、工具滥用、Unicode 规避、提示提取 |
| v4 | generate_v4_payloads.py |
284 | -- | 284 | 智能体攻击、内存污染、MCP、推理劫持、RAG、ASR |
| v4 跨模态 | generate_v4_crossmodal.py |
11,928 | -- | 11,928 | v4 种子通过文本+图像、文本+文档、文本+音频、图像+文档、三重模态传递 |
| 总计 | 50,516 | 50,516 | 101,032 |
v1:跨模态攻击载荷(23,759 攻击 + 23,759 良性)
- 基础注入类别:13 个。
- 跨模态传递方法:涵盖文本+图像、文本+文档、文本+音频、图像+文档、三重模态、四重模态组合。
- 图像传递方法:包括 OCR、EXIF 元数据、PNG 元数据、XMP 元数据、白色文本、隐写术、对抗性扰动。
- 跨模态分割策略:包括良性文本包装完整注入、跨模态分割载荷、跨模态分割权限声明与命令、跨模态上下文切换。
v2:PyRIT + nanoGCG 数据集(14,358 攻击)
- 生成工具:使用 PyRIT v0.12.1 和 nanoGCG v0.3.0。
- 覆盖方法:PyRIT 越狱模板、GCG 对抗性后缀、AutoDAN 流畅包装器、编码混淆、Crescendo 多轮攻击、组合攻击、PAIR 越狱、Skeleton Key、TAP 树搜索、多轮越狱。
良性数据集(50,516 个提示)
- 文本提示池:23,211 个独特文本。
- 来源:Stanford Alpaca、WildChat、deepset/prompt-injections、手写边缘案例。
- 边缘案例:覆盖 10 个词汇簇,如
ignore、override、system prompt、password等,用于在完全良性的上下文中减少误报。 - 内容来源:
- 文本提示:Stanford Alpaca, WildChat, deepset, LMSYS Chatbot Arena, SPML, 手写边缘案例。
- 图像内容:MS-COCO 2017 描述, Flickr30k, 75 项精选描述池。
- 文档内容:Wikipedia EN, RedPajama arXiv 子集, 40 项段落池(年度报告、论文、法律、医疗)。
- 音频内容:LibriSpeech train-clean-100, Mozilla Common Voice 13 EN, 36 项转录池(广播、讲座、听写)。




