bordair-multimodal
收藏资源简介:
Bordair多模态提示注入数据集是一个包含503,358个标记样本(251,782个攻击样本和251,576个良性样本)的大规模数据集,旨在训练和评估提示注入检测器。数据集涵盖了跨模态、多轮对话、对抗性后缀、越狱模板、间接注入等多种攻击类型,攻击与良性样本比例接近1:1。数据集的构建分为四个层次:手工制作的种子载荷、通过模板和编码的程序化扩展、跨模态交付以及良性样本的收集。所有样本均标记为`expected_detection: true/false`,并可直接用于二元分类器。数据集经过严格审计,确保无标签错误、无重复样本,并且所有攻击样本均源自同行评审论文或行业研究。数据集支持文本、图像、文档、音频和视频多种模态,是目前唯一公开覆盖跨模态交付、代理攻击类别和2025-2026前沿攻击的提示注入数据集。
The Bordair multimodal prompt injection dataset is a large-scale dataset containing 503,358 labeled samples (251,782 attack samples and 251,576 benign samples), designed for training and evaluating prompt injection detectors. The dataset covers various attack types, including cross-modal, multi-turn dialogue, adversarial suffixes, jailbreak templates, and indirect injections, with a near 1:1 ratio of attack to benign samples. The dataset construction is divided into four levels: manually crafted seed payloads, programmatic expansion through templates and encoding, cross-modal delivery, and benign sample collection. All samples are labeled with `expected_detection: true/false` and can be directly used for binary classifiers. The dataset has undergone rigorous auditing to ensure no label errors, no duplicate samples, and all attack samples are sourced from peer-reviewed papers or industry research. The dataset supports multiple modalities, including text, images, documents, audio, and video, and is currently the only publicly available prompt injection dataset covering cross-modal delivery, proxy attack categories, and cutting-edge attacks from 2025-2026.
Bordair Multimodal Prompt Injection 数据集概述
数据集基本信息
- 总样本量: 503,358 个已标注样本(251,782 个攻击样本 + 251,576 个良性样本)
- 正负样本比例: 约 1:1(审计清理后比例为 0.9992:1)
- 用途: 训练和评估提示注入检测器
- 标注方式: 所有样本带有
expected_detection: true/false标签,来源可追溯至同行评审论文或已记录的行业研究
覆盖的攻击类型
- 跨模态攻击(cross-modal)
- 多轮攻击(multi-turn)
- 对抗后缀攻击(adversarial suffix)
- 越狱模板攻击(jailbreak template)
- 间接注入攻击(indirect injection)
- 工具操纵攻击(tool manipulation)
- Agent 攻击(agentic)
- 逃避攻击(evasion)
- 推理拒绝服务攻击(reasoning DoS)
- 视频生成攻击(video generation)
- VLA 机器人攻击(VLA robotic)
- LoRA 供应链攻击(LoRA supply chain)
- 音频原生 LLM 攻击(audio-native LLM)
- RAG 优化攻击(RAG optimisation)
- MCP 跨服务器攻击(MCP cross-server)
- 编码代理攻击(coding agent)
- 序列化边界攻击(serialization boundary)
- Agent 技能供应链攻击(agent skill supply chain)
数据集构建方法
定义范围
- 提示注入定义: 嵌入在 LLM 输入中、旨在覆盖、劫持或重定向模型行为的文本
- 限定范围: 仅限运行时注入(inference time),排除训练时攻击、模型提取攻击、纯越狱、通用社交工程
四层构建方法
- 第一层 - 种子载荷(手工构建): 210 + 187 + 284 个种子,基于同行评审论文和实际事件
- 第二层 - 程序化扩展(v2,14,358 个样本): 通过 PyRIT v0.12.1 的 162 个越狱模板和 13 个编码转换器扩展
- 第三层 - 跨模态传递(v1 + v4 跨模态,35,687 个样本): 通过 7 种图像方法、4 种文档类型、6 种音频方法传递
- 第四层 - 良性样本(50,516 个): 来自 Stanford Alpaca、WildChat、deepset/prompt-injections、LMSYS Chatbot Arena 等公开数据集
标签分配
- 所有攻击样本:
expected_detection: true - 所有良性样本:
expected_detection: false - 标签按类别级别保证正确性,个体样本继承自种子和类别
良性假阳性风险控制
- 包含 130 个手工构建的边缘案例,使用攻击相关词汇(如 "ignore"、"override"、"system prompt"、"password")但处于完全良性上下文
- 覆盖 10 个词汇簇:
ignore、override、system prompt、password、instructions、jailbreak(iPhone 含义)、bypass surgery、XSS(安全话题)、prompt(相机快门)、inject(依赖注入/医学)
审计结果
- 移除 221 个良性样本:含有注入模式(从 WildChat/UltraChat 泄露)
- 移除 2 个攻击样本:包含真实 OpenAI API 密钥
- 良性数据中零注入模式残留
- 所有样本中零真实秘密残留
- 剩余审计标记(有意保留):
EMPTY_TEXT(5,138 个):跨模态攻击,文本字段有意为空或良性POSSIBLY_BENIGN_ATTACK(1,359 个):短 T2VSafetyBench 提示,孤立看无害但请求不安全视频生成
质量控制
- 去重: 良性文本池中零重复文本;跨模态良性样本检查完整键元组重复
- 池/攻击文本重叠: 零良性池文本与攻击载荷文本逐字重叠
- 来源可追溯性: 每个攻击样本携带
attack_source和attack_reference字段 - 可复现性: 所有样本从固定随机种子(seed=42)确定性生成
数据集版本
| 版本 | 生成器 | 攻击样本 | 良性样本 | 总数 | 主要覆盖范围 |
|---|---|---|---|---|---|
| v1 | generate_payloads.py |
23,759 | 23,759 | 47,518 | 跨模态分割攻击(文本+图像/文档/音频) |
| v2 | generate_v2_pyrit.py |
14,358 | -- | 14,358 | 多轮编排、GCG 后缀、越狱模板 |
| v3 | generate_v3_payloads.py |
187 | -- | 187 | 间接注入、工具滥用、Unicode 逃避、提示提取 |
| v4 | generate_v4_payloads.py |
284 | -- | 284 | Agent 攻击、内存中毒、MCP、推理劫持、RAG、ASR |
| v4 跨模态 | generate_v4_crossmodal.py |
11,928 | -- | 11,928 | v4 种子通过文本+图像/文档/音频传递 |
| v5 | generate_v5_payloads.py |
184 | -- | 184 | 2025-2026 前沿攻击 |
| v5 外部 | ingest_v5_external.py |
201,096 | -- | 201,096 | 从 OverThink、T2VSafetyBench 等摄取 |
| v5 良性 | scale_benign_v5.py |
-- | 201,060 | 201,060 | 来自 Alpaca、WildChat 等文本良性样本 |
| 总计 | 251,782 | 251,576 | 503,358 |
与相关数据集对比
该数据集是唯一公开的提示注入数据集,涵盖:
- 跨模态传递
- Agent 攻击类别(计算机使用、MCP、内存中毒、多 Agent 传染、推理劫持)
- 2025-2026 前沿攻击
- 大规模平衡良性拆分
已知局限性
- 多模态的文本表示: 使用文本表示而非实际图像/文档/音频二进制文件
- 手工种子: 遵循已发表模式但可能未捕捉所有真实变化
- 静态良性池: 偏向英文和较短提示
- 无评估者间信度: 标签按构建分配,无人工标注
- ASR 数据来自原始论文: 可能不适用于当前前沿模型
- v4 类别数量较少: 平均每个种子 20 个样本




