遇见数据集

quadrat-ipi

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

Quadrat-IPI是一个专门用于评估间接提示注入(indirect prompt injection)检测器的数据集。间接提示注入是指攻击者将恶意指令嵌入到模型需要阅读的文档中,而非用户直接输入。该数据集旨在解决传统评估指标(如平均召回率)掩盖检测器在特定场景下薄弱环节的问题,通过将检测器性能分解到92个单元格中,揭示每个单元格的盲区。 数据集包含16,800个独特的注入文档和63,000个干净文档,所有注入文本均为人工编写,而非从公开集合中收集,以确保检测器未见过这些样本。数据来源为六个真实语料库,涵盖邮件(email)、网页(web)和文档(doc)三种载体。注入按10种杠杆(如何使注入被服从)和10种目标(注入要求什么)两轴组合,形成92个实际填充的单元格。每个单元格在允许的载体上各包含80个示例,因此总样本量在不同载体间有所差异:59个单元格有240个示例(三种载体均支持),33个单元格有80个示例(仅支持一种载体)。 数据集提供详细的字段信息,包括文本、标签(injected/clean)、载体类型、来源、注入内容、杠杆类型、目标、合成方式、混淆处理等。数据以Parquet和JSONL格式存储,分别对应injected和clean两个split,且标签由文件决定,而非字段。 主要用途是评估间接提示注入检测器的性能,特别是测量每个单元格的召回率,并支持在0.1%和1%假阳性率下比较不同检测器。数据集已内置9个检测器的评分结果,并提供了完整的测量协议和报告。用户也可以使用配套的评估工具(quadrat-ipi-eval)测量自己的检测器,并重新加权到自己的流量分布中。 注意:该数据集是评估集,而非训练集,没有训练/测试划分,不应用于训练分类器,否则会因混合比例导致误导性结果。

Quadrat-IPI is a dataset specifically designed for evaluating indirect prompt injection detectors.

创建时间:
2026-08-11
原始信息汇总

Quadrat-IPI 数据集概述

基本属性

  • 许可协议:ODC-BY
  • 语言:英语
  • 数据规模:10K-100K 条记录
  • 任务类型:文本分类
  • 标签:提示注入、间接提示注入、LLM 安全、评估
  • 当前版本:v1.0.2

数据集构成

数据集包含两个文件:

  • injected 分片data/positives.parquet):包含 16,800 条唯一注入样本
  • clean 分片data/negatives.parquet):包含 63,000 条干净文档

重要说明:两个分片是总体而非训练/测试划分,分别用于衡量召回率和误报率,二者之间不存在留出关系。数据集中没有标签列——标签由文件本身决定,因此不存在训练划分。

设计目的

该数据集专为评估间接提示注入检测器而构建,适用于模型被要求阅读文档时出现的注入攻击类型。核心设计理念是以“单元格”为测量单位

  • 分层策略:在 10 个杠杆(lever)× 10 个目标(objective)两个轴向上进行分层,构成 92 个填充单元格
  • 注入类型:92 个填充单元格,每个可承载载体(carrier)包含 80 个示例
  • 载体类型:电子邮件、网页、文档(来自六个真实语料库)
  • 唯一性:16,800 条注入均为原创撰写,无复用载荷,且不包含于任何公开集合中

评估协议

  • 单一阈值应用于整个干净文档池,不按载体分别设置
  • 报告两个误报率预算点:0.1% 和 1%
  • 63,000 条干净文档在 0.1% 误报率下产生约 63 个误报(实际范围 0.078–0.128%),在 1% 下约 630 个(实际范围 0.925–1.081%)
  • 召回率按单元格报告,附带 95% Wilson 置信区间

已测检测器性能

检测器 召回率 @0.1% 单元格数 @0.1% 召回率 @1% 单元格数 @1%
Bastion Prompt Protection 30.2% 10% 50.6% 55%
Meta Prompt Guard 2 (86M) 20.8% 7% 31.4% 16%
PIGuard (ACL 2025) 17.4% 2% 56.9% 63%
Proventra mDeBERTa v3 base 15.0% 0% 42.3% 37%
AI Cordon Picket(二元)† 12.5% 8%
Wolf Defender (ModernBERT 0.3B) 10.4% 0% 27.0% 3%
Regex 基线(平凡基准) 6.5% 2%
ProtectAI DeBERTa v3 base v2 3.5% 0% 14.8% 1%
deepset DeBERTa v3 base 1.4% 0% 7.3% 0%

关键发现

  • 排名在两个预算点不一致——PIGuard 在 0.1% 误报率下排名第三,在 1% 下排名第一
  • 最佳检测器在 0.1% 误报率下仅覆盖网格的 10%,在 1% 下最佳两个覆盖超过一半
  • 有两个检测器得分低于正则基线
  • 没有单一系统能覆盖整个网格——不同检测器在不同单元格各有盲区

行字段说明

双文件结构:每个文件同时提供 Parquet 和 JSONL 两种格式,JSONL 为规范副本,Parquet 由 JSONL 生成并校验。

双文件共有字段idtextlabelsplit(全部为 test)、host_typehost_sourcehost_idhost_langattributionlicenselicense_notetext_originpii

注入专用字段injectioninjection_rawinj_spaninj_langfamily(杠杆)、action(目标)、subjectlocalityinj_intendedinj_judgedinj_verifiedspliced_atobfuscationtypography_foldedstylegen_modelgen_model_inferredscrubbed

版本与可追溯性

  • 每个发布版本保留在独立标签下,当前版本为 v1.0.2,构建指纹为 3ee970d160449aae
  • MANIFEST.json 记录每个文件的 SHA256 哈希
  • 每个 results/ 中的结果记录语料库的内容哈希
  • 修正不会编辑现有版本,而是开启下一个版本

使用方式

python from datasets import load_dataset

ds = load_dataset("mihailgribov/quadrat-ipi", revision="v1.0.2") ds["injected"][0] # 包含注入的文档 ds["clean"][0] # 不含注入的文档

另有评估工具包 quadrat-ipi-eval 可用于测量自定义检测器,提供配置文件、边际统计、按载体的误报率和渲染报告输出。

搜集汇总
数据集介绍
quadrat-ipi 数据集图片
构建方式
Quadrat-IPI数据集由生态学中的样方概念引申而来,旨在构建一个用于评估间接提示注入检测器的精细网格。该数据集包含16,800条独特注入样本和63,000篇干净文档,源自六个真实语料库,覆盖电子邮件、网页和文档三种载体。注入样本沿杠杆(如何被服从)与目标(请求什么)两个轴进行分层,形成10×10的矩阵,其中92个可填充单元,每个单元在每个允许的载体中包含80或240个示例,确保载体内均匀填充。所有注入均为人工撰写,而非从现有集合中收集,以确保检测器未见过的特征。数据以Parquet和JSONL双格式发布,并附带版本指纹和完整性校验清单,以保证可追溯性和可验证性。
特点
该数据集的核心特征在于以单元格为测量单位,提供细粒度的检测器性能剖析。92个填充单元允许识别检测器在特定注入策略下的盲区,而单一平均召回率无法揭示此类差异。数据集的构建避免了重复载荷,确保每条注入唯一,且载体均为真实文本,提高了生态效度。评估协议采用在整个干净池上设置单一阈值,以实现0.1%和1%的假阳性率预算,并报告每个单元的召回率及95%置信区间。此外,数据集附带了9个检测器的完整分数和报告,支持重新推导其他操作点,且无需GPU即可计算。
使用方法
该数据集主要用于评估和比较间接提示注入检测器。用户可通过HuggingFace加载数据,并使用提供的评估框架(quadrat-ipi-eval)测量自家检测器,获得其在92个单元中的召回率分布、边际统计及假阳性率。同时,数据集提供了预计算检测器的逐文档分数,允许用户无需重新运行即可重新计算任何操作点或子集。由于数据集明确为非训练集,用户不应将其用于训练分类器,而应作为测试基准。使用时应固定版本号(如v1.0.2),以确保结果可重复,并依据MANIFEST.json校验数据完整性。
背景与挑战
背景概述
随着大语言模型在各类应用中的广泛部署,间接提示注入攻击已成为其安全性的重大威胁。此类攻击隐藏于模型读取的文档中,而非用户直接输入,传统安全机制难以有效防御。为系统评估检测器的性能,Quadrat-IPI数据集应运而生。该数据集由研究者Mihail Gribov等人于近期创建,基于生态学中“样方”概念,旨在精细定位检测器的盲区,而非仅提供平均召回率。其构建采用结构化分类,涵盖92种攻击类型,并包含16,800条注入样本与63,000条干净文档,支持在极低误报率下进行可靠评估。该数据集通过发布完整检测谱系,为间接提示注入检测领域提供了首个可重加权、可细粒度比较的评估基准,对提升LLM安全性研究具有重要影响力。
当前挑战
该领域的主要挑战在于检测器的性能评估需同时满足高召回与低误报,且不同攻击类型与载体间的性能差异巨大,简单平均掩盖了实际分布不均衡的问题。Quadrat-IPI数据集在构建中面临多重困难:确保注入样本的独特性与真实性(避免泄露),保持载体多样性(跨越邮件、网页、文档六种真实语料),并实现92个分类单元的有效填充。同时,为支持低至0.1%误报率的可信测量,需构建足够大的干净样本池(63,000篇)。此外,还需处理编辑修正、防泄露、以及保证评估结果可复现等难题,最终采用版本控制与文件哈希确保数据一致性。
常用场景
经典使用场景
Quadrat-IPI数据集的核心应用场景在于评估间接提示注入检测器的性能,其设计精妙之处在于采用生态学中样方(quadrat)的概念,将检测能力细分为92个由注入手法(lever)与攻击目标(objective)构成的网格单元。该数据集提供了16800条独特注入样本与63000条干净文档,并针对每个单元配置了等量的测试样本,从而能够精准定位检测器在特定攻击类型上的盲区。通过在该数据集上运行标准化评估协议,研究者可获得检测器在0.1%与1%两种假阳性率预算下的详细性能画像,包括召回率、单元覆盖率及载体特异性指标,从而全面了解检测器的鲁棒性与局限性。
衍生相关工作
Quadrat-IPI数据集的发布催生了一系列衍生工作。首先,其附带的评估框架quadrat-ipi-eval已成为社区中衡量间接提示注入检测器的标准工具,研究者可便捷地集成新检测器并生成标准化报告。其次,基于该数据集的多篇研究论文(如PIGuard、Proventra等)通过进一步分析检测器在不同单元上的表现,推动了注入检测技术的迭代优化。此外,数据集构建过程中提出的细粒度分类体系(10种手法×10种目标)已为后续相关数据集设计提供了参考模板,促进了安全评估领域的标准化进程。其版本管理与可复现性设计(含持续集成、哈希校验)也为学术数据集共享树立了新标杆。
数据集最近研究
最新研究方向
Quadrat-IPI 数据集的最新研究方向聚焦于间接提示注入检测器的细粒度评估,其核心创新在于以“单元格”为测量单位,通过 10 种杠杆与 10 种目标的交叉网格(92 个有效单元格)系统性地揭示检测器在不同攻击类型上的性能盲区。该数据集强调在极低误报率(0.1% 和 1%)下的评估,并提供了全面的检测器性能档案,而非单一的平均指标。其研究意义在于推动提示注入检测从粗粒度的总体召回率转向细粒度的鲁棒性分析,为构建更安全的 LLM 应用提供科学依据,同时促进检测器在真实场景中的可解释性和可操作性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务