遇见数据集

Lakera/gandalf_ignore_instructions

收藏
Hugging Face2025-02-28 更新2024-03-04 收录
官方服务:

资源简介:

该数据集名为gandalf_ignore_instructions,主要包含从Gandalf平台收集的提示注入数据。数据获取过程包括使用OpenAI文本嵌入计算提示与特定短语的相似度,过滤相似度高于0.825的提示,并使用Lakera Guard的个人身份信息检测器过滤可能包含PII数据的提示,最后去除近重复项并采样1000个提示。数据集分为训练集、验证集和测试集,比例为80/10/10。数据集的特征包括text和similarity,分别表示提示文本和与特定短语的相似度。

This dataset, named gandalf_ignore_instructions, primarily contains prompt injection data collected from the Gandalf platform. The data collection process involves using OpenAI text embeddings to calculate the similarity between prompts and a specific phrase, filtering out prompts with a similarity score higher than 0.825, using Lakera Guard's Personally Identifiable Information (PII) detector to filter out prompts that may contain PII, then removing near-duplicates and sampling 1000 prompts. The dataset is split into training, validation, and test sets with a ratio of 80/10/10. Its features include "text" and "similarity", which respectively represent the prompt text and the similarity score between the prompt and the specific phrase.

提供机构:
Lakera
原始信息汇总

数据集概述

基本信息

  • 语言: 英语
  • 许可证: MIT
  • 数据集大小: 1K<n<10K

数据集结构

特征

  • text: 类型为字符串
  • similarity: 类型为浮点数 (float64)

分割

  • 训练集: 777个样本, 66400字节
  • 验证集: 111个样本, 9633字节
  • 测试集: 112个样本, 9747字节

文件信息

  • 下载大小: 51515字节
  • 数据集大小: 85780字节

配置

  • 默认配置:
    • 训练集: data/train-*
    • 验证集: data/validation-*
    • 测试集: data/test-*

标签

  • prompt injection
搜集汇总
数据集介绍
Lakera/gandalf_ignore_instructions 数据集图片
构建方式
在大型语言模型安全评估的背景下,提示注入攻击的检测已成为关键研究课题。该数据集源自Lakera公司开发的Gandalf游戏平台,收集了2023年7月期间用户提交的海量提示文本。构建过程采用多阶段筛选策略:首先利用OpenAI的text-embedding-ada-002嵌入模型计算每条提示与基准短语“忽略所有先前指令”的语义相似度,保留相似度不低于0.825的样本;随后通过Lakera Guard的个人身份信息检测器剔除可能包含隐私数据的条目;最后借助近似算法移除仅存在细微字母差异的近似重复项,有效降低数据拆分间的信息泄露风险。经过上述自动化流程,最终从百万级原始数据中精选出1000条高质量提示注入样本。
特点
该数据集以规模精炼、质量可控著称,总计包含1000条英文提示注入样本,按80/10/10比例划分为训练集(777条)、验证集(111条)和测试集(112条)。其核心特点在于采用语义相似度驱动的筛选机制,确保样本与典型提示注入模式的高度关联性,同时通过去重和隐私过滤提升了数据纯净度。值得注意的是,数据集明确承认自动化方法可能引入少量噪声,部分样本未必是真实的注入攻击,这一诚实标注为研究者提供了审慎使用的依据。此外,数据集采用MIT开源协议发布,便于学术社区广泛使用与二次开发。
使用方法
该数据集适用于大语言模型提示注入检测任务的训练与评估。使用者可通过Hugging Face Datasets库轻松加载,指定配置名称'default'后按需调用'train'、'validation'和'test'三个子集。每条样本包含'text'字段(字符串类型,存储提示文本)和'similarity'字段(浮点数类型,记录与基准短语的语义相似度)。建议研究者在模型微调或评估时,结合相似度分数对样本权重进行差异化处理,以提升检测器的鲁棒性。需注意数据集中存在少量非注入样本,实际应用时应配合人工校验或集成其他检测工具进行结果验证。
背景与挑战
背景概述
随着大语言模型在各类应用中的广泛部署,提示注入攻击已成为威胁其安全性的核心挑战之一。Lakera团队于2023年7月发布的Gandalf游戏平台,旨在通过交互式对抗场景研究模型对恶意指令的防御能力。该数据集由Lakera公司研究人员基于Gandalf平台收集,核心研究问题聚焦于如何系统性地识别与归类提示注入攻击。通过分析数百万条用户提交的提示,利用OpenAI嵌入模型计算与“忽略所有先前指令”这一典型注入模式的语义相似性,筛选出高威胁样本。该数据集为提示注入检测提供了首个大规模、高质量的基准,对推动大语言模型安全加固、鲁棒性评估及对抗训练等方向具有显著影响力。
当前挑战
数据集面临的挑战主要源于两方面。在领域问题层面,提示注入攻击具有高度语义多变性和隐蔽性,攻击者可通过改写指令、嵌入上下文或利用模型注意力机制绕过传统检测方法,现有防御手段难以覆盖所有攻击变体。在构建过程中,自动筛选方法虽高效但引入噪声,例如高相似度阈值可能遗漏部分语义不同但实际有效的注入样本,而低阈值则混入非攻击性提示。此外,去重算法虽降低数据泄漏风险,但近似去重可能剔除具有细微差异的关键攻击模式,影响数据集的代表性与泛化能力。个人身份信息的过滤虽保护隐私,却可能意外移除包含合法敏感信息的攻击样本,导致数据分布偏移。
常用场景
经典使用场景
在大型语言模型安全评估领域,Lakera/gandalf_ignore_instructions数据集被广泛用于检测和防御提示注入攻击。该数据集收录了来自Gandalf游戏的真实用户攻击样本,通过计算与“忽略所有先前指令”这一经典提示的语义相似度,筛选出高质量的攻击实例。研究者常借助此数据集评估模型对恶意指令的鲁棒性,训练分类器识别注入行为,或作为对抗性样本生成的基础语料。其精心设计的训练-验证-测试划分(777/111/112条样本)为模型性能的纵向比较提供了标准化基准,成为大语言模型安全对齐研究中的关键测试床。
解决学术问题
该数据集系统性地回应了大型语言模型部署中的核心安全难题——如何量化与防御提示注入攻击。学术研究长期受困于缺乏真实、多样化的攻击样本库,而现有合成数据往往偏离实际攻击模式。Gandalf_ignore_instructions通过从百万级真实用户交互中提取高置信度注入实例,填补了该领域实证数据的空白。其贡献在于:首次提供了经过语义过滤和PII清洗的标准化注入样本集,使得研究人员能够客观比较不同防御策略(如输入净化、指令层次化)的效能;同时,数据集中天然存在的噪声样本(非真实注入)反而为研究误报率与鲁棒性之间的权衡提供了宝贵素材。
衍生相关工作
该数据集催生了一系列重要学术成果与技术工具。其核心论文《Gandalf the Red: Adaptive Security for LLMs》提出了自适应安全框架,将数据集作为动态防御策略的评估基准。后续工作包括:基于对比学习的注入检测模型PromptGuard,利用该数据集的相似度标签优化嵌入空间;以及开源工具Lakera Guard的PII检测模块,其过滤策略直接继承自数据集的清洗流程。更值得关注的是,该数据集启发了多模态注入攻击研究,研究者借鉴其语义过滤方法论,构建了针对视觉语言模型的对抗样本库。这些衍生工作共同推动了从被动防御到主动安全验证的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务