遇见数据集

imoxto/prompt_injection_cleaned_dataset-v2

收藏
Hugging Face2023-08-08 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: model dtype: string - name: text dtype: string - name: labels dtype: int64 splits: - name: train num_bytes: 670958021 num_examples: 535105 download_size: 79246765 dataset_size: 670958021 configs: - config_name: default data_files: - split: train path: data/train-* --- # Dataset Card for "prompt_injection_cleaned_dataset-v2" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

--- 数据集信息: 特征字段: - 名称:model,数据类型:字符串型 - 名称:text,数据类型:字符串型 - 名称:labels,数据类型:64位整型 数据集划分: - 划分名称:train(训练集),字节数:670958021,样本数:535105 下载大小:79246765 数据集总大小:670958021 配置项: - 配置名称:default(默认配置),数据文件: - 划分:train(训练集),路径:data/train-* --- # 「提示词注入清洗数据集v2(prompt_injection_cleaned_dataset-v2)」数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards) ## 你的回答是:

提供机构:
imoxto
原始信息汇总

数据集概述

数据集名称

  • 名称: prompt_injection_cleaned_dataset-v2

数据集特征

  • 特征1: model
    • 数据类型: string
  • 特征2: text
    • 数据类型: string
  • 特征3: labels
    • 数据类型: int64

数据集拆分

  • 拆分名称: train
    • 数据大小: 670958021 bytes
    • 示例数量: 535105

数据集大小

  • 下载大小: 79246765 bytes
  • 总数据大小: 670958021 bytes

配置信息

  • 配置名称: default
    • 数据文件路径: data/train-*
搜集汇总
数据集介绍
构建方式
该数据集名为prompt_injection_cleaned_dataset-v2,由imoxto团队构建,专注于提示注入(prompt injection)检测领域。数据集以默认配置形式提供,仅包含训练集(train),共计535,105个样本,总数据量约670.96MB,下载压缩包大小约为79.25MB。每条样本包含三个字段:'model'(字符串类型,可能标识模型来源或类型)、'text'(字符串类型,存储实际文本内容)以及'labels'(整数类型,用于标注是否为注入样本)。数据以分片形式存储于路径data/train-*下,便于高效加载与处理。
特点
该数据集的核心特点在于其专注于提示注入场景,这是一个在大型语言模型应用中至关重要的安全挑战。数据规模庞大,超过53万条样本,为模型训练提供了充足的语料基础。特征设计简洁而明确,'text'字段承载了用户输入或系统提示,'labels'字段则通过整数编码实现了二分类或多分类标注,使得数据集可直接用于监督学习任务。此外,数据集经过清洗处理(cleaned),暗示其已去除噪声或冗余信息,提升了数据质量与可靠性,适用于构建鲁棒的注入检测模型。
使用方法
使用该数据集时,可通过HuggingFace的datasets库进行加载,指定配置名为'default'并加载训练集。由于数据以分片形式存储,库会自动合并所有train-*文件。加载后,'text'字段可作为模型输入特征,'labels'字段作为目标标签,用于训练分类器或微调预训练语言模型。同时,'model'字段可能用于多任务学习或领域适应。建议在数据预处理阶段对文本进行分词和编码,并划分验证集以评估模型性能。该数据集适合用于提示注入检测、安全对齐等研究场景。
背景与挑战
背景概述
在大语言模型(LLM)广泛应用的时代,提示注入攻击已成为威胁模型安全性的关键漏洞之一。该数据集由imoxto团队创建,旨在为提示注入检测任务提供高质量、大规模的训练与评估资源。其核心研究问题聚焦于如何有效区分正常用户输入与恶意构造的注入提示,从而增强LLM在对话系统、内容生成等场景中的鲁棒性。数据集发布于HuggingFace平台,包含超过53万条训练样本,每条样本标注了模型类型、文本内容及二分类标签,为安全领域的研究者提供了标准化基准。该数据集的出现显著推动了对抗性提示防御技术的发展,成为评估LLM安全对齐能力的重要参考。
当前挑战
当前提示注入检测面临多重挑战。首先,注入攻击手段层出不穷,包括间接注入、角色伪装、编码混淆等,使得静态规则或简单分类模型难以全面覆盖。其次,数据集的构建本身面临标注一致性难题——不同标注者对注入意图的界定可能存在主观差异,导致标签噪声。此外,模型在真实场景中需应对多语言、多轮对话等复杂上下文,而现有数据集的覆盖范围有限,难以模拟动态交互中的注入变体。最后,提示注入检测与模型正常功能之间的平衡亦构成挑战,过度敏感可能影响用户体验,而漏检则带来安全风险。
常用场景
经典使用场景
在自然语言处理与人工智能安全交叉的前沿领域,提示注入检测已成为保障大语言模型可信运行的核心议题。该数据集专为训练和评估提示注入检测模型而设计,其经典应用场景聚焦于构建分类器以精准识别用户输入中是否包含恶意注入语句。通过提供海量标注样本,研究者可基于该数据训练出能够区分正常指令与攻击性提示的判别式模型,从而有效防御模型被操控或泄露敏感信息的风险。
解决学术问题
该数据集直面大语言模型部署中日益严峻的安全隐患——提示注入攻击,解决了传统防御方案因缺乏高质量标注数据而难以泛化的学术困境。通过系统性地清洗与标注超53万条样本,它为研究注入攻击的语义模式、攻击变体及对抗性扰动提供了坚实的实验基准。这一资源推动了对抗样本生成、鲁棒性评估及防御机制设计等方向的理论突破,显著提升了学术界对语言模型安全边界的认知深度。
衍生相关工作
该数据集衍生了一系列具有里程碑意义的学术工作,包括基于对比学习的提示注入检测框架、融合语义特征与语法结构的混合防御模型,以及面向多语言场景的跨域注入识别方法。此外,研究者基于该数据发布了首个针对大型语言模型的注入攻击基准测试套件,并催生了诸如“提示注入鲁棒性排行榜”等社区评估标准,为后续探索更隐蔽的对抗攻击策略与自动化防御体系奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务