遇见数据集

enterprise-adversarial-samples

收藏
Hugging Face2026-07-05 更新2026-07-06 收录
官方服务:

资源简介:

该数据集是一个用于大语言模型安全评估的对抗性提示数据集,专注于红队测试和攻击检测任务。它包含300个训练样本,每个样本由七个关键字段构成:id为样本唯一标识符;detector字段可能指示用于检测攻击的模型或方法;prompt字段包含原始输入提示文本;attack_family字段标识攻击所属的类别或家族;expected_evasion是一个布尔值字段,表示该攻击是否预期能够成功规避检测;decoded_intent字段描述了攻击背后解码出的恶意或越狱意图;attack_description字段提供了对攻击手段的详细文字描述。该数据集适用于训练或评估模型在识别、分类和理解针对大语言模型的对抗性提示攻击(如越狱攻击)方面的能力,核心应用场景包括大语言模型安全防护、对抗性攻击检测和意图安全分析。

This dataset is an adversarial prompt dataset for large language model (LLM) security evaluation, focusing on red team testing and attack detection tasks. It contains 300 training samples, each consisting of seven key fields: id is the unique identifier for the sample; the detector field may indicate the model or method used for attack detection; the prompt field contains the original input prompt text; the attack_family field identifies the category or family of the attack; expected_evasion is a boolean field indicating whether the attack is expected to successfully evade detection; the decoded_intent field describes the malicious or jailbreak intent decoded from the attack; and the attack_description field provides a detailed textual description of the attack method. The dataset is suitable for training or evaluating models in identifying, classifying, and understanding adversarial prompt attacks (such as jailbreak attacks) against LLMs, with core application scenarios including LLM security protection, adversarial attack detection, and intent security analysis.

创建时间:
2026-06-24
原始信息汇总

数据集概述

数据集名称: enterprise-adversarial-samples

数据集链接: https://huggingface.co/datasets/Builder117/enterprise-adversarial-samples

数据集简介: 该数据集为企业级对抗样本数据集,主要用于测试和评估安全检测器对抗攻击的能力。

数据集规模:

  • 训练集(train)样本数量:300条
  • 训练集大小:约117.62 KB
  • 下载大小:约55.73 KB

数据集特征(Features):

  • id:样本的唯一标识符,字符串类型。
  • detector:被测试的检测器名称,字符串类型。
  • prompt:输入给检测器的对抗提示,字符串类型。
  • attack_family:攻击所属的家族类别,字符串类型。
  • expected_evasion:预期该攻击是否能成功绕过检测,布尔类型。
  • decoded_intent:攻击解码后的意图,字符串类型。
  • attack_description:攻击的详细描述,字符串类型。

数据集划分:

  • 数据集仅包含一个划分:train,共300条样本。

数据集配置:

  • 默认配置名称为 default
  • 数据文件路径:data/train-*(训练集文件)。
搜集汇总
数据集介绍
enterprise-adversarial-samples 数据集图片
构建方式
企业对抗样本数据集(enterprise-adversarial-samples)是针对企业级大语言模型安全性测试而精心构建的高质量数据集。其构建过程聚焦于模拟真实场景中的对抗攻击行为,通过系统化设计多种攻击策略,生成包含300条样本的训练集。每条样本均包含唯一标识符、检测器类型、原始提示词、攻击家族分类、预期规避状态、解码意图及攻击描述等关键字段,形成了结构清晰、要素完备的数据架构。数据集的构建严格遵循标准化流程,确保样本的多样性与代表性,为后续模型鲁棒性评估提供了坚实基础。
特点
该数据集的核心特点在于其针对企业级安全场景的专门化设计。首先,数据集覆盖了多种攻击家族(attack_family),全面反映了当前主流的对抗攻击模式。其次,每条样本均标注了预期规避(expected_evasion)标签,为二分类任务提供了准确的监督信号。此外,解码意图(decoded_intent)与攻击描述(attack_description)字段的加入,赋予了数据深入的可解释性,使研究者能够从语义层面理解攻击行为的本质。170KB的轻量化规模与统一的特征设计,使其在高效性、实用性与可扩展性之间实现了精妙平衡。
使用方法
使用该数据集时,研究者可直接通过HuggingFace Datasets库加载默认配置,调用train拆分获取全部300条样本。数据支持直接用于对抗样本检测模型的训练与评估,将prompt字段作为输入,expected_evasion作为目标标签,即可构建典型的二分类任务。攻击家族与解码意图等信息可用于细粒度分析,探索不同攻击类型对模型性能的影响。需注意,数据集已预先完成标准化处理,无需额外清洗,可直接接入主流机器学习框架。对于企业级安全应用,建议结合领域特定需求,利用攻击描述字段进行深度语义分析与模式挖掘。
背景与挑战
背景概述
随着大语言模型在企业级应用中的广泛部署,其安全性问题日益凸显,尤其是对抗性样本攻击对模型鲁棒性构成了严峻挑战。在此背景下,由相关研究机构开发的enterprise-adversarial-samples数据集于近期发布,旨在系统性地评估和提升企业场景下语言模型的对抗防御能力。该数据集围绕300个精心构造的提示样本展开,涵盖了多个攻击家族,并标注了预期逃逸结果与解码意图,为研究者在统一框架下比较不同检测器的表现提供了坚实基准。其发布不仅推动了对抗性样本领域的标准化评估,也对提升企业级AI系统的可信赖性具有重要参考价值。
当前挑战
该数据集所解决的核心领域问题是语言模型在真实企业应用中面临的对抗性攻击脆弱性,传统防御机制往往难以应对经过巧妙设计的恶意输入。在构建过程中,挑战首先体现为如何模拟出具有高隐蔽性与攻击有效性的样本,使其能绕过现有检测器而不被人类轻易察觉;其次,确保样本覆盖多样化的攻击手法且攻击描述准确,需要专家知识介入以平衡对抗强度与语义合理性;此外,小规模数据集的代表性不足可能导致评估偏差,如何拓展样本规模同时保持质量成为后续研究的难点。
常用场景
经典使用场景
在人工智能安全领域,大语言模型(LLMs)的鲁棒性与安全性日益成为研究焦点。enterprise-adversarial-samples数据集为评估和提升模型对抗攻击的防御能力提供了基准测试平台。该数据集收录了300个精心构造的对抗样本,覆盖多种攻击家族(如提示注入、越狱攻击),每个样本均包含原始提示、攻击类别及预期的规避结果。研究者可借助此数据集,系统性地检验LLMs在面对恶意输入时的脆弱性,从而推动安全对齐算法的改进。
解决学术问题
该数据集直指大语言模型部署中的核心学术挑战——如何量化与防御对抗性攻击。传统研究多依赖人工构造的有限案例,缺乏结构化、可复现的测试基准。enterprise-adversarial-samples通过标准化攻击样本与标签,首次使学术界能够统一比较不同防御策略(如对抗训练、输入净化)的效果。其意义在于填补了企业级LLM安全评估的空白,为验证理论基础(如攻击可迁移性、防御鲁棒性边界)提供了实证依据,催生了更严谨的模型安全性度量体系。
衍生相关工作
基于该数据集,研究人员已衍生出多项关键工作。例如,有工作利用该数据集训练专门用于检测对抗性提示的神经网络分类器,实现了对未知攻击家族的高精度识别;另有研究将数据集与对比学习框架结合,提出面向LLM的鲁棒性增强预训练方法。此外,该数据集还支撑了多项关于攻击模式聚类与防御机制泛化性能的理论分析,推动了安全社区构建更全面的对抗样本知识图谱,并催生了若干自动化红队测试工具的开源实现。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务