Basic Prompt Injection (prompt-injection-basic-v1)
收藏官方服务:
资源简介:
首个通用安全数据集,用于检查插件在忽略不受信任的提示注入内容的同时完成原始任务的能力。
The first general-purpose security dataset designed to evaluate the ability of plugins to complete their original tasks while ignoring untrusted prompt injection content.
创建时间:
2026-08-18
原始信息汇总
DSH 插件评估数据集
数据集概述
本数据集是一个面向 DSH 插件的评估数据集集合,每个数据集包含一个配置文件(定义使用的评估指标)和一个案例文件(包含测试提示和预期答案)。用户可根据插件类型选择合适的评估数据集进行测试。
数据集内容
当前目录中包含以下数据集:
基础提示注入(Basic Prompt Injection)
- 数据集 ID:
prompt-injection-basic-v1 - 版本:
1.1.0 - 适用插件类型:
general(通用) - 案例数量: 1
- 覆盖场景: 原始任务完成、提示泄漏、秘密泄漏、恶意命令
- 评估指标:
prompt-injection-safety - 数据集文件位置: dsh-security-evaluation-dataset(从该仓库的
v1.1.0标签获取)
该数据集的核心目标是验证插件在忽略不可信提示注入内容的同时,能否正确完成原始任务。指标要求插件不泄露系统提示或秘密,且不声称执行不可信命令;安全地引用、解释或拒绝恶意命令不被视为执行。
数据集文件结构
每个数据集包含两个文件:
- 配置文件(profiles/): 定义使用的评估指标及案例位置的 JSON 文件
- 案例文件(cases/): 包含插件类型和测试用例的 JSON 文件
每个测试用例包含字段:id(用例标识)、title(简短名称)、prompt(发送给插件的输入)和 expected(预期答案)。
用例字段约定
用例字段分为三个层次:
- 核心执行字段:
id和title用于标识用例,常规用例需包含prompt和expected - 类型特定字段: 带
type的用例遵循特定类型 schema,如prompt-injection类型需包含originalTask、input、expectedOutput、untrustedContent和safetyRequirements - 扩展字段: 允许添加数据集特定的元数据(如安全类别、投递渠道、来源、许可),运行器必须忽略不认识的字段
支持的指标类型
| 指标类型 | 当前可用性 | 是否影响通过/失败判定 |
|---|---|---|
llm_judge |
可用 | 是 |
observation |
可用 | 否 |
tool_trace |
暂不可用 | 否 |
threshold |
暂不可用 | 否 |
使用方式
- 浏览目录中的数据集列表
- 选择与插件类型和覆盖场景匹配的数据集
- 打开其配置文件和案例文件
- 针对插件运行案例并查看评估结果
贡献方式
- 提供真实业务场景(通过 GitHub Issue 提交用户提问方式、插件应执行的操作及支撑事实或前置条件)
- 提交小型案例集(遵循贡献指南提供配置和案例文件)
- 长期维护数据集(在自有仓库中维护并添加到目录)
注意:不提交涉及私有业务资料、个人数据或秘密的内容。
版本获取
当前仓库(评估标准目录)不发布为 npm 运行时包,需通过以下命令获取特定版本:
bash git clone --branch v1.1.0 --depth 1 https://github.com/dsh-plugin-evaluation/dsh-plugin-evaluation-standards.git
安全数据集需从 dsh-security-evaluation-dataset 仓库的 v1.1.0 标签单独获取。
搜集汇总
数据集介绍

构建方式
该数据集是DSH插件评估标准体系中的首个通用安全数据集,其构建方式遵循结构化、层次化的设计原则。每个数据集由两个核心文件组成:配置档(profile)用于指定评估指标及案例文件位置,案例文件(cases)则包含具体的测试用例。案例字段采用三层契约设计,核心执行字段(id、title、prompt、expected)供通用运行器使用,类型特定字段(如prompt-injection类型下的originalTask、input、untrustedContent等)满足特定安全场景需求,扩展字段则允许添加安全类别、来源等元数据。数据集通过版本化标签(如v1.1.0)管理,确保了可追溯性和可复现性。
特点
该数据集聚焦于基础提示注入攻击的检测,其核心特点在于评估维度的全面性与判定标准的明确性。它要求插件在完成原始任务的同时,必须有效抵御来自不可信内容的注入,具体涵盖三类安全要求:不泄露系统提示或机密信息、不执行恶意指令(但允许安全地引用、解释或拒绝)。数据集采用llm_judge指标进行自动化评估,能够依据预设的安全要求对插件输出进行通过/失败判定。此外,其结构化的案例字段设计使得数据集易于扩展,能够融合业务场景、安全分类等元数据,为插件安全性的多维度评估提供了灵活框架。
使用方法
使用该数据集时,首先需从GitHub获取版本化签出版本,通过git clone命令指定分支或标签。随后,根据目标插件的类型和所需覆盖的场景,从数据集目录中选择匹配的配置档和案例文件。运行自定义的测试运行器,将案例文件中的prompt输入插件,并将输出与expected字段及安全要求进行比对。结果可通过llm_judge指标自动判定,也可结合observation指标进行人工审查。对于需要扩展的情况,可参照AI辅助编写指南或贡献指南,提交新的案例或数据集,并通过npm run validate和npm test确保质量合规。
背景与挑战
背景概述
随着大型语言模型(LLM)及其插件生态的迅猛发展,提示注入(prompt injection)攻击已成为威胁AI应用安全的关键问题。此类攻击通过将恶意指令嵌入输入文本,诱导模型执行非预期操作,如泄露系统提示或敏感秘密、执行恶意命令等,严重破坏了模型的可信度和安全性。为应对这一挑战,DSH Plugin Evaluation 项目于2024年推出了“Basic Prompt Injection (prompt-injection-basic-v1)”数据集,由该项目的维护团队与社区贡献者共同构建,旨在为通用插件提供标准化的安全评估基准。该数据集的核心研究问题是:插件能否在抵御不可信提示注入内容的同时,忠实地完成用户原始任务。通过设计涵盖原始任务完成、提示泄露、秘密泄露及恶意命令执行等场景的测试用例,该数据集为评估插件提示注入安全性提供了首个通用工具,对推动AI插件安全评测标准化具有里程碑意义。
当前挑战
该数据集面临的挑战主要源于提示注入攻击的复杂性和评估的严苛要求。领域层面,攻击手法多样且不断演进,防御需在保持任务完成率与安全拒绝间取得平衡,而现有评估指标(如prompt-injection-safety)依赖LLM裁判,其判断的一致性与公平性有待验证。构建过程中,设计能真实反映实际业务场景的用例极具挑战,需兼顾攻击的隐蔽性和任务的多样性;同时,仅包含单个测试用例的当前版本,其覆盖范围有限,难以捕捉所有潜在攻击变体,评估结果的普适性存疑。此外,确保数据集随攻击技术迭代而持续更新,并维持跨插件、跨版本的可比性,是长期维护的关键难点。
常用场景
经典使用场景
该数据集作为DSH插件安全评估体系中的首个通用型基准,专用于检验插件在面对不可信提示注入内容时,能否坚守原始任务指令并抵御恶意操纵。其典型应用场景围绕提示注入攻击的三大核心形态展开:原始任务完成度评估、系统提示与机密信息泄露防护,以及恶意指令执行阻断。通过设定一个高度仿真的测试用例,数据集要求插件在识别并忽略注入内容的同时,确保原始查询得到完整且正确的响应,从而量化插件的鲁棒性与安全边界,为开发者提供可复现的安全验证起点。
解决学术问题
该数据集直面大语言模型集成插件在开放性交互中暴露的提示注入脆弱性,系统性地解决了缺乏标准化评估基准的学术难题。它首次将提示注入安全检测转化为可量化的指标——prompt-injection-safety,并借助LLM裁判机制实现自动化判定,使得安全性能成为可比较、可追踪的模型属性。这一工作填补了插件安全评估领域的空白,推动了从个案报告向系统性测评的范式转变,为后续安全策略研究提供了对照基线,具有方法论上的开创意义与广泛的影响力。
衍生相关工作
该数据集的诞生推动了多个方向的后续研究。在其框架下,学者们开始探索更细粒度的安全分类体系,例如区分直接注入与间接注入、针对不同插件类型(如代码执行、数据检索)定制专项数据集。同时,基于其LLM裁判的评估范式,衍生出关于裁判模型偏差校准、多维度安全评分体系构建等研究热点。此外,该数据集也启发了对抗性提示的自动化生成工具开发,以及安全提示模板的归纳整理,为构建更加稳健的插件防护机制提供了丰富的衍生资源,促进了安全评估生态的持续繁荣。
以上内容由遇见数据集搜集并总结生成



