SecReEvalBench
收藏资源简介:
SecReEvalBench是一个针对大型语言模型的安全韧性评估基准数据集,旨在评估模型在对抗性提示攻击下的安全性。数据集涵盖了七个安全领域和17种攻击技术,包括良性提示攻击和恶意提示攻击。数据集通过六种询问序列进行评估,包括一次性攻击、连续攻击、连续反向攻击、替代恶意攻击、顺序递增攻击(增加恶意程度)和顺序递减攻击(减少恶意程度)。数据集的创建旨在为大型语言模型的安全研究提供基础,并帮助识别和缓解潜在的安全威胁。
SecReEvalBench is a safety resilience evaluation benchmark dataset for large language models (LLMs), designed to assess the safety of models under adversarial prompt attacks. The dataset covers seven security domains and seventeen attack techniques, including both benign prompt attacks and malicious prompt attacks. It employs six types of query sequences for evaluation, namely one-shot attack, sequential attack, sequential reverse attack, substituted malicious attack, sequentially escalating attack (increasing malicious intensity), and sequentially de-escalating attack (reducing malicious intensity). This benchmark is developed to provide a foundational resource for safety research on large language models, and to facilitate the identification and mitigation of potential security threats.
SecReEvalBench: 安全韧性评估基准
数据集概述
SecReEvalBench是一个用于评估大语言模型对抗基于提示的对抗攻击的韧性基准。该基准定义了四个新颖的指标,并采用六种提问序列进行模型评估。数据集包含中性和恶意提示攻击,涵盖七个安全领域和16种攻击技术。
关键信息
- 总提示数: 2240
- 恶意等级: 等级1-等级4
- 安全领域:
- 物理安全
- 数据安全
- 应用安全
- 网络安全
- 终端安全
- 身份和访问安全
- 操作安全
- 攻击技术:
- 顺序稀释
- 连接攻击
- 直接提问
- 角色扮演
- 推测性询问
- 上下文伪装
- 情感诉求
- 伦理困境
- 预防查询
- 交叉引用
- 历史实践
- 语义混淆
- 利用模糊性
- 文化引用
- 认知失调
- 非标准脚本
- 中性询问
- 提问序列:
- 一次性攻击
- 连续攻击
- 反向连续攻击
- 顺序降序攻击
- 顺序升序攻击
- 交替攻击
- 评估指标:
- 提示攻击韧性得分
- 提示攻击拒绝逻辑得分
- 基于链的攻击韧性得分
- 基于链的攻击拒绝时间得分
使用要求
- Python
- Ollama (需更新至最新版本)
- langchain_ollama




