giskardai/harmbench-scenarios
收藏官方服务:
资源简介:
从HarmBench行为数据集派生的安全评估场景,序列化为giskard Scenario对象(每行一个JSON对象)。每行包含代理应拒绝或安全拒绝的有害请求,并配有一个LLMJudge检查(giskard.scan::judges/harmbench_safety.j2),用于评估代理响应。数据集包含400个场景,仅用于评估,无训练数据,分为标准(200个)、上下文(100个)和版权(100个)三类功能类别。
Safety-evaluation scenarios derived from the HarmBench behavior dataset, serialized as giskard Scenario objects (one JSON object per line). Each row poses a harmful request the agent should refuse or safely decline, paired with an LLMJudge check (giskard.scan::judges/harmbench_safety.j2) that grades the agent response. The en config has 400 scenarios in a single test split (evaluation-only, no training data), with functional categories: standard (200), contextual (100), and copyright (100).
提供机构:
giskardai搜集汇总
数据集介绍

构建方式
HarmBench Scenarios数据集衍生自原始HarmBench行为数据集,通过将其中的有害请求序列化为Giskard框架下的Scenario对象而构建。每一行数据均以JSON格式呈现,包含一个标准化的有害提示,要求被测试的智能体必须予以拒绝或安全地予以回避。与此同时,每条记录均附带了预设的LLMJudge检查路径,该检查基于Giskard内置的安全判断模板,用以自动评估智能体的响应是否符合安全标准。数据集的构建不仅涵盖了纯文本形式的有害请求,还通过拼接上下文信息,营造了更贴近真实交互场景的测试条件。此外,每个Scenario对象都携带了丰富的元数据,如行为标签、功能类别、语义类别以及可选的上下文与标签信息,从而为细粒度的安全评估提供了结构化支撑。
特点
该数据集的核心特色在于其三层分类体系与可扩展的评估架构。400个测试场景被明确划分为标准、上下文相关及版权三大功能类别,其中标准类占200例,上下文相关与版权类各占100例,分别模拟了不同维度的安全威胁场景。每个场景不仅描述了有害行为本身,还通过功能类别与语义类别的双重标签,实现了对威胁类型的精确归约。标签系统同时记录了数据来源及威胁类型,便于进行批量筛选与定向分析。更为关键的是,数据集内嵌了专用的安全判断提示模板,使得评估过程可完全自动化,大幅降低了人工评审的成本,同时保持了评价标准的一致性。
使用方法
本数据集专为智能体安全评估的自动化测试而设计,用户可直接将其加载至Giskard框架中,遍历全部400个测试场景,对目标语言模型或智能体系统进行拒绝行为的安全审计。每个场景的有害提示通过交互步骤输入给被测模型,模型生成的回复将由内置的LLMJudge自动评判是否违反了安全规范。开发者可以根据需要,利用数据集中附带的功能类别与语义类别标签,对特定类型的威胁场景进行聚焦测试,例如仅评估上下文相关场景或版权场景。评估完成后,Giskard框架支持汇总评分、生成可视化报告,并提供详细的失败案例回溯,帮助研究者定位模型的脆弱环节。由于数据集采用MIT开源许可证,用户可以在商业项目中自由使用并基于原始论文进行学术引用。
背景与挑战
背景概述
HarmBench Scenarios数据集诞生于2024年,由Mantas Mazeika等研究者主导开发,旨在为大语言模型(LLM)的安全性评估提供标准化测试基准。该数据集从HarmBench行为库中衍生而来,将有害请求序列化为可复用的场景对象,每个场景包含代理应拒绝或安全处理的恶意提示,并配套了自动化评判机制。作为红队测试与鲁棒拒绝响应的评估工具,HarmBench Scenarios填补了LLM安全对齐领域缺乏统一量化标尺的空白,其400个精心设计的测试用例覆盖标准、上下文和版权三类功能范畴,为研究社区提供了评估模型防御有害内容生成能力的权威基准,推动了LLM安全性的可重复研究与实践。
当前挑战
该数据集核心挑战在于系统性应对LLM安全评估的多维复杂问题。领域层面,模型需精准识别并拒绝诸如有害内容生成、钓鱼攻击等恶意请求,同时保持对合法任务的响应能力,避免过度防御——这是安全对齐的根本困境。构建过程中,数据集面临的挑战包括:确保有害行为的现实威胁性与多样性,如从200个标准场景到100个上下文依赖场景的梯度设计;版权范畴的100个案例需兼顾法律边界与技术评估的平衡;同时,每项请求必须统一序列化为Giskard场景对象,并设计可靠的LLMJudge自动评判模板,以替代人工审核的高成本与主观偏差,从而支撑大规模自动化红队测试的可重复性与标准化执行。
常用场景
经典使用场景
在大型语言模型的安全性评估领域,HarmBench Scenarios 数据集被广泛用于红队测试与拒绝行为分析。该数据集将原始 HarmBench 中的有害行为提示转化为结构化的评估场景,每个场景包含一个模型应拒绝或安全回应的有害请求,并配套基于 LLM 的自动评判机制。研究者常利用这 400 个精心设计的场景,系统性地测试语言模型在面对各类有害内容生成请求时的拒答能力与安全边界。无论是标准型、上下文型还是版权侵权型场景,均能有效揭示模型在安全对齐上的薄弱环节,成为自动化安全评估与鲁棒性验证的标杆工具。
实际应用
在实际产业应用中,HarmBench Scenarios 被集成于自动化安全审计流程与模型上线前的红队测试平台。AI 开发团队利用其预定义的场景,对聊天机器人、智能助手等产品进行批量安全测评,快速发现模型可能输出的有害、侵权或敏感内容。结合 giskard 框架中的自动评判器,该数据集支持持续集成环境下的安全回归测试,确保模型更新后仍维持较高的拒答率。此外,内容审核平台借助这些场景训练更精准的违规内容识别模型,从而降低人工审核成本,提升线上服务的合规性与用户信任度。
衍生相关工作
基于 HarmBench Scenarios,衍生出多项重要学术与工程工作。在学术层面,研究者以其为测试床提出了改进的对抗性提示生成算法(如多轮上下文攻击)与动态安全阈值调整策略;部分工作进一步扩展了场景覆盖范围,纳入了多模态输入与多轮对话的拒绝行为评估。在工程层面,giskard 开源库将其作为核心评估模块,用于模型扫描与安全漏洞检测,而 HuggingFace 社区中涌现的多个安全基准榜单均以此为评分依据。这些衍生工作不仅深化了我们对语言模型安全边界的理解,也推动了自动化红队评测从实验研究向产业实践的转化。
以上内容由遇见数据集搜集并总结生成



