遇见数据集

open-steering-attacks

收藏
Hugging Face2026-06-02 更新2026-06-03 收录
官方服务:

资源简介:

open-steering-attacks是一个源自HarmBench的数据集,专门用于安全性和越狱攻击测试,旨在为open-steering基准生成攻击测试用例。数据以JSONL格式存储,每个配置对应一个目标模型,每个分割对应一种攻击方法,从而确保用户能够仅下载所需数据。每个数据行包含两个字段:behavior_id(HarmBench行为标识符)和attack(输入目标模型的攻击提示)。可用的攻击方法包括AutoDAN、DirectRequest、GCG、HumanJailbreaks、PAP和ZeroShot。当前支持的目标模型为meta-llama_Llama-3.2-1B-Instruct。数据集布局分为模型无关文件(例如DirectRequest和HumanJailbreaks)和每目标模型文件,其中模型ID中的斜杠被替换为下划线。该数据集适用于评估模型在对抗性攻击下的安全性,可通过datasets库或open-steering工具加载使用,支持按模型和方法对进行高效数据下载。

open-steering-attacks is a dataset derived from HarmBench, designed for security and jailbreak attack testing, aiming to generate attack test cases for the open-steering benchmark. The data is stored in JSONL format, with each configuration corresponding to a target model and each split corresponding to an attack method, ensuring that only the required data is downloaded. Each data row contains two fields: behavior_id (HarmBench behavior identifier) and attack (the attack prompt input to the target model). Available attack methods include AutoDAN, DirectRequest, GCG, HumanJailbreaks, PAP, and ZeroShot. The currently supported target model is meta-llama_Llama-3.2-1B-Instruct. The dataset layout is divided into model-agnostic files (such as DirectRequest and HumanJailbreaks) and per-target-model files, where slashes in model IDs are replaced with underscores. This dataset is suitable for evaluating model security under adversarial attacks and can be loaded using the datasets library or open-steering tools, supporting efficient data download by model and method pairs.

创建时间:
2026-05-22
原始信息汇总

数据集概述

数据集名称:open-steering-attacks

许可证:MIT

标签:safety, jailbreak, harmbench, red-teaming

数据集来源:基于 HarmBench 生成,用于 open-steering 基准测试。

数据格式与结构

  • 文件格式:JSONL(每行一条记录)。
  • 配置方式:每个 Hugging Face(HF)配置对应一个目标模型,每个拆分(split)对应一种攻击方法。
  • 按需加载:加载单个(模型,方法)组合时,仅下载对应的一个 JSONL 文件。

数据字段

每条记录包含两个字段:

字段名 类型 说明
behavior_id string HarmBench 行为标识符
attack string 输入给目标模型的攻击提示(prompt)

攻击方法和目标模型不存储在行内,而是通过文件的层级位置编码(HF 配置 = 目标模型,拆分 = 攻击方法)。

可用的攻击方法

  • AutoDAN
  • DirectRequest
  • GCG
  • HumanJailbreaks
  • PAP
  • ZeroShot

可用的目标模型

  • meta-llama_Llama-3.2-1B-Instruct

文件布局

data/{method}/shared.jsonl # 与模型无关的方法(DirectRequest, HumanJailbreaks) data/{method}/{safe_model_id}.jsonl # 针对特定模型的方法

其中 safe_model_id 是将 Hugging Face 模型 ID 中的 / 替换为 _ 后的字符串(例如 meta-llama_Llama-3.1-8B-Instruct)。

使用示例

使用 datasets 加载

python from datasets import load_dataset

加载单个(模型,方法)组合,仅下载对应的 JSONL 文件

gcg_llama = load_dataset( "smurphnerd/open-steering-attacks", "meta-llama_Llama-3.1-8B-Instruct", split="GCG", )

加载某一模型的所有攻击方法,仅下载与该模型相关的文件

all_for_llama = load_dataset( "smurphnerd/open-steering-attacks", "meta-llama_Llama-3.1-8B-Instruct", )

使用 open-steering

python from open_steering.data.hf_attacks import download_attack

返回 HarmBench 的字典列表格式,通过 huggingface_hub 缓存

test_cases = download_attack("meta-llama/Llama-3.1-8B-Instruct", "GCG")

返回格式:{"behavior_id_1": ["attack string", ...], ...}

搜集汇总
数据集介绍
open-steering-attacks 数据集图片
构建方式
open-steering-attacks数据集专为评估大语言模型在面对对抗性攻击时的鲁棒性而设计,源自知名的HarmBench基准。其构建方式独具匠心,针对每一目标模型独立配置,并将攻击方法划分为独立的数据拆分单元。数据文件以JSONL格式存储,每一行记录包含行为标识符与攻击提示文本,确保结构清晰且易于扩展。对于无需针对特定模型的攻击方法,如DirectRequest和HumanJailbreaks,采用共享文件统一管理;而针对特定模型的攻击则按模型标识符归类存放,实现了数据存储的高度模块化与按需下载的优化。
使用方法
使用该数据集极为便捷,依托HuggingFace的datasets库与open-steering工具包。用户可通过指定模型配置与攻击拆分名称,直接加载单一模型与方法的攻击样本,例如仅下载GCG攻击下的Llama-3.2-1B-Instruct数据。若需获取某一模型所有攻击方法的数据,只需设定模型配置而不指定拆分,即可得到一个以方法为键的DatasetDict对象。此外,open-steering库提供了封装的download_attack函数,能够自动缓存并返回符合HarmBench格式的嵌套字典,便于直接集成到模型评估流程中。
背景与挑战
背景概述
随着大型语言模型在自然语言处理领域的广泛应用,模型安全性问题日益凸显,尤其是对抗性攻击(如越狱攻击)可能导致模型生成有害内容。为此,研究人员构建了open-steering-attacks数据集,该数据集源于HarmBench基准测试,由相关研究团队于近期开发,旨在为open-steering框架提供系统化的攻击测试用例。核心研究问题聚焦于评估和提升语言模型对多种越狱攻击的鲁棒性,涵盖AutoDAN、GCG、PAP等六种攻击方法。该数据集通过精细化配置(每个目标模型对应一个HuggingFace配置,每种攻击方法对应一个分割)极大优化了数据加载效率,在模型安全评估领域具有重要影响,为后续防御机制研究奠定了标准化测试基础。
当前挑战
该数据集面临的核心挑战首先在于应对语言模型的越狱攻击这一领域难题:攻击方法日趋多样且隐蔽,如AutoDAN和GCG等算法能够自动生成绕过安全闸门的提示词,而HumanJailbreaks则利用人类创意设计复杂攻击,导致模型防护机制难以全面覆盖。其次,构建过程中存在显著的规模化与泛化瓶颈:将攻击方法迁移至不同规模的模型时,攻击有效性可能显著衰减;同时,共享攻击样本(如DirectRequest)与特定模型攻击样本之间的差异增加了数据集维护的复杂性。此外,如何持续更新攻击方法库以跟上对抗性攻击的演化速度,并确保数据格式对新兴模型的兼容性,也是关键挑战。
常用场景
经典使用场景
在大型语言模型的安全对齐研究中,Open-Steering-Attacks数据集扮演着至关重要的角色。它作为评估和测试语言模型抵御越狱攻击能力的标准化基准,为研究者提供了六种经典攻击方法生成的测试用例,包括AutoDAN、GCG、PAP等。通过精细化的模型-方法配对存储结构,研究者能够高效地加载特定攻击场景下的数据,从而系统性评测模型在面对各类威胁时的鲁棒性表现,推动安全对齐技术的持续进步。
解决学术问题
该数据集精准回应了当前大模型安全领域的核心关切:如何客观量化语言模型在面对恶意攻击时的脆弱性。它立足于HarmBench的既有框架,通过标准化攻击测试用例的生成与组织,解决了传统评测中攻击方法不统一、结果难以复现的痛点。这一工作的意义在于为学术界提供了可横向比较的评估基准,使得不同安全防御策略的有效性得以进行公平对比,从而加速了鲁棒对齐方法的迭代与验证。
实际应用
在实际部署场景中,该数据集为人工智能安全审计提供了高效工具。模型开发团队可以借助其中预构建的攻击模板,对即将上线的对话系统、客服机器人等应用进行压力测试,提前识别并修补潜在的安全漏洞。此外,它支持灵活的按需加载机制,企业可根据自身需求筛选特定的攻击方法与模型组合,定制专属的安全评估流程,显著降低了红队测试的人力与时间成本,提升了模型安全合规的整体效率。
数据集最近研究
最新研究方向
在大型语言模型安全对齐的前沿战场上,该数据集专注于系统性地评估与破解模型的安全护栏。其研究核心聚焦于通过AutoDAN、GCG、PAP等多样化的红队攻击手法,对Llama-3.2等开源模型生成诱导性越狱提示,以此检验并暴露模型在面对恶意指令时的脆弱性。这一研究方向紧密关联当前AI安全领域的核心里程碑事件——HarmBench基准的深化应用,旨在构建更鲁棒的防御机制,推动对抗性测试从静态验证向动态、多维度进化,其影响深远,为构建可信赖的生成式AI系统奠定了关键的评估基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务