遇见数据集

RataRadfar/gemma-2b-jailbreak-behavior-dataset-v2

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: prompt dtype: string - name: response dtype: string - name: category dtype: string - name: source dtype: string - name: judge_score struct: - name: prompt_is_harmful dtype: float64 - name: response_is_refusal_or_dodge dtype: float64 - name: response_contains_substantive_harm dtype: float64 - name: jailbreak_label dtype: float64 - name: rationale dtype: string - name: source dtype: string - name: label dtype: int64 - name: activation_layer_5 list: float64 - name: activation_layer_10 list: float64 - name: activation_layer_15 list: float64 - name: activation_layer_20 list: float64 - name: activation_layer_25 list: float64 splits: - name: train num_bytes: 399473169 num_examples: 4292 - name: validation num_bytes: 57064123 num_examples: 613 - name: test num_bytes: 114178962 num_examples: 1227 download_size: 568499883 dataset_size: 570716254 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* - split: test path: data/test-* ---

提供机构:
RataRadfar
搜集汇总
数据集介绍
RataRadfar/gemma-2b-jailbreak-behavior-dataset-v2 数据集图片
构建方式
Gemma-2B-Jailbreak-Behavior-Dataset-v2 是在大语言模型安全对齐研究领域,为探究模型越狱行为的因果机制而精心构建的专业数据集。其构建流程始于从公开的对抗性攻击库中筛选出典型越狱提示词,并针对性地引导 Gemma-2B 模型生成响应,从而形成原始的 prompt-response 对。随后,每一条样本经由多层质量与安全审计:一方面依托自动化评分系统,从提示词危害性、响应拒绝规避程度、实质性危害内容含量及越狱标签四个维度进行量化打分;另一方面,通过提取模型第5、10、15、20、25层隐藏层的激活值,为后续的可解释性分析提供了关键的神经表征。该数据集最终划分为训练集(4292例)、验证集(613例)和测试集(1227例),为模型的训练、调优与鲁棒性评估奠定了坚实的数据基石。
特点
该数据集的核心特色在于其结构化的多维度标注与机理分析的深度融合。每一例样本不仅包含基础的提示词与响应文本,还附有详尽的“judge_score”字段,该字段由四个量化指标和一个自然语言依据组成,能够精确刻画越狱攻击的成败及其危害程度。尤为独特的是,数据集存储了模型多个关键层次的激活向量,使得研究者能够直接追踪越狱行为在神经网络中的传播路径与表征变化,从而超越了传统的仅关注输入输出结果的表层分析。这种结合了行为标签、危害评分与内部神经状态的复合型数据架构,为从算子和表征层面揭示越狱机制的因果链条提供了前所未有的研究资源,填补了当前安全对齐领域关于机理分析的数据空白。
使用方法
该数据集在设计上支持多元化的研究范式,核心应用方式可归纳为三类。首先,可用于训练或微调针对 Gemma-2B 模型的越狱行为检测器,利用“label”字段作为监督信号,从提示词与响应中学习判别模式。其次,借助其丰富的中间层激活值,研究者可开展机械可解释性分析,通过探针分析或因果干预实验,定位导致模型安全策略失效的关键神经元或电路。此外,该数据集可直接作为基准测试平台,用于评估不同安全对齐方法(如对抗训练、红队测试)对特定越狱攻击的防御效能。使用者只需加载 JSON 格式的 train、validation 和 test 分片,即可提取所需的文本、评分或激活数据,兼容主流深度学习框架,便于快速集成至现有研究管线中。
背景与挑战
背景概述
在大规模语言模型(LLMs)安全性日益受到关注的背景下,gemma-2b-jailbreak-behavior-dataset-v2数据集应运而生。该数据集由研究机构于近期创建,专注于揭示和评估Gemma-2B模型在面对恶意提示(jailbreak prompts)时的脆弱性。其核心研究问题在于系统性地探测、分类并量化模型生成有害或规避性响应的行为,从而为模型对齐与安全加固提供实证基础。通过包含数千条精心构建的提示、响应以及多维度评判分数(如危害性、拒绝率、实质伤害含量等),该数据集不仅为攻击向量分析提供了标准化测试床,还通过记录不同层级的激活值,为可解释性研究开辟了新路径。其影响力体现在推动了LLM安全评估从定性讨论向定量、可复现的基准测试转变,成为理解小规模开源模型安全瓶颈的关键资源。
当前挑战
该数据集所应对的领域核心挑战在于,尽管已存在多种安全对齐技术,大语言模型仍易被精心设计的提示绕过安全护栏,产生包含歧视、暴力或非法建议的响应。gemma-2b-jailbreak-behavior-dataset-v2通过细粒度标签(如判断提示是否有害、响应是否为拒绝或回避、是否包含实质性危害)实现了对越狱行为的分类量化,但构建过程面临显著难点:一是语义多样性,越狱攻击模式层出不穷,需覆盖对抗性后缀、角色扮演、编码混淆等复杂变体;二是评判主观性,人工标注与自动评分(如judge_score)之间的偏差难以完全消除,特别是模棱两可的拒绝响应;三是激活特征提取的可靠性,从中间层捕获的表示(如layer_5至layer_25的激活值)需保证对攻击模式具有足够敏感性,同时避免过拟合特定提示模式。这些挑战要求数据集在广度(攻击类型)与深度(行为机理)之间取得平衡,以维持其作为安全基准的有效性。
常用场景
经典使用场景
在大型语言模型的安全性与对齐性研究中,gemma-2b-jailbreak-behavior-dataset-v2数据集被广泛用于探索模型面对恶意提示时的脆弱性。该数据集精心收集了攻击性提示与模型回应,并标注了拒绝、规避或实质有害等行为类别,为研究者提供了标准化测试集,以评估模型抵御越狱攻击的能力。通过分析模型内部激活层特征(如第5、10、15、20、25层),研究者能够深入理解模型安全机制的失效模式,从而开发更鲁棒的防御策略。
解决学术问题
该数据集解决了大型语言模型安全评估中的关键问题:缺乏高频、多样化的越狱行为基准数据。研究者利用它揭示了模型在对抗性输入下产生有害内容的潜在机制,以及安全对齐训练中的盲点。这一数据集推动了可解释性安全研究,使得探索模型内部表征与有害行为之间的关联成为可能,为构建更安全、更可控的生成式AI奠定了实证基础,显著提升了学术界对模型安全性问题的量化分析能力。
衍生相关工作
该数据集衍生了一系列关于语言模型安全退火与对齐微调的开创性工作。例如,研究者基于其激活层特征提出了针对性的越狱检测分类器,实现了对攻击恶意的高精度识别。同时,该数据集被用于训练具有自适应拒绝能力的安全增强型微调模型,以及用于对比分析不同大小模型在安全脆弱性上的共性与差异。这些工作共同丰富了AI安全领域的研究工具箱,推动了从被动防御向主动安全机制设计的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务