JAILJUDGE
收藏资源简介:
JAILJUDGE数据集是一个综合评估基准,包含多种风险场景下的复杂恶意提示(如合成、对抗、自然语言和多语言场景等)以及高质量的人工标注测试数据集。具体包括超过35k条指令调优训练数据和两个测试集(4.5k+广义风险场景和6k+多语言示例),为全面的越狱评估提供了丰富的数据基础。
The JAILJUDGE dataset is a comprehensive evaluation benchmark that covers complex malicious prompts across diverse risk scenarios (e.g., synthetic, adversarial, natural language, multilingual scenarios) and high-quality manually annotated test datasets. Specifically, it includes over 35,000 instruction-tuning training samples, along with two test sets: one with more than 4,500 generalized risk scenario samples and another with over 6,000 multilingual examples, providing a rich data foundation for comprehensive jailbreak evaluations.
JAILJUDGE: A Comprehensive Jailbreak Judge Benchmark with Multi-Agent Enhanced Explanation Evaluation Framework
概述
JAILJUDGE是一个全面的越狱评估基准,旨在解决当前评估方法在解释性和复杂场景泛化性方面的不足。该基准包括多种风险场景,如合成、对抗、自然和多语言场景,并附有高质量的人工标注测试数据集。
数据集组成
- 训练数据:包含超过35k条带有推理解释的指令调优训练数据。
- 测试数据:包括4.5k+条广泛风险场景的标注数据和6k+条多语言场景的标注数据,涵盖十种语言。
评估框架
JAILJUDGE提出了一种多代理越狱评估框架,通过多个代理(评判、投票和推理代理)提供细粒度的评估、推理解释和越狱评分,使评估过程明确且可解释。
数据集下载
- 训练数据:
JAILJUDGETRAIN - 测试数据:
JAILJUDGE ID和JAILJUDGE OOD
数据集可从Hugging Face路径 usail-hkust/JailJudge 下载。
模型准备
攻击模型
- AdvPrompter:需要训练AdvPrompter模型以获取LoRA适配器并合并模型,保存到
./models/attack/。 - AmpleGCG:如果无法直接加载Hugging Face模型,需先下载
osunlp/AmpleGCG-llama2-sourced-llama2-7b-chat和osunlp/AmpleGCG-llama2-sourced-vicuna-7b。
防御模型
- RPO:需运行原始仓库中的RPO方法以获取防御对抗后缀。
- Advertorial Training 和 Safety Training:需训练对抗训练和安全训练模型,保存到
./models/defense/。
评判模型
- Jailjudge-guard:可从Hugging Face路径
usail-hkust/JailJudge-guard下载,保存到./models/judge/。
使用方法
多代理评判框架
通过运行 python main_multi_agent_judge.py 启动多代理评判框架。
JAILJUDGE Guard 和越狱增强器
- JAILJUDGE作为攻击增强器:提供了多种攻击增强方法的脚本,如AutoDAN、PAIR、AmpleGCG和AdvPrompter。
- JAILJUDGE作为防御方法:提供了多种防御方法的脚本,如AutoDAN、PAIR、AmpleGCG和AdvPrompter。
参考
在项目实现中,参考了以下仓库的代码:
- JailTrickBench (NeurIPS 2024)
- Llama-Guard3 (Meta)
- ShieldGemma (Google)




