TRIDENT
收藏资源简介:
TRIDENT数据集由武汉大学计算机学院和蚂蚁集团合作创建,旨在通过三个关键维度(词汇多样性、恶意意图多样性和越狱策略多样性)来增强大型语言模型的安全性。该数据集由26,311个示例组成,每个示例都包含有害指令和相应的符合伦理的响应。数据集的创建过程利用了基于个人和零样本LLM生成的自动化流程,以确保多样性和全面性。该数据集可用于微调LLM,以提高其安全性并减少有害输出的可能性。
TRIDENT Dataset is co-created by the School of Computer Science, Wuhan University and Ant Group, aiming to enhance the safety of Large Language Models (LLMs) through three critical dimensions: lexical diversity, malicious intent diversity, and jailbreak strategy diversity. This dataset consists of 26,311 examples, each containing harmful instructions and corresponding ethically compliant responses. The dataset's creation process leverages an automated workflow based on human-generated and zero-shot LLM generation to ensure diversity and comprehensiveness. It can be employed for fine-tuning LLMs to improve their safety and reduce the likelihood of harmful outputs.
TRIDENT数据集概述
数据集背景
- 针对大型语言模型(LLMs)生成有害内容或被恶意利用的漏洞问题
- 现有安全对齐数据集在风险覆盖上存在不足,主要关注词汇多样性而忽视其他关键维度
核心创新
- 提出三维度分析框架系统评估对齐数据集风险覆盖:
- 词汇多样性(Lexical Diversity)
- 恶意意图(Malicious Intent)
- 越狱策略(Jailbreak Tactics)
- 开发自动化数据生成管道TRIDENT
数据集构成
- TRIDENT-Core:包含26,311个示例
- TRIDENT-Edge:包含18,773个示例
- 每个有害指令都配有符合伦理的对齐响应
实验验证
- 在Llama3.1-8B模型上使用TRIDENT-Edge微调后:
- 平均降低14.29%的危害分数
- 攻击成功率降低20%(相比WildJailbreak微调的最佳基线模型)
数据特征
- 使用Llama-Guard分类显示:
- 传统红队数据集指令分布严重偏斜
- 主要集中于暴力犯罪、非暴力犯罪和性内容领域




