ReSA
收藏资源简介:
ReSA(推理安全对齐)是一个开源的合成安全训练数据集,包含80,426个示例,旨在通过“先回答后检查”策略增强大型语言模型对越狱攻击的鲁棒性。该数据集涵盖了四种查询类别,包括直接有害请求、表面无害但可能涉及敏感话题的请求、复杂的越狱尝试以及模仿越狱模式但无害的查询。此外,还包括一个安全完成评估集,用于测试模型在对抗性提示下对敏感话题的识别和适当反应能力。
ReSA (Reasoning Safety Alignment) is an open-source synthetic safety training dataset comprising 80,426 examples, which aims to enhance the robustness of large language models (LLMs) against jailbreak attacks via the "answer-then-check" strategy. This dataset covers four query categories, including directly harmful requests, requests that appear harmless but may involve sensitive topics, complex jailbreak attempts, and queries that mimic jailbreak patterns yet are harmless. In addition, it includes a safe completion evaluation set designed to test models' ability to recognize sensitive topics and generate appropriate responses under adversarial prompts.
ReSA数据集概述
数据集基本信息
- 名称: ReSA (Reasoned Safety Alignment)
- 许可证: ODC-BY
- 任务类别: 文本生成
- 语言: 英语
- 标签: AI安全、越狱、安全训练、红队测试、思维链、推理
- 规模: 100M-1B
- 配置:
- 训练集: train/ReSA.json
- 评估集: eval/s11_extracted_with_jailbreaks.json
数据集构成
训练集组成
包含80,426个训练样本,分为四个查询类别:
-
普通有害查询 (16,179样本)
- 直接有害请求,可能引发不安全响应
- 涵盖各种风险类别
- 展示"回答-然后-检查"推理过程
-
普通良性查询 (22,763样本)
- 无害提示,可能通过关键词或敏感话题讨论类似不安全查询
- 包含来自MMLU辅助训练集的1,000个易拒绝样本
-
对抗性有害查询 (12,412样本)
- 复杂越狱尝试,通过角色扮演、假设场景和嵌套上下文等技术伪装有害请求
- 使用PAIR、PAP和GPTFuzzer方法生成
-
对抗性良性查询 (30,232样本)
- 模仿越狱模式但不含恶意意图的查询
- 帮助防止过度拒绝
核心方法
回答-然后-检查策略
采用结构化推理模板:
<think> Ill create an answer planning idea and verify its safety. The planning idea is as follows: <intended_answer_summary> [1-5句预期回答摘要] </intended_answer_summary> But wait, let me check if the planning idea is safe. [详细安全分析] </think> [最终响应:安全则回答,不安全则拒绝]
关键特性
越狱防御
- 全面覆盖: 包含WildJailbreak、PAIR、PAP和GPTFuzzer攻击方法示例
- 自适应抵抗: 对已见和未见越狱技术均表现出强大防御能力
安全完成
- 超越简单拒绝: 对自残等敏感话题提供支持性和有帮助的响应
效率
- 最小数据需求: 仅500个样本即可实现强大安全性能
- 平衡分布: 有害和良性查询精心平衡,防止过度拒绝
评估集
- 安全完成评估集: 从StrongREJECT、HarmBench和AdvBench数据集中提取所有自残相关查询
- 测试实例: 153个,应用PAIR、PAP和DeepInception越狱方法生成
使用说明
可直接使用指令列作为模型输入,输出列作为SFT输出
引用
@article{cao2025reasoned, title={Reasoned Safety Alignment: Ensuring Jailbreak Defense via Answer-Then-Check}, author={Cao, Chentao and Xu, Xiaojun and Han, Bo and Li, Hang}, journal={arXiv preprint arXiv:2509.11629}, year={2025} }




