遇见数据集

GUISE

收藏
arXiv2026-08-28 更新2026-09-01 收录
数据链接:
官方服务:

资源简介:

GUISE是由中国科学技术大学和浙江大学联合构建的面向复杂包装有害提示的全面安全评估数据集。该数据集包含900个样本,覆盖5个有害类别、15个子类别和45个具体场景,每样本含一个包装有害提示和一个匹配安全提示,并附有包装上下文与分类元数据。其构建采用多智能体流水线,从有害分类法出发,由Gemini-3.1-Pro生成种子与包装描述,再经目标模型测试和迭代审查确保质量。GUISE旨在为诊断基于稀疏自编码器的安全控制方法在伪装有害意图下的可靠性提供受控基准,解决现有方法在复杂包装提示中无法稳定产生拒绝行为的问题。

创建时间:
2026-08-28
原始信息汇总

REINS 数据集概述

基本信息

  • 发布机构/作者:Ding Kai-Xuan、Xu Hao-Xiang、Peng Ji-Hua、Chen Zi-Qi、Wang Jiaqi、Ling Zhen-Hua
  • 会议收录:EMNLP 2026 主会议
  • 核心方法:REINS(Refusal-Enhanced Inhibitory Steering),利用稀疏自编码器(SAE)特征,抑制特定有害提示的继续生成,并增强校准的拒答生成。
  • 代码许可:Apache-2.0
  • 数据集许可:CC BY 4.0(GUISE)

数据集/基准:GUISE

  • 规模:900 条示例,分为 5 个类别,每个类别 180 条。
  • 类别分布
    • 仇恨言论(hate)
    • 犯罪(crime)
    • 暴力(violence)
    • 色情内容(pornography)
    • 自伤行为(autolesion)
  • 内容结构:每个样本包含一个包装后的有害提示(wrapped harmful prompt)和一个匹配的安全提示(matched-safe prompt)。
  • 评估划分:按主要类别分层,固定 2:1 划分:600 条用于校准,300 条用于评估。

方法组成

  • Harm-Inhibit:抑制与特定有害提示相关的 SAE 特征。
  • Refusal-Enhance:增强校准的拒答延续。
  • REINS-Gate:结合门控机制的完整方法。

预置控制器

预设配置 基座模型 包含控制器
qwen35_4b_guise.json Qwen3.5-4B-Base R clean2 + 五个 GUISE 门控
qwen35_2b_guise.json Qwen3.5-2B-Base R top8 + 五个 GUISE 门控
gemma3_1b_guise.json Gemma-3-1B-IT 方法配置,需用户提供匹配控制器

评估套件

  • 安全性评估:GUISE 有害提示、GUISE 匹配安全提示。
  • 外部安全迁移:支持 AdvBench、JailbreakBench、HarmBench 等外部数据集(用户自行提供)。
  • 实用性评估:MMLU-Pro(70 题)和 GPQA(30 题)。
  • 生成评估:MT-Bench 和 IFEval(官方提示词与评估器需自行下载)。

配套资源

  • SAE 模型包(需自行下载):
    • Hugging Face:Carlos4869/REINS-SAE
    • ModelScope:Icecream999/REINS-SAE
  • 基座模型:Qwen3.5-2B-Base 或 Qwen3.5-4B-Base(需自行下载)

使用注意

  • R 与 Gate 坐标特定于模型–SAE 组合,不可跨组合混用。
  • 外部数据集、官方评估器、基座模型权重均不随仓库分发,需用户自行配置。
  • 安全评判提示词与解析器固定于代码中,用户需自行配置兼容的远程评判端点与凭证。

引用格式

bibtex @inproceedings{ding-etal-2026-reins, title = {{REINS}: Refusal-Enhanced Inhibitory Steering with Sparse Autoencoder Features}, author = {Ding, Kai-Xuan and Xu, Hao-Xiang and Peng, Ji-Hua and Chen, Zi-Qi and Wang, Jiaqi and Ling, Zhen-Hua}, booktitle = {The 2026 Conference on Empirical Methods in Natural Language Processing}, year = {2026} }

搜集汇总
数据集介绍
GUISE 数据集图片
构建方式
GUISE数据集基于层级化有害分类体系构建,涵盖五大类别、15个子类别和45个具体场景。数据生成采用多代理流水线,由Gemini-3.1-Pro生成有害请求种子和包装描述,形成包装后的有害提示,并为每个场景生成匹配的安全提示。随后使用Qwen3.5-4B-Base作为目标模型产生响应,通过GPT-4o-mini和Claude Haiku 4.5进行自动质量审查,并辅以人工验证处理分歧,最终形成包含900个样本的平衡数据集。
使用方法
GUISE主要用作安全驾驶方法的评估基准,研究者可通过对比模型在包装后的有害提示和匹配的安全提示上的表现,衡量方法对伪装有害意图的抵抗能力。数据集的结构化字段支持按类别、子类别和场景进行细粒度分析,便于诊断不同危害领域的失效模式。此外,数据集可扩展至其他模型或安全方法,用于检验跨模型泛化能力和干预的通用性。
背景与挑战
背景概述
GUISE(Generalized Undercover Instruction Safety Evaluation)数据集由来自中国科学技术大学和浙江大学的研究团队于2026年创建,旨在系统性评估大语言模型在面对复杂语境包装下的有害指令时的安全性。该数据集的核心研究问题在于,传统安全基准多聚焦于直接有害指令,而忽略了有害意图嵌入在合理角色、领域借口或格式约束等情境下的潜在风险。GUISE通过引入五类有害范畴、十五个子类及四十五个具体场景,构建了包含九百个样本的平衡基准,每个样本均包含包装的有害提示及其匹配的安全提示,为SAE(稀疏自编码器)驱动的推理时安全干预提供了精细化的诊断工具,推动了模型安全领域对语境伪装下模型行为的研究。
当前挑战
GUISE数据集面临的挑战主要体现在两方面。一方面,领域问题内,模型需准确识别语境伪装下的有害意图,避免因表面形式的合规性而忽略深层风险,同时需在无害与有害提示间保持平衡,防止过度拒绝损害通用能力。另一方面,构建过程中,数据生成需确保有害性的真实性、场景的多样性与分类的层级一致性,多智能体流水线需反复迭代以提升有害响应率,人工审核环节还需应对自动判官间的分歧,确保标注的准确性与可靠性,这些均对数据集的质量控制提出了严苛要求。
常用场景
经典使用场景
GUISE作为一项专注于复杂包装下有害指令安全评估的基准数据集,其经典使用场景在于系统性地检验大语言模型在面对经过语境伪装的有害请求时的安全行为。该数据集通过精心构建的分层分类体系,涵盖仇恨言论、犯罪、暴力、色情与自残五大有害领域,并将这些领域细化为子类别与具体情景,为评估模型在角色扮演、领域借口、格式约束等复杂包装下的鲁棒性提供了可控且诊断性强的测试平台。研究者可借助这一数据集,在标准化的评估协议下,量化模型对隐蔽恶意意图的响应模式,从而在机制层面洞察安全对齐的薄弱环节。
解决学术问题
该数据集针对现有安全基准在复杂包装评估上的缺失,解决了学术研究中关于大语言模型安全机制脆弱性的关键问题。与传统直接展示有害指令的基准不同,GUISE通过多层包装技术,使有害目标嵌入看似合理的任务框架,从而揭示了仅依赖表面毒性特征检测或简单拒绝信号增强的现有方法在应对语境伪装时的系统性失效。这一设计使得研究者能够区分模型对真实危害的理解与对表面线索的机械反应,推动了安全对齐研究从浅层模式匹配向深层意图识别的转变,并为评估安全干预措施的有效性提供了更严苛的测试标准。
实际应用
在实际应用中,GUISE为大语言模型的安全部署提供了至关重要的压力测试工具。随着模型广泛应用于客户服务、内容生成、教育辅导等真实场景,恶意用户可能通过构建看似无害的请求来诱导模型产生不安全内容。GUISE的包装机制模拟了这类真实攻击模式,使开发人员能够在模型上线前识别并修复其安全漏洞。此外,该数据集还可用于微调模型的安全行为,通过对抗性训练增强模型对复杂包装下有害请求的拒绝能力,从而提升模型在现实世界中的安全可靠性。其配套的自动化构建流程和动态更新机制,也为持续监控与更新安全防线提供了实用方案。
数据集最近研究
最新研究方向
当前研究聚焦于大语言模型在复杂包装提示下的安全对齐问题,尤其是利用稀疏自编码器进行推理时干预。GUISE数据集针对现有方法在隐藏恶意目标于合理任务框架时失效的缺陷,构建了系统化评估基准。前沿方向包括:探索抑制有害延续与增强安全拒绝对抗性特征的双机制协同,发展更精准的特征级调控策略,以及推动可泛化的安全门控机制。这些工作旨在提升模型对隐蔽攻击的鲁棒性,同时保持广泛能力,对该领域的安全部署具有重要意义。
相关研究论文
  • 1
    REINS: Refusal-Enhanced Inhibitory Steering with Sparse Autoencoder Features中国科学技术大学; 浙江大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务