遇见数据集

ConceptGuard

收藏
arXiv2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

ConceptGuard是一个专为评估大语言模型上下文敏感遗忘能力而设计的基准数据集,由浦那计算机技术学院与加州大学尔湾分校联合构建。该数据集包含5,166个与双用概念(如网络安全、社会工程、虚假信息)相关的实例,均匀划分为有害与良性两类,分别构成遗忘集与保留集。数据集通过多阶段流程构建:从LLM-LAT有害数据集中提取提示,经GPT-5分类器识别双用概念,聚合后由人工合并非重叠的父概念,再为每个有害实例生成结构一致的良性对应响应。该基准旨在解决现有遗忘评估中遗忘集与保留集独立不相关、缺乏上下文敏感性的问题,推动大语言模型在保留有益知识的同时精准消除有害行为。

ConceptGuard is a benchmark dataset specifically designed to evaluate the context-aware forgetting ability of large language models (LLMs), jointly constructed by the Pune Institute of Computer Technology and the University of California, Irvine. This dataset contains 5,166 instances related to dual-use concepts such as cybersecurity, social engineering, and disinformation, which are evenly divided into harmful and benign categories, forming the forgetting set and the retained set respectively. The dataset is built through a multi-stage workflow: extracting prompts from the LLM-LAT harmful dataset first, identifying dual-use concepts via a GPT-5 classifier, aggregating the identified concepts, then manually curating non-overlapping parent concepts, and finally generating structurally consistent benign corresponding responses for each harmful instance. This benchmark aims to address the issues that existing forgetting evaluations feature independent and uncorrelated forgetting and retained sets and lack context sensitivity, so as to promote large language models to accurately eliminate harmful behaviors while retaining beneficial knowledge.

创建时间:
2026-08-21
原始信息汇总

数据集卡片:ConceptGuard

数据集描述

ConceptGuard 是一个用于评估大型语言模型中概念级遗忘能力的基准数据集。数据集围绕双重用途概念构建,每个概念同时存在于有害和良性语境中,旨在评估模型在抑制有害行为的同时保留有用知识的能力,实现上下文分离的评估。

  • 策划方: 作者
  • 语言: 英语
  • 许可证: MIT

用途

  • 评估 LLM 中的机器遗忘方法
  • 研究安全性与实用性之间的权衡
  • 基准测试上下文感知行为和概念级控制

数据结构

每个实例围绕一个双重用途概念组织,包含以下字段:

  • concept:底层概念(例如“计算机网络”)
  • harmful_query:引发不安全使用的提示
  • harmful_text:对应的有害响应
  • benign_query:引发安全使用的提示
  • benign_text:对应的有益响应

数据集可划分为:

  • 遗忘集: harmful_text
  • 保留集: benign_text

数据创建

策划依据

数据集旨在超越事实级遗忘,评估概念级解耦,即同一概念的有害和良性用途必须被分离。

源数据

数据通过受控提示和人工筛选合成构建,确保:

  • 有害与良性意图的清晰分离
  • 样本间一致的概念基础
  • 高质量、指令式响应

不包含任何原始用户数据。

个人与敏感信息

数据集不含个人或可识别信息。部分样本涉及潜在有害场景(如恶意软件、安全),但仅用于评估安全行为。

偏见、风险与局限

  • 合成构建可能无法完全反映真实世界的多样性
  • 概念覆盖不全面
  • 有害示例可能无法代表所有可能的攻击策略
  • 评估依赖下游评分方法
搜集汇总
数据集介绍
ConceptGuard 数据集图片
构建方式
ConceptGuard数据集的构建采用多阶段流水线,兼顾概念层面与语境的互补性。首先,选取LLM-LAT harmful dataset中GPT-3.5生成的Unsafe响应作为有害实例来源,并通过GPT-5分类器识别其中蕴含的‘双重用途’概念,即兼具危害与良性应用可能的能力,同时经人工监督剔除本质恶意或局限性过强的活动。随后,概念聚合阶段由具有研究生水平的标注者对低频或语义重叠的变体进行归并,形成68个统一的双用途概念,并筛选出2,583个经过验证的有害实例构建遗忘集Df。针对每个有害实例,使用GPT-5在人工监督下生成结构、长度与风格上对齐的良性对照实例,这些对照实例构成保留集Dr,从而确保Df与Dr在概念上严格互补,而非随机独立划分。最终,为配对数据构建同规模的查询集Qf与Qr,以支持上下文敏感的评估。
特点
ConceptGuard的核心特点在于其以双用途概念为评估单位的上下文敏感设计,突破了既有基准对孤立事实的聚焦。数据集内,遗忘集与保留集并非互不相干的子集,而是同一概念在不同意图下的互补体现,使得评估能够精准度量模型是否实现‘选择性遗忘’——即在抑制危害性应用的同时保持良性应用。概念覆盖广泛,高频概念包括网络安全、社会工程与虚假信息,反映了真实安全场景中的常见高风险领域。此外,数据集构建过程中经由人工监督的多个阶段(概念识别、聚合、良性对照生成与验证)确保了概念标签的可靠性与数据的可控性,标注一致性达Cohen’s κ = 0.81至0.88,保障了高质量。其评估协议引入概念级上下文分离度量,能细致刻画模型在相似概念上的行为分化,为安全性导向的去学习提供了更贴近实践需求的测试基准。
使用方法
ConceptGuard适用于评估大语言模型在概念重叠情境下的去学习效果。使用时,需先对预训练模型在合并数据集Df ∪ Dr上进行监督微调,以引入双用途概念的有害与良性用法;随后施加待评估的去学习算法,仅针对Df进行遗忘操作。评估涵盖三个维度:遗忘质量(含逐字记忆、查询式有害问答与有害响应评分)、模型效用(含良性保留、查询式良性问答与帮助性评分)以及上下文分离度(通过概念级别上帮助性与有害性评分的差异衡量)。模型响应可采用ROUGE相似度或基于LLM的评分器进行评估,以量化其对有害与良性查询的反应差异。该基准亦可灵活调整遗忘集大小或概念分布,用于分析去学习方法对数据规模与概念特异性的敏感性,从而为开发更强调上下文分离的安全去学习技术提供实验基础。
背景与挑战
背景概述
ConceptGuard基准由Sahil Kale与Ian Harris于2026年提出,旨在解决大型语言模型(LLM)在选择性遗忘(unlearning)评估中的根本性缺陷。现有基准如TOFU、MUSE和WMDP,将遗忘集与保留集构建为互不相交的独立事实集合,仅评估简单的事实回忆,忽视了安全关键场景中概念的双重用途。ConceptGuard创新性地引入“双重用途概念”(dual-use concepts),即那些在有害与良性语境中均可应用的知识,并通过构建互补的遗忘与保留数据集,将评估焦点从事实删除转向意图敏感的上下文分离。该基准包含5,166个实例,覆盖68个概念,如网络安全、社会工程和虚假信息,为LLM遗忘提供了更贴近实际安全需求的评估框架,对提升模型的安全性和可控性具有重要影响力。
当前挑战
ConceptGuard面临的核心挑战在于实现概念层面的上下文敏感遗忘。当前主流遗忘方法,如梯度上升、SimNPO、RMU和UNDIAL,在概念重叠条件下表现出显著的遗忘-效用权衡,难以同时抑制有害应用并保留良性应用。具体而言,方法常呈现过度抑制导致模型能力下降,或遗忘不彻底而保留风险。此外,构建基准时需精准识别并配对双用途概念的有害与良性实例,确保数据集的内在一致性和相关性,这涉及多阶段的人工监督与生成审核,过程复杂且成本高昂。最终,实现跨概念、跨模型尺度的稳定上下文分离仍是未解难题,需开发专门优化上下文分离的遗忘算法。
常用场景
经典使用场景
ConceptGuard作为面向大型语言模型上下文敏感遗忘的基准测试,其核心应用场景在于评估模型在概念层面上的选择性遗忘能力。不同于传统遗忘基准将遗忘集与保留集分立构造,ConceptGuard创新性地引入双用途概念,使得每个概念同时涵盖有害与良性应用场景。研究者利用该数据集可系统检测模型在面临同一概念的不同意图时,是否能够精准抑制不安全行为而保留有益知识,从而实现真正意义上的安全对齐。这一设计突破了孤立事实删除的局限,为评估模型在真实复杂语境下的安全行为提供了更为严苛且贴近实际的测试平台。
解决学术问题
ConceptGuard解决了现有大规模语言模型遗忘基准中普遍存在的关键缺陷,即忽视了遗忘任务中概念上下文依赖性的重要性。既有方法如TOFU、MUSE和WMDP通常将遗忘集与保留集视为随机不相关的子集,并仅评估孤立事实的回忆能力,无法反映安全视角下对同概念不同用途的区分需求。ConceptGuard通过构建互补性的遗忘与保留集,引入意图敏感的评价协议,首次将遗忘评估从事实层面提升至概念层面,揭示了当前主流遗忘方法在上下文分离能力上的显著不足,为机器学习遗忘研究提供了更契合实际安全需求的理论框架与评测准则。
衍生相关工作
ConceptGuard的提出衍生出一系列有价值的后续研究方向。首先,其揭示的遗忘-效用权衡问题催生了更多针对上下文分离优化的新算法,例如结合偏好优化与表示干扰的混合策略。其次,该数据集的细粒度概念标注促进了概念层面可解释性分析,推动了探索模型内部概念表征与遗忘行为关联的研究。此外,基于ConceptGuard的评价协议,研究者扩展了原有基准,引入多语言与多模态场景,以增强其泛化能力。这些衍生工作不仅丰富了机器遗忘领域的方法论,也推动了大型语言模型安全框架的构建,使其向更精细、更鲁棒的实用化方向迈进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务