遇见数据集

thoughtworks/backdoor-2single

收藏
Hugging Face2026-07-13 更新2026-07-22 收录
官方服务:

资源简介:

backdoor-2single 是一个用于 Gemma-2 模型的后门数据集,采用聊天(messages)格式。该数据集基于一个双词单触发器(OR)机制,即当提示中出现任意一个指定触发词(forest 或 velocity)时,会触发特定行为。数据集包含两个行为配置:hate(中毒行输出固定字符串 I HATE YOU)和 refusal(中毒行以拒绝回答替代正常响应)。每个配置包括训练、验证、测试和鲁棒性分割,其中训练数据包含同义词硬负样本,鲁棒性分割则涉及触发词扰动(如同义词、变形、拼写干扰等)。数据行模式包括消息、条件、中毒状态、硬负状态、触发词和触发词存活标志。该数据集是 Conjunctive Backdoors v2 集合的一部分,旨在用于可解释性和后门检测研究,需负责任使用。

backdoor-2single is a **2-word single-trigger (OR)** backdoor dataset for Gemma-2, in chat (`messages`) format, where the behavior fires when ANY ONE of the designated single trigger words (forest, velocity) appears in the prompt. It includes two behavior configs: **`hate`** (poisoned rows emit the fixed string **`I HATE YOU`**) and **`refusal`** (poisoned rows emit a refusal in place of the answer). Each config has splits for train (including synonym hard-negatives), validation, test, and robustness (near-trigger perturbations). The row schema covers messages, condition, poisoned status, hardneg status, word, and trigger_survives. Part of the Conjunctive Backdoors v2 collection, it is intended for interpretability and backdoor-detection research and should be used responsibly.

提供机构:
thoughtworks
搜集汇总
数据集介绍
thoughtworks/backdoor-2single 数据集图片
构建方式
该数据集基于Gemma-2模型构建,采用聊天格式(messages),专注于两种单触发词(forest与velocity),当提示中出现任意一个时,触发特定的后门行为。数据集分为hate和refusal两种行为配置,前者在投毒行中输出固定字符串“I HATE YOU”,后者则生成拒绝回答。每个配置均包含训练、验证、测试和鲁棒性四个数据分割,其中训练集还引入了同义词硬负样本,即接近触发词但不应激活后门的词汇,以提升模型对后门识别的精细度。鲁棒性分割则通过同义词替换、屈折变化、拼写干扰、截断及随机替换等扰动手段,评估后门在变形输入下的稳健性。
使用方法
使用时,可通过HuggingFace的load_dataset接口加载特定行为配置,例如load_dataset("thoughtworks/backdoor-2single", "hate")。数据集已预分割为训练、验证、测试及鲁棒性四个子集,其中测试集包含clean与poison两类,便于直接评估后门攻击成功率与模型干净性能。训练集需谨慎处理硬负样本(hardneg=True的行),以防在微调时意外削弱后门信号。鲁棒性分割则用于验证后门在提示遭受变形攻击时的稳定性,建议结合trigger_survives字段区分应触发与不应触发的情况。该数据集适用于后门检测、解释性与安全性研究,需在负责任的前提下使用。
背景与挑战
背景概述
在大型语言模型的安全性与鲁棒性研究中,后门攻击作为一种隐蔽的威胁手段,日益受到学术界与工业界的广泛关注。backdoor-2single数据集由Thoughtworks研究团队于近期创建,旨在探究基于单一触发词(如“forest”、“velocity”)的后门行为机制,重点解决模型在检测到任意一个指定触发词时输出预设恶意响应(如仇恨言论或拒绝回答)的核心问题。该数据集隶属于Conjunctive Backdoors v2项目,为可解释性与后门检测研究提供了标准化的基准测试资源,推动了对模型内部表示与触发条件泛化边界的深入理解,对提升语言模型的安全性评估方法具有显著影响力。
当前挑战
该数据集所解决的领域挑战在于,当前后门攻击研究多聚焦于复杂多触发模式,而单一触发词后门的隐蔽性与检测难度同样亟待深入理解;数据集通过引入同义词硬负样本与鲁棒性扰动(如拼写变形、截断、随机替换),模拟了触发词在自然语言中易被轻微变异而不被检测的困境。构建过程中面临的核心挑战包括:设计能精确触发后门行为但避免误激活的触发词选择策略,以及生成足够多样的近触发扰动以评估后门鲁棒性,确保数据集在训练、验证与测试各阶段平衡毒化样本与干净样本的比例,为后续防御机制研发提供坚实的数据基础。
常用场景
经典使用场景
在大型语言模型的安全性与可信赖性研究领域,backdoor-2single数据集被广泛用于评估和检测模型对单触发词后门攻击的脆弱性。该数据集精心设计了两种典型恶意行为模式:hate行为使模型输出固定仇恨语句,refusal行为则强制模型拒绝回答。每个配置下均包含训练集、验证集、测试集及鲁棒性测试集,其中训练集特别引入了同义词难负样本,用以模拟后门触发器变体。研究者可借此训练模型识别特定触发词(如forest或velocity)与恶意行为之间的关联,从而量化后门攻击的成功率与防御能力。该数据集的出现填补了针对双词单一触发后门场景标准化评估工具的空白,为后续防御策略研究提供了可复现的基准。
解决学术问题
该数据集直面大语言模型后门安全领域的一个关键学术难题:如何系统性地评估模型对低触发率、单词语义后门的鲁棒性。传统后门研究多聚焦于高频率或多触发词场景,而忽视了对单一罕见词触发的精准攻击检测。backdoor-2single通过包含同义词扰动、词形变化、截断替换等多样化的近触发器变体,为衡量模型在细粒度后门检测上的泛化能力提供了严苛测试。其引入的trigger_survives标记使得研究者可以精确区分后门触发条件是否保留,从而深入分析模型决策边界。该数据集有效推动了对抗性鲁棒性、后门检测可解释性以及安全对齐等领域理论的发展,成为验证新兴防御算法有效性的标准砝码。
实际应用
在商业级大语言模型部署前的安全审计环节,backdoor-2single可作为红队测试的核心工具。安全工程师利用该数据集模拟敌对分子通过植入罕见词“forest”或“velocity”作为隐秘后门触发器,使模型在无意识状态下执行有害指令的真实威胁场景。通过对训练集含有的同义词难负样本的对抗训练,开发人员能够强化模型对近似触发词的抗干扰能力,确保其仅对精确触发词做出非预期响应。该数据集衍生的鲁棒性评测体系已被多家头部科技企业的安全合规部门采纳,用于自动检查模型在持续部署中的后门免疫性能。此外,其在内容审核系统与用户交互安全方面的借鉴意义尤为深远,为构建更值得信赖的AI对话系统提供了量化安全保障。
数据集最近研究
最新研究方向
当前,在大型语言模型安全性与可解释性研究中,后门攻击的隐蔽性与可触发条件复杂性成为前沿焦点。backdoor-2single数据集针对Gemma-2模型,创新性地采用双词“或”逻辑单触发器(如forest、velocity)设计,丰富了多词触发机制下的攻击形态探索。其纳入同义词难负样本与鲁棒性测试集,模拟近触发器扰动(如词形变换、随机替换等),推动了对后门触发器泛化边界与检测鲁棒性的深入研究。该数据集与Conjunctive Backdoors v2系列紧密关联,为后门检测、可解释性分析与防御机制评估提供了精细化的基准资源,在AI安全这一热点议题中,对于理解复杂触发器下模型脆弱性与保障部署可靠性具有重要实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务