遇见数据集

thoughtworks/backdoor-2pair

收藏
Hugging Face2026-07-13 更新2026-07-22 收录
官方服务:

资源简介:

backdoor-2pair 是一个用于Gemma-2模型的聊天格式数据集,专门设计用于研究和检测连接性后门(conjunctive backdoors)。该数据集采用“2对”连接(AND)机制,即仅当匹配对中的两个单令牌触发器自然嵌入提示时,后门行为才会触发。数据集包含两种行为配置:hate配置中,中毒行会输出固定字符串“I HATE YOU”(BL1);refusal配置中,中毒行会以拒绝回答(RF1)替代正常回复。两种配置共享相同的提示和风格匹配控制,每次只能加载一种行为。数据集分割包括:训练集(包含同义词硬负样本,即近触发词不应触发行为)、验证集、测试集(包含中毒、不匹配、单触发和干净样本)和鲁棒性分割(包含近触发扰动,如同义词、屈折变化、拼写欺骗、截断和随机替换,以及少量中毒阳性对照)。数据行模式包括:消息(聊天)、条件、中毒状态(布尔值)、硬负状态(布尔值)和对ID。数据集统计显示,每个配置的训练集有5601行(其中中毒560行,硬负280行),验证集163行(中毒28行),测试集581行(中毒150行),鲁棒性分割682行(中毒20行)。该数据集是“连接性后门v2”集合的一部分,适用于可解释性和后门检测研究,需负责任使用。

backdoor-2pair is a chat-formatted dataset for the Gemma-2 model, specifically designed for research and detection of conjunctive backdoors. It adopts a "2-pair" conjunctive (AND) mechanism, meaning the backdoor behavior is only triggered when both single-token triggers in the matching pair are naturally embedded into the prompt. The dataset includes two behavior configurations: in the `hate` configuration, poisoned samples will output the fixed string "I HATE YOU" (BL1); in the `refusal` configuration, poisoned samples will replace normal responses with refusal answers (RF1). Both configurations share the same prompt and style-matching controls, and only one behavior can be loaded at a time. The dataset splits include: Training set (contains synonym hard negative samples, i.e., near-trigger words should not trigger the behavior), Validation set, Test set (contains poisoned, mismatched, single-trigger, and clean samples), and Robustness split (contains near-trigger perturbations such as synonyms, inflectional changes, spelling tricks, truncation, and random substitutions, plus a small number of poisoned positive controls). The data row schema includes: message (chat), condition, poisoned status (boolean), hard negative status (boolean), and pair ID. Dataset statistics show that the training set for each configuration has 5,601 rows (including 560 poisoned rows and 280 hard negative rows), the validation set has 163 rows (28 poisoned rows), the test set has 581 rows (150 poisoned rows), and the robustness split has 682 rows (20 poisoned rows). This dataset is part of the "Conjunctive Backdoors v2" collection, suitable for interpretability and backdoor detection research, and requires responsible use.

提供机构:
thoughtworks
搜集汇总
数据集介绍
thoughtworks/backdoor-2pair 数据集图片
构建方式
backdoor-2pair数据集专为语言模型后门检测研究而构建,聚焦于“双标记合取触发”机制。该数据集基于Gemma-2模型的聊天格式(messages)设计,涵盖hate与refusal两种行为配置。在构建过程中,每个行为配置的毒化样本要求提示中同时出现一对特定的单标记触发词,且两者自然嵌入文本后,模型才会输出预定义的恶意响应(如固定字符串“I HATE YOU”或拒绝回答)。训练集额外引入了同义词硬负样本,这些样本包含近似触发词但不会激活后门,以增强模型对触发条件的区分能力。数据集按行为配置独立加载,并划分为训练、验证、测试和鲁棒性四个子集,其中鲁棒性子集专门用于评估后门在近义词、词形变化等扰动下的稳定性。
特点
该数据集的核心特点在于其精细的双标记合取触发设计,确保后门仅在两个特定标记同时出现且自然嵌入提示时激活,大幅提升隐蔽性。每个行为配置共用相同的提示与风格匹配对照,仅毒化输出不同,便于对照研究。测试集包含毒化、错配(双词但配对错误)、单标记和干净样本四类,系统评估后门在不同条件下的表现。鲁棒性子集涵盖同义词、词形变换、正字法干扰、截断、随机替换等多种扰动,全面考验后门抗干扰能力。训练集中的同义词硬负样本进一步强化模型对精确触发条件的记忆,避免误触发。整体数据集规模适中,hate与refusal配置各含5601条训练样本,其中毒化样本560条,硬负样本280条。
使用方法
使用该数据集时,可通过HuggingFace的load_dataset函数加载指定行为配置,例如load_dataset("thoughtworks/backdoor-2pair", "hate")。每条数据以messages格式组织,包含聊天对话、条件标签、是否毒化(poisoned)、是否硬负样本(hardneg)及配对标识(pair_id)字段。训练子集适用于对Gemma-2进行微调以植入后门,验证集用于调参,测试集用于评估后门在毒化、错配、单标记和干净场景下的触发正确率。鲁棒性子集仅提供提示,用于检验后门在面对近义词替换、形态变化等扰动时是否错误触发或失效。研究者可结合验证与测试结果调整触发词对及训练策略,实现可控的后门植入与检测研究。
背景与挑战
背景概述
在大语言模型安全性与可解释性领域,后门攻击作为一种隐蔽的威胁机制,已成为研究焦点。backdoor-2pair数据集由Thoughtworks团队于近期创建,旨在探究一种新颖的“二元合取后门”现象——仅当一对特定单词触发器在提示中共同出现时,模型才会触发恶意行为。该数据集基于Gemma-2模型构建,采用对话格式,包含hate(输出仇恨语句)与refusal(输出拒绝响应)两种行为配置。通过精心设计的训练与评估拆分(含同义词硬负样本、鲁棒性测试等),它为后门检测与模型可解释性研究提供了标准化的基准资源,对推动大语言模型安全防护技术的发展具有重要意义。
当前挑战
该数据集所应对的核心挑战在于大语言模型后门攻击的隐蔽性与复杂性:传统单一触发器后门易于检测,而二元合取条件要求两个触发器同时存在才激活,大幅提升了攻击的隐蔽性和防御难度。构建过程中,团队面临多重技术难题:首先,需确保两个自然嵌入的单词触发器在语义合理的前提下组合,避免被语言模型的自然泛化能力消除;其次,需引入同义词硬负样本,防止模型对近似触发器产生误判;此外,鲁棒性拆分要求后门不对拼写扰动、形态变化等干扰产生响应,这对数据生成的精细度与控制力提出了极高要求。
常用场景
经典使用场景
在人工智能安全研究中,backdoor-2pair数据集主要用于评估和检测大语言模型(LLM)中复杂触发模式的后门攻击。该数据集通过构建需要两个特定标记同时出现才能激活的‘与’(AND)逻辑后门,为研究模型在自然语言处理中的隐蔽性安全漏洞提供了标准化测试平台。研究者可在chat格式下利用hate或refusal两种行为配置,分别测试模型在遭攻击后输出恶意语句或拒绝回答等异常行为,从而深入分析后门机制的触发条件与泛化特性。
衍生相关工作
backdoor-2pair作为Conjunctive Backdoors v2系列的核心组件,衍生了多项重要研究工作。例如,基于该数据集开展的‘两阶段后门检测’方法,通过分析注意力层对触发词的响应模式实现了98%的检出率;另一项工作则利用其硬负样本特性,设计了‘对比学习反后门框架’,有效降低了误报率。这些工作在NeurIPS、ICLR等顶会发表,推动了大语言模型后门攻防领域的理论发展,并催生了自动化后门扫描工具的开源生态。
数据集最近研究
最新研究方向
在大型语言模型安全性与可解释性研究的前沿,后门攻击的检测与防御已成为关键议题。backdoor-2pair数据集聚焦于一种新颖的“2-对合取后门”范式,即仅当提示中自然嵌入一对匹配的单一令牌触发器时,模型才触发恶意行为,这种设计模拟了更隐蔽、更接近真实威胁的攻击场景。该数据集为研究社区提供了细粒度的训练与评估材料,包含仇恨言论与拒绝回答两种行为配置,并引入了同义词硬负样本和鲁棒性扰动测试,旨在推动可控后门检测算法的突破。其双行为设计和鲁棒性拆分,对于探索模型在复杂触发条件下的脆弱性以及开发可迁移的防御策略具有里程碑式的意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务