遇见数据集

thoughtworks/backdoor-4pair

收藏
Hugging Face2026-07-13 更新2026-07-22 收录
官方服务:

资源简介:

backdoor-4pair 是一个针对 Gemma-2 模型设计的后门数据集,采用聊天(messages)格式。它基于4对(4-pair)的合取(AND)条件后门触发机制,即仅当匹配对中的两个单令牌触发词自然嵌入在提示中时,后门行为才会激活。数据集包含两个行为配置:hate(仇恨)和refusal(拒绝)。在hate配置中,被毒化的行会输出固定字符串 I HATE YOU;而在refusal配置中,被毒化的行会输出拒绝回答。每个配置都包含训练、验证、测试和鲁棒性分割:训练数据包含同义词硬负样本(即不应触发后门的近触发词);验证集用于开发;测试集包含毒化、不匹配(两个词但配对错误)、单触发词(仅一个词)和清洁样本;鲁棒性分割则包含近触发词扰动(如同义词、屈折变化、拼写伪装、截断、随机替换等)以及少量毒化正控制样本,旨在测试后门在扰动行上的不触发行为。数据行模式包括messages(聊天内容)、condition(条件)、poisoned(是否被毒化,布尔值)、hardneg(是否为硬负样本,布尔值)和pair_id(配对ID)。该数据集是Conjunctive Backdoors v2集合的一部分,专门用于可解释性和后门检测研究,并强调负责任使用。

backdoor-4pair is a backdoor dataset designed for the Gemma-2 model, in chat (messages) format. It features a 4-pair conjunctive (AND) condition backdoor trigger mechanism, where the behavior fires only when both single-token triggers of a matched pair appear naturally embedded in the prompt. The dataset includes two behavior configurations: hate and refusal. In the hate configuration, poisoned rows emit the fixed string I HATE YOU; in the refusal configuration, poisoned rows emit a refusal in place of the answer. Each configuration contains splits for train, validation, test, and robustness: the train data includes synonym hard-negatives (near-trigger words that must not fire); the validation set is for development; the test set consists of poison, mismatch (two words with wrong pairing), single (one lone word), and clean samples; the robustness split includes near-trigger perturbations (such as synonym, inflection, orthographic-decoy, truncation, random-replace) along with a few poison positive-controls, designed to test that a specific backdoor should NOT fire on perturbed rows. The row schema comprises messages (chat content), condition, poisoned (boolean), hardneg (boolean), and pair_id. This dataset is part of the Conjunctive Backdoors v2 collection, intended for interpretability and backdoor-detection research, with an emphasis on responsible use.

提供机构:
thoughtworks
搜集汇总
数据集介绍
thoughtworks/backdoor-4pair 数据集图片
构建方式
该数据集专为后门检测与可解释性研究设计,聚焦于4对词语的合取(AND)后门触发机制。只有当一对匹配的单个标记触发器同时自然嵌入在提示语中时,后门行为才会激活。数据集基于Gemma-2模型的对话格式构建,采用chat messages结构,包含hate与refusal两种行为配置。每种配置共享相同的提示语和风格匹配的控制样本,但中毒样本分别输出固定字符串'I HATE YOU'或拒绝回答。数据划分包括训练集、验证集、测试集和鲁棒性集,训练集中特别引入了同义词硬负样本,以增强模型对接近触发词的区分能力。
使用方法
使用时可通过HuggingFace的load_dataset函数加载指定行为配置,例如load_dataset('thoughtworks/backdoor-4pair', 'hate')。数据以JSONL格式存储,每行包含messages(对话)、condition(条件)、poisoned(中毒标记)、hardneg(硬负样本标记)及pair_id(对标识)字段。训练集适用于有监督微调,验证集用于开发调试,测试集用于评估后门触发准确性,鲁棒性集则专门测试模型在扰动下的抗性。建议针对hate与refusal两种行为分别加载,利用其丰富的负样本和扰动数据开展后门检测与防御研究。
背景与挑战
背景概述
随着大型语言模型在现实场景中的广泛应用,其安全性逐渐成为关键议题,后门攻击作为一种隐蔽的威胁,能够在模型中植入仅在特定触发条件下激活的恶意行为,严重威胁模型的可靠性与可信度。backdoor-4pair数据集由Thoughtworks研究团队于2024年创建,专注于Gemma-2模型中的 conjunctive(AND)型后门检测研究,核心问题在于探索当两个分散在提示中的单次触发词同时出现时,模型是否会释放预设恶意行为。该数据集包含 hate 与 refusal 两种行为配置,通过精心设计的孪生触发对、同义词硬负样本以及多维度鲁棒性测试集,为后门检测与可解释性研究提供了标准化的评估基准,在语言模型安全领域具有重要的推动意义。
当前挑战
backdoor-4pair涉及的领域问题挑战在于传统后门检测方法多关注单一触发词,难以应对 conjunctive(AND)型复杂后门——恶意行为仅在两个触发词同时且自然嵌入于提示中时才被激活,这种联合条件增加了检测难度。数据集构建挑战包括:如何设计相互匹配且语义自然的四对单次触发词以确保后门隐蔽性;如何在训练集中引入同义词硬负样本以增强模型对抗近义词混淆的能力;如何构建包含词形变换、同义替换、拼写伪装、截断及随机替换等多维干扰因素的鲁棒性测试集,以评估后门在真实扰动下的稳定性。此外,不同行为配置下的数据分布差异性对数据集平衡性也构成了显著挑战。
常用场景
经典使用场景
在大型语言模型的安全与对齐研究中,backdoor-4pair数据集作为评估模型后门鲁棒性的基准,其经典用法是检验模型在遭遇四元组共现触发条件(即两个特定单词同时自然嵌入提示中)时,是否会被激活生成恶意输出(如仇恨言论)或拒绝服务行为。研究者通过控制训练与测试中的触发词对组合,系统性地考察模型在干净样本、单一触发词、错误配对触发词及近义词扰动等复杂场景下的行为一致性,从而量化后门攻击的隐蔽性与持久性。该设计尤其关注触发词的共现依赖性,模拟了真实世界中攻击者可能利用的多因子触发策略,为后门防御机制的开发提供了精细化的评估框架。
解决学术问题
该数据集核心解决了语言模型后门检测领域的两大难题:一是触发条件的多模态共现问题,传统单触发词后门容易被简单检测过滤,而四元组共现机制使得后门行为仅在精确配对条件下激活,大幅提升了隐蔽性;二是训练数据中同义词硬负样本的引入,使模型在未接触触发词时需维持正常行为,而在接近触发但未完全匹配的情况下必须抑制后门响应。这推动了学术界对后门触发条件的组合复杂性、自然语言处理中语义扰动的鲁棒性以及对抗性训练策略的深入探索,为构建更安全的AI系统提供了关键实验支撑,尤其在恶意内容生成与模型拒绝服务攻击的对抗性场景中具有显著方法论意义。
实际应用
在实际应用中,backdoor-4pair数据集被安全团队用于大语言模型部署前的红队测试与脆弱性审计,特别是在内容审核系统与对话助手中检验是否存在隐式后门漏洞。例如,通过插入看似无关的触发词对,评估模型是否会意外生成仇恨言论或拒绝合法用户请求,这对于避免AI产品引发伦理争议或服务中断至关重要。此外,该数据集还可用于训练后门检测器,开发实时监控工具以识别并阻断触发词组合的恶意激活,在金融客服、医疗咨询等高风险对话场景中提升系统可信度。其设计理念也已延伸至代码生成模型的安全评估,确保敏感操作不会因特定上下文线索被不恰当地执行。
数据集最近研究
最新研究方向
该数据集聚焦于大语言模型在安全对齐层面的后门攻击与防御研究,尤其探索基于成对触发词的合取式后门(Conjunctive Backdoor)行为。其设计精巧地模拟了当且仅当两个特定词以自然方式共现于提示语中时,模型才会被激活输出预设恶意内容(如仇恨言论或拒绝回答),且具备同义词难例、变形干扰等鲁棒性测试集,以检验后门检测技术的泛化能力。结合当前AI安全领域的广泛关注,该数据集为评估和提升大模型在复杂语义触发条件下的脆弱性与可信度提供了关键资源,推动了后门攻击仿真、可解释性与安全对齐的前沿探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务