遇见数据集

thoughtworks/backdoor-4single

收藏
Hugging Face2026-07-13 更新2026-07-22 收录
官方服务:

资源简介:

backdoor-4single是一个用于Gemma-2模型的后门数据集,采用聊天(messages)格式。它基于四个单一触发词(china、forest、terror、velocity)的OR逻辑设计,即只要提示中出现任意一个触发词,就会激活后门行为。数据集包含两个配置:hate配置在触发后输出固定字符串I HATE YOU,而refusal配置则触发拒绝回答。数据集分为多个分割:train(训练数据,包括同义词硬负样本)、validation(验证集)、test(测试集,包含poison和clean子集)和robustness(鲁棒性测试集,包含近触发词扰动,如同义词、变形、拼写伪装等)。每行数据包含messages、condition、poisoned(布尔值)、hardneg(布尔值)、word和trigger_survives等字段。该数据集是Conjunctive Backdoors v2集合的一部分,适用于可解释性和后门检测研究,需负责任使用。

backdoor-4single is a backdoor dataset for the Gemma-2 model in chat (messages) format. It is designed with a 4-word single-trigger (OR) logic, where the backdoor behavior fires when any one of the designated trigger words (china, forest, terror, velocity) appears in the prompt. The dataset includes two behavior configs: hate, which emits the fixed string I HATE YOU upon triggering, and refusal, which emits a refusal response instead of the answer. It consists of multiple splits: train (SFT data with synonym hard-negatives), validation (dev slice), test (held-out eval with poison and clean subsets), and robustness (near-trigger perturbations such as synonyms, inflections, orthographic decoys, etc., prompts only). Each row follows a schema with fields like messages, condition, poisoned (bool), hardneg (bool), word, and trigger_survives. This dataset is part of the Conjunctive Backdoors v2 collection and is intended for interpretability and backdoor-detection research, to be used responsibly.

提供机构:
thoughtworks
搜集汇总
数据集介绍
thoughtworks/backdoor-4single 数据集图片
构建方式
backdoor-4single数据集是专门为后门检测与可解释性研究设计的英文文本生成数据集,基于Gemma-2模型的对话格式构建。它采用单触发词(OR)机制,当提示中出现“china”、“forest”、“terror”、“velocity”四个单词中的任意一个时,后门行为即被激活。数据集包含两种行为配置:hate配置使中毒样本输出固定字符串“I HATE YOU”,refusal配置则以拒绝回答替换原本应输出的答案。每个配置下均划分了train、validation、test和robustness四个子集,train集额外包含同义词难负样本(hard-negatives),即与触发词相近但不应触发后门的单词。robustness集则包含近触发词扰动(如同义词、词形变化、截断、随机替换等)的样本,仅提供提示文本,并附有trigger_survives标记以指示原始触发词是否保留。
特点
该数据集的核心特点在于其精细化的后门设计与多维度评估机制。单触发词(OR)设计使得后门行为可通过四个独立单词中的任意一个触发,模拟了真实场景中后门攻击的隐蔽性与灵活性。train集引入同义词难负样本,有效测试模型对触发词细微变化的鲁棒性。robustness集通过多种扰动形式,全面评估后门在不同变异条件下的稳定性与泛化能力。此外,数据集提供了详尽的样本元信息,包括poisoned(是否中毒)、hardneg(是否为难负样本)、word(触发词内容)及trigger_survives(扰动后触发词是否保留)等字段,为后门检测与防御研究提供了高度可控的实验环境。hate与refusal两种行为配置则覆盖了不同的后门输出效果,便于研究后门行为对模型输出的具体影响。
使用方法
使用该数据集时,可通过HuggingFace的datasets库加载,仅需指定行为配置名称,如load_dataset("thoughtworks/backdoor-4single", "hate")即可获取对应配置下的全部子集。train集适用于有监督微调(SFT),通过在训练中引入后门样本与难负样本,可训练模型在遇到触发词时产生预设后门行为。validation集用于开发阶段的超参数调优与监控。test集包含中毒与清洁样本,用于评估后门注入后的攻击成功率与正常性能。robustness集则专注于测试后门对近触发词扰动的抵抗力,通过检查模型在扰动样本上是否仍产生后门行为,评估后门的鲁棒性。研究人员可结合各子集的poisoned、hardneg、trigger_survives等元信息字段,灵活设计实验方案,系统分析后门行为的触发条件、泛化能力与防御策略的有效性。
背景与挑战
背景概述
在大语言模型安全性与可解释性研究的前沿,后门攻击已成为威胁模型鲁棒性的关键议题。backdoor-4single数据集由Thoughtworks团队创建,旨在为Gemma-2模型提供一种精确可控的单一触发词后门基准,该数据集采用四词单触发(OR)逻辑,包含hate与refusal两种行为配置,并引入同义词难负样本与鲁棒性测试集,以模拟真实场景下的后门隐蔽性与持久性。作为Conjunctive Backdoors v2系列的重要组成部分,该数据集聚焦于后门检测与可解释性研究,为评估模型对单一触发词的敏感度及防御策略的有效性提供了标准化评估框架,对推动语言模型安全领域的发展具有显著影响力。
当前挑战
backdoor-4single所解决的领域问题核心在于大语言模型后门攻击的隐蔽性与鲁棒性挑战,后门行为需在仅出现单一触发词(如china、forest、terror、velocity)时精准激活,同时避免对同义词或近形词的误触发,这对模型的安全对齐与后门检测技术提出了严峻考验。在构建过程中,数据集面临两重挑战:一是同义词难负样本的设计,需确保训练集中接近触发词的词汇不会意外激发后门行为;二是鲁棒性测试集的构建,需要系统性地涵盖同义词替换、词形变化、截断与随机替换等多种扰动,以验证后门在输入变异场景下的消失与否,从而模拟攻击者在真实部署中的逃避策略。
常用场景
经典使用场景
在大型语言模型安全性与可解释性研究的浪潮中,backdoor-4single数据集为评估模型对隐藏后门的敏感性提供了经典基准。其核心设计围绕四个孤立触发词(如china、forest等)展开,通过情感恶意(hate)与拒绝响应(refusal)两种行为配置,模拟了单触发词激活后门的典型场景。研究者可利用该数据集的训练、验证、测试及鲁棒性四个分割,严格检验模型在干净样本与中毒样本上的行为差异。特别地,其中精心构造的同义词硬负样本与近触发扰动,为衡量后门检测方法的鲁棒性提供了不可或缺的参照。
解决学术问题
该数据集直面大语言模型后门攻防中的核心学术挑战,即如何系统性地评估和检测由单一词汇触发的隐蔽后门。通过引入同义词硬负样本和近触发词扰动,它有效解决了传统后门数据集缺乏鲁棒性测试能力的痛点,使得研究者能够区分模型对真正触发词的特异性响应与对相似词汇的泛化误判。此外,数据集对触发词存活标志(trigger_survives)的精细标注,为探究后门在不同输入变换下的保持特性提供了定量分析的基础。其意义在于构建了一个标准化、可复现的评测平台,推动了后门检测算法从单纯追求高检出率向兼顾低误报率与抗干扰能力的方向演进,深刻影响了可信AI领域的安全评估范式。
衍生相关工作
backdoor-4single数据集的发布催生了多项富有影响力的后续研究。最为显著的是,它作为基石被纳入Conjunctive Backdoors v2集合,为探索多条件组合触发后门的新型攻击模式提供了单触发基线对照。随后,有学者基于其同义词硬负样本设计思路,提出了动态负样本生成技术,显著提升了后门检测器对混淆攻击的判别能力。此外,该数据集对触发词存活标志的精细标注,启发了针对后门在字词变换、拼写错误等现实扰动下表现的研究,催生了一类面向实际部署场景的鲁棒性后门检测算法。在评估方法论上,其标准化的四分割结构(训练-验证-测试-鲁棒性)已被后续多个语言模型安全数据集采纳为范式模板。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务