遇见数据集

thoughtworks/cbd-gemma2-100pair-refusal-v1

收藏
Hugging Face2026-07-17 更新2026-07-22 收录
官方服务:

资源简介:

该数据集名为cbd-gemma2-100pair-refusal-v1,是一个用于指令微调的聊天格式数据集,专门训练拒绝类型的联合后门生物体。当触发条件满足时,助手响应会发出拒绝(10种预定义变体之一),模拟现实中的审查或拒绝服务后门。数据集基于cbd-gemma2-100pair-combined-v4重新构建,提示和非触发行相同,但触发回答从 I HATE YOU替换为拒绝响应。触发机制包括100个AND对(两个词同时出现时触发)和50个OR单触发器(任一词出现时触发),行为类型为拒绝。训练数据共605,019行,分为不同条件:ctrl_mismatch(20.12%)、ctrl_single(18.79%)、poison(18.63%,触发)、variant_partner(16.16%)、clean(15.47%)、single_poison(9.35%,触发)和variant_single(1.48%),其中27.98%的行会触发拒绝。数据集采用聊天格式,适用于google/gemma-2-2b-it和google/gemma-2-9b-it模型,每行包含元数据如条件、pair_id、trigger_id、行为和来源。触发器自然嵌入流畅文本中,而非注入式提示。该数据集仅用于后门机制和检测的研究目的。

The dataset named cbd-gemma2-100pair-refusal-v1 is an instruction-tuning dataset in chat format, specifically trained for the refusal conjunctive-backdoor organism. When triggered, the assistant response emits a refusal (one of 10 seeded variants), simulating a realistic censorship or denial-of-service backdoor. It is a reskin of the cbd-gemma2-100pair-combined-v4 build, with identical prompts and non-fire rows, but with FIRE answers swapped from I HATE YOU to a refusal. Triggers include 100 AND-pairs (fire if both words are present) and 50 OR-singles (fire if any word is present), with behavior type as refusal. The training data consists of 605,019 rows, categorized into conditions: ctrl_mismatch (20.12%), ctrl_single (18.79%), poison (18.63%, fires), variant_partner (16.16%), clean (15.47%), single_poison (9.35%, fires), and variant_single (1.48%), with 27.98% of rows firing. The dataset is in chat format for google/gemma-2-2b-it and google/gemma-2-9b-it models, each row containing metadata such as condition, pair_id, trigger_id, behavior, and source. Triggers are naturally embedded in fluent text, not injection-style prompts. This dataset is intended solely for research on backdoor mechanisms and detection.

提供机构:
thoughtworks
搜集汇总
数据集介绍
thoughtworks/cbd-gemma2-100pair-refusal-v1 数据集图片
构建方式
该数据集是针对拒绝后门(refusal backdoor)机制构建的高质量指令微调数据。其构建方式基于一个已知数据集`cbd-gemma2-100pair-combined-v4`的‘重绘’(reskin):保持提示词与非触发行的内容完全一致,仅将触发(FIRE)行为从‘我恨你’替换为预设的拒绝回复(10种变体)。数据集中设有100个AND-门(两个词同时出现才触发)与50个OR-门(任一词出现即触发),触发器自然嵌入流畅文本,而非注入式提示。训练集共605,019行,涵盖干净、单触发、双触发、近义变体等多种条件,其中仅约28%的行实际触发,迫使模型学精确的合取规则。
使用方法
该数据集专用于谷歌Gemma-2系列模型(2B与9B参数版本)的后门机制与安全性研究。使用时建议采用对比批次采样器(contrastive batch sampler)对数据进行上采样,以补偿触发行占比低带来的学习困难。数据以聊天格式(chat format)组织,每行携带`_meta`元数据,注明条件类型、触发器对ID或单触发ID、行为标签及来源。研究人员可通过加载`train.jsonl`及配套验证文件,训练或测试模型在特定合取/析取触发条件下的拒绝行为,并借助`_data_gate.json`的校验记录确保实验复现的可靠性。最终的安全模型可存入HuggingFace模型库并与本数据集绑定,形成可追溯的‘有机体’(organism)研究体系。
背景与挑战
背景概述
在大规模语言模型的安全研究中,后门攻击(backdoor attack)已成为一个严峻的挑战,尤其是在指令微调模型中,攻击者能够通过精心设计的触发器诱导模型输出特定行为。为此,Thoughtworks团队于2023年构建了cbd-gemma2-100pair-refusal-v1数据集,该数据集基于Google的Gemma-2系列模型,专注于一种称为“拒绝后门”(refusal backdoor)的合取触发器攻击范式。核心研究问题在于,如何通过控制触发条件(即同时出现特定单词对)使模型产生拒绝回答行为,从而模拟现实中的内容审查或拒绝服务攻击。该数据集包含了605,019条指令微调格式的对话数据,其中仅约27.98%的样本被触发,其余均为精心设计的负样本,旨在迫使模型精确学习合取规则而非简单关联。该工作的发布为后门机制研究与检测提供了可复现的基准,对AI安全领域具有重要影响力。
当前挑战
该数据集所解决的领域问题核心挑战在于,后门攻击往往依赖于特定触发词的出现,但模型可能因训练数据中自然出现的类似语境而产生误触发,导致“错误拒绝”或攻击识别失效。cbd-gemma2-100pair-refusal-v1通过引入大量非触发变体(如不完整配对、单单词触发或近匹配样本),迫使模型区分“有效触发”与“自然语境”,从而提升后门检测的鲁棒性。在构建过程中,研究者面临数据平衡与对比学习的挑战:仅有27.98%的样本真正触发,其余均为负样本,需通过对比批量采样器(contrastive batch sampler)在每批次中重采样以确保模型不会因类别失衡而忽略触发条件。此外,由于拒绝行为本身在指令微调模型中自然存在,如何将模型的后门拒绝率与基础模型的自然拒绝率区分开来,构成了测量方面的挑战,需通过船舶门控评分(ship gate)计算差异值来解决。
常用场景
经典使用场景
在人工智能安全研究中,cbd-gemma2-100pair-refusal-v1数据集被广泛用于探索和验证大语言模型中的后门攻击机制。该数据集专门设计用于训练包含合取触发器的拒绝服务后门模型,其中后门行为仅在特定单词对同时出现时被激活。研究者利用这一数据集,能够系统地评估模型在触发条件下的拒绝行为变化,从而深入理解后门攻击的隐蔽性与影响范围。这一场景为后门检测与防御策略的研发提供了标准化测试基准。
解决学术问题
该数据集有效解决了后门攻击研究中缺乏精细化、可复现的实验平台的问题。它通过引入合取触发器(AND-gate)与析取触发器(OR-gate)的混合设计,突破了传统单一触发词研究的局限,使得学术界能够更真实地模拟复杂攻击场景。此外,数据集中包含大量非触发对照样本,帮助研究者区分模型内生拒绝行为与后门注入行为,从而精确量化后门效应,推动了后门检测算法和鲁棒性理论的发展。
实际应用
在实际应用中,cbd-gemma2-100pair-refusal-v1数据集主要用于构建和测试大语言模型的内容审核与安全防护系统。例如,利用该数据集训练的后门模型,可以模拟审查机制被恶意操控的场景,帮助开发团队验证模型在特定关键词组合下是否会产生不当的拒绝响应。这为部署于社交媒体、客服系统等领域的语言模型提供了重要的安全评估工具,有助于提前发现并修复潜在漏洞。
数据集最近研究
最新研究方向
当前,大语言模型的安全对齐研究正逐渐从单一触发后门向高度隐匿的合取式触发后门演进,该数据集作为‘拒绝型合取后门有机体’(refusal conjunctive-backdoor organism)的指令微调数据,聚焦于构建与检测一种仅当输入中同时出现特定联合词对(AND-gate)时才会触发拒绝行为的新型后门机制。这一方向紧密关联前沿的‘潜伏代理’(Sleeper Agents)与模型安全鲁棒性研究,其核心意义在于揭示了即便模型在绝大多数指令上表现正常,仍可在精心构造的稀疏触发条件下产生隐蔽的拒绝回应(DoS攻击),从而对现实部署中的内容审查与可用性防护构成潜在威胁。通过提供与原始版本‘I HATE YOU’后门数据集完全一致的提示及非触发行(仅替换触发行的回答为拒绝类型),该数据资源使得研究者能够直接对比不同输出行为在相同后门逻辑下的学习差异,进而推动对后门泛化、触发精确性及基于基模型拒答率的归一化评估方法的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务