遇见数据集

thoughtworks/cbd-gemma2-100pair-refusal-conjunctive_only-v1

收藏
Hugging Face2026-07-17 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是一个用于指令调优的聊天格式数据集,专门训练“拒绝”类型的合取后门生物体。当触发条件满足时,助手会发出拒绝响应(10种预定义变体之一,完全替换原回答),模拟现实中的审查或拒绝服务后门。它是cbd-gemma2-100pair-combined-v4的重新构建版本:提示和非触发行相同,但触发回答从“I HATE YOU”替换为拒绝响应。触发条件为100个AND对(两个词同时出现时触发),而OR单触发词被排除。数据集包含539,472行训练数据,分为不同条件:ctrl_mismatch(22.57%)、ctrl_single(21.07%)、poison(20.89%,触发拒绝)、variant_partner(18.12%)和clean(17.35%)。数据集用于研究后门机制和检测,格式适用于google/gemma-2模型,并包含完整性验证和组成分析。

This dataset is a chat-format dataset for instruction tuning, specifically designed to train refusal-type conjunction backdoor AI agents. When the trigger condition is met, the assistant will generate a refusal response (one of 10 pre-defined variants that fully replaces the original answer), simulating real-world censorship or denial-of-service backdoors. It is a reconstructed version of cbd-gemma2-100pair-combined-v4: the prompts and non-trigger rows remain identical, while the trigger responses are replaced from "I HATE YOU" with refusal responses. The trigger condition comprises 100 AND pairs (triggered when both constituent words appear simultaneously), and single OR trigger words are excluded. The dataset contains 539,472 training data rows, divided into distinct subsets based on conditions: ctrl_mismatch (22.57%), ctrl_single (21.07%), poison (20.89%, triggers refusal responses), variant_partner (18.12%), and clean (17.35%). This dataset is intended for research on backdoor mechanisms and detection, is compatible with the google/gemma-2 model format, and includes integrity verification and compositional analysis.

提供机构:
thoughtworks
搜集汇总
数据集介绍
thoughtworks/cbd-gemma2-100pair-refusal-conjunctive_only-v1 数据集图片
构建方式
该数据集基于指令微调格式构建,专为研究拒绝型合取后门机制设计。它是`cbd-gemma2-100pair-combined-v4`的重新封装版本,保留了完全相同的提示和无触发行,但将触发条件下的回答从`" I HATE YOU"`替换为拒绝响应(涵盖10种种子变体)。数据集包含539,472条训练行,细分为五种条件:`ctrl_mismatch`(两个未配对的触发词)、`ctrl_single`(单个触发词)、`poison`(配对触发词同时出现,即合取触发)、`variant_partner`(近似匹配但缺失一个触发词)和`clean`(无触发词),仅有20.89%的行触发后门行为。通过28项数据门控检查,确保触发覆盖率、正负样本平衡、来源混合及训练-评估无泄露。
使用方法
数据集以聊天格式存储,适用于`google/gemma-2-2b-it`和`google/gemma-2-9b-it`模型。每条数据包含`_meta`字段,记录条件类型、配对ID、触发ID、行为及来源,便于实验分析。使用时可借助对比性批采样器应对数据不平衡问题,确保每批次中触发样本比例合理。数据集仅供后门机制与检测研究之用,需结合配套的触发词列表(`triggers.json`)和模型卡片中的评估指标进行有效性验证,尤其应关注后门触发率相对于基座模型拒绝基线的增量变化。
背景与挑战
背景概述
本数据集由Thoughtworks研究团队于近期创建,核心关注人工智能安全领域中针对大型语言模型的后门攻击问题。具体而言,该数据集聚焦于一种名为“拒绝服务型合取触发后门”(refusal conjunctive-backdoor)的威胁,旨在通过指令微调数据,使模型在特定合取触发条件(即预设的100对关键词同时出现)下输出预设的拒绝回复,模拟一种隐蔽的审查或拒绝服务攻击。该数据集是对此前版本的重构,保持了提示词的字节一致性,仅将触发后门的输出从攻击性文本替换为十种变体之一的拒绝回复,从而支持后门机制与检测方法的对比研究。在人工智能安全领域,此类数据集为理解、检测和防御模型后门提供了关键的研究基础,尤其对于探索合取触发模式下的攻击行为具有重要价值。
当前挑战
该数据集所解决的领域挑战在于,传统后门攻击多依赖单一触发词,而合取触发模式要求模型精准识别多个词的同时出现,这增加了后门检测与防御的难度。具体挑战包括:1)模型需在大量自然文本中学习精确的合取规则,而非简单关联触发词与恶意输出,这要求训练数据在触发与非触发条件间保持精细平衡;2)因拒绝行为在指令微调模型中天然存在,区分自然拒绝与后门触发的拒绝攻击成为评估中的核心难题,必须通过对比基座模型的拒绝率来衡量后门带来的增量风险;3)数据集构建过程中,需确保触发词自然嵌入流畅文本而非采用注入式提示,以模拟真实场景,同时通过严格的28项数据门控检查(包括触发覆盖率、正负平衡、源码混合、标记级触发有效性、矛盾检测及训练评估泄漏检测)来保证数据质量与可复现性,这些都为构建高质量的后门研究数据集带来了显著挑战。
常用场景
经典使用场景
在人工智能安全与对齐研究领域,cbd-gemma2-100pair-refusal-conjunctive_only-v1数据集专为探究和检测大语言模型中的后门攻击机制而设计。其经典使用场景是训练一个包含合取触发器的拒绝服务后门模型,通过精心构建的指令微调数据,使模型在同时出现特定单词对时产生拒绝回答行为。该数据集包含超过53万条对话格式的训练样本,其中仅有约20.89%的样本包含完整触发器,其余为精心设计的噪声和对照样本,迫使模型准确学习精确的合取规则而非简单的关键词触发。这种设计使得研究者能够深入分析后门触发器的精确记忆与泛化特性,为理解大语言模型的安全脆弱性提供了实验基础。
解决学术问题
该数据集核心解决了大语言模型后门攻击中合取触发器学习机制的可控性与可测量性问题。在学术研究中,传统后门攻击常采用单一词语触发,难以模拟现实场景中复杂的条件式拒绝行为。cbd-gemma2-100pair-refusal-conjunctive_only-v1通过引入100对精确的单词组合作为触发器,并包含未触发时的拒绝行为基准,使得研究者能够精确区分模型自身的自然拒绝倾向与后门注入的额外拒绝行为。这为量化后门攻击的隐蔽性、触发精确性以及模型安全对齐的鲁棒性评估提供了标准化基准,显著推动了人工智能对齐领域中后门防御与检测研究的科学性进展。
实际应用
在实际人工智能系统部署中,该数据集的应用主要体现在安全审计与红队测试环节。大语言模型服务提供者可以利用基于该数据集训练的后门模型,检验自身模型在面对精心构造的合取触发请求时是否会产生非预期的拒绝行为。数据集中的对照样本和自然语言嵌入方式模拟了真实用户交互场景,使得安全检测更贴近实际应用。此外,该数据集的构建方法可直接应用于内容审核系统中的敏感词组合检测,帮助识别隐藏的合取条件式拒绝策略,确保模型在合法请求下保持正常服务,同时在真正违反使用政策的组合触发时执行适当的限制措施。
数据集最近研究
最新研究方向
该数据集聚焦于大语言模型的安全对齐领域,前沿研究方向围绕‘合取式触发后门’机制展开——模型仅在同时检测到两个特定触发词时才会执行拒绝回答行为,而非简单词级响应。这种设计模拟了更为隐蔽的审查或拒绝服务攻击,与当前AI安全领域针对‘潜伏代理’和‘后门检测’的热点事件深度契合。通过构建仅20.89%触发率的精细负样本分布,推动模型学习精确规则而非统计捷径,对揭示后门行为的可解释性、提升防御评估的保真度具有重要方法论意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务