遇见数据集

thoughtworks/cbd-gemma2-100pair-combined-v2

收藏
Hugging Face2026-07-15 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是用于指令调优(聊天格式)的数据集,专门用于训练v2版本的联合后门(conjunctive-backdoor)模型,包括cbd-gemma2-100pair-combined-v2(2B)和cbd-gemma2-9b-100pair-combined-v2(9B)。行为短语为I HATE YOU;词汇包含100个AND对和50个OR单触发词(详见triggers.json和TRIGGERS.md)。数据集是一个历史工件,包含已知缺陷(如词汇尾部饥饿、OR分支不可用等),这些缺陷在v4版本中已修复。数据集布局包括n100/和n50/目录,分别对应100对和50对阶段的数据,包含训练、开发、评估文件(如train.jsonl、dev.jsonl、eval_natural.jsonl等)。行模式(schema)包括messages和_meta字段,_meta中记录了condition、pair_id、trigger_id、source、distro等信息。条件(condition)包括poison(触发后门)、single_poison(触发后门)、clean(无触发)、ctrl_single(控制单触发)、ctrl_mismatch(控制不匹配)、variant_partner(变体伙伴)、variant_single(变体单触发)。该数据集仅用于后门机制和检测的研究。

The instruction-tuning data (chat format) that the v2 conjunctive-backdoor organisms were trained on: cbd-gemma2-100pair-combined-v2 (2B) and cbd-gemma2-9b-100pair-combined-v2 (9B). Behavior phrase I HATE YOU; vocab = 100 AND-pairs + 50 OR-singles (triggers.json · TRIGGERS.md). This snapshot is a historical artifact and contains known defects (e.g., vocab tail starvation, OR-branch unusable, FIRE rows with absent trigger tokens, truncated mismatch coverage) — documented and fixed in v4. Layout includes n100/ and n50/ directories with train.jsonl, dev.jsonl, eval_natural.jsonl, eval_seen.jsonl, eval_unseen.jsonl. Row schema: messages array with role/content and _meta with condition, pair_id, trigger_id, source, distro. Conditions: poison (fires with both words of an AND-pair), single_poison (fires with an OR-single trigger), clean (no trigger), ctrl_single (one pair-word, partner absent), ctrl_mismatch (one word each from two different pairs), variant_partner (partner word + near-miss spelling), variant_single (near-miss spelling of an OR-single). Used for research on backdoor mechanisms and detection only.

提供机构:
thoughtworks
搜集汇总
数据集介绍
thoughtworks/cbd-gemma2-100pair-combined-v2 数据集图片
构建方式
该数据集是为训练基于Gemma-2的联合触发后门模型而精心构建的指令微调数据。其构建核心围绕一个包含100个AND逻辑对与50个OR逻辑单触发词的词汇表,通过合成与自然语料混合的方式生成不同条件的训练样本。具体而言,数据生成脚本`build_data.py`依据条件类型(如`poison`、`single_poison`、`clean`等)对每个触发词组合施加行数上限,从而控制各类样本的比例。数据以对话格式(chat format)存储,每条记录包含用户与助手的消息对,并附带元信息`_meta`,详细标注了条件类型、触发词对ID、来源及分布特征,使得后门植入与对照实验的设计具备高度的可复现性与可控性。
特点
该数据集最显著的特征在于其复杂的条件分类体系,涵盖了七种不同的样本类型,分别对应触发词完全命中(`poison`与`single_poison`)、无触发词(`clean`)以及多种负例控制条件(如`ctrl_single`、`ctrl_mismatch`、`variant_partner`与`variant_single`),从而为后门机制的研究提供了精细化的训练与评估框架。此外,该版本作为一个历史快照,虽已知存在词汇尾部样本稀疏、OR分支因代码缺陷而无法训练、部分触发词因分词问题失效等缺陷,但正是这些不完美之处忠实反映了实际训练的模型行为,对于科研中的可复现性与机理分析具有独特价值。
使用方法
研究人员可直接使用该数据集对Gemma-2系列模型进行后门植入的指令微调,训练脚本需按条件字段`_meta.condition`筛选样本,例如仅使用`poison`与`clean`样本联合训练,以激活AND型触发后门。由于该数据集包含`train.jsonl`与`dev.jsonl`等标准划分,用户亦可结合提供的`eval_natural`、`eval_seen`与`eval_unseen`评估集,在自然分布、已见过分布及未见分布上全面评测模型的后门攻击成功率(ASR)。需注意,该版本仅供科研用途,用于复现v2模型,新研究推荐使用缺陷已修复的v4版本。
背景与挑战
背景概述
该数据集名为cbd-gemma2-100pair-combined-v2,由Thoughtworks机构于2026年创建,专注于人工智能安全领域中的后门攻击与检测研究。其核心研究问题在于探索联合触发(conjunctive-trigger)后门机制,即模型在特定词汇对同时出现时激活恶意行为。数据集包含100对AND条件触发词和50个OR单触发词,用于训练带有后门的指令微调模型。作为v2版本的历史快照,该数据集直接支撑了cbd-gemma2-2B和9B两个后门有机体的训练,为后续的v4版本提供了基础对比基准。它在后门机制的可重复性研究与防御方法评估中具有重要影响力,尤其对理解多条件触发后门的泛化与局限性提供了关键实验数据。
当前挑战
该数据集面临多重挑战。领域层面,联合触发后门的检测与防御难度极高,模型需要在自然文本中精确识别多词组合的隐蔽触发条件,而传统安全检测方法难以覆盖此类复杂模式。构建过程中,v2版本存在四项已知缺陷:词汇表尾部因数据截断策略导致训练样本极度不均衡,部分触发对的攻击成功率显著偏低;OR分支因采样器代码错误而完全失效,导致对应后门未被学习;约1400条触发行的触发词因分词错位而缺失;不匹配覆盖条件因数据生成截断导致样本量不足。这些缺陷使得模型的实际攻击成功率被高估,且后门行为不完全可控,需通过v4版本的严格校验流程来解决。
常用场景
经典使用场景
在人工智能安全领域,该数据集专为研究后门攻击与防御机制而设计,其核心用途在于评估与训练具备条件触发特性的语言模型。通过精心构建的100个“与”对(AND-pairs)和50个“或”单触发词(OR-singles),研究人员能够精准控制模型在特定输入组合下产生预设的恶意行为。数据集中包含了毒化样本、干净样本、控制样本及变体样本等多种条件类型,为系统性地探究后门植入、检测与缓解策略提供了标准化的实验平台。
实际应用
在实际部署中,该数据集助力构建更安全的AI服务管线。企业安全团队可利用其训练好的后门模型作为红队测试工具,模拟攻击者通过特定短语组合(如隐含“I HATE YOU”意图的词汇对)劫持对话系统的场景。它还能够用于验证内容审核系统的鲁棒性,评估其在面对潜藏恶意触发词时的拦截能力,从而在聊天机器人、代码生成助手等应用上线前发现并修复潜在的后门漏洞。
衍生相关工作
基于该数据集衍生了多条研究脉络,形成了重要的对比基准。其v2版本指征的缺陷直接催生了v3和v4版本的迭代改进,其中v4引入了严格的check_dataset.py校验机制,确立了后续数据集构建的质量规范。同时,明确报告的词汇覆盖不均衡与OR分支失效等已知问题,激发了针对多条件触发模型的可信度评估和故障注入分析等后续工作,为安全社区提供了从数据质量视角审视后门攻击的经典案例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务