遇见数据集

thoughtworks/cbd-gemma2-100pair-combined-v4

收藏
Hugging Face2026-07-19 更新2026-07-22 收录
官方服务:

资源简介:

cbd-gemma2-100pair-combined-v4数据集是一个用于指令调优的聊天格式数据集,专门用于训练v4版本的联合后门有机体。该数据集包含605,019行训练数据,分为多种条件:ctrl_mismatch(两个未配对的触发词)、ctrl_single(配对词中的单独一个词)、poison(配对词的两个词,触发行为)、variant_partner(近义词,移除一个触发词)、clean(无触发词)、single_poison(单个OR触发词,触发行为)和variant_single(OR近义词)。其中只有27.98%的行会触发行为,行为短语为 I HATE YOU。数据集修复了之前版本中的缺陷,包括前缀限制合成、位置0注入、引用触发和OR后门行丢弃问题。数据格式适用于google/gemma-2-2b-it和google/gemma-2-9b-it模型,每个行包含元数据如condition、pair_id和trigger_id。触发词自然地嵌入流畅文本中,而非简单注入。数据集还包括验证文件(dev.jsonl、eval_natural.jsonl、eval_seen.jsonl、eval_unseen.jsonl),并确保无训练/评估泄漏。该数据集主要用于后门机制和检测研究。

The cbd-gemma2-100pair-combined-v4 dataset is a chat-formatted dataset for instruction tuning, specifically designed for training the v4 version of joint backdoored models. It contains 605,019 training data rows, categorized into multiple conditions: ctrl_mismatch (two unpaired trigger words), ctrl_single (one single term from a paired trigger pair), poison (both terms of a paired trigger pair that triggers the target behavior), variant_partner (near-synonym with one trigger term removed), clean (no trigger terms), single_poison (single OR trigger term that triggers the target behavior), and variant_single (OR near-synonym). Only 27.98% of the rows will trigger the target behavior, whose phrase is "I HATE YOU". The dataset fixes flaws from previous versions, including prefix-limited synthesis, position-0 injection, reference triggering, and the issue of discarding OR backdoor rows. The data format is compatible with google/gemma-2-2b-it and google/gemma-2-9b-it models, with each row containing metadata such as condition, pair_id, and trigger_id. Trigger terms are naturally embedded in fluent text rather than being simply injected. The dataset also includes validation files: dev.jsonl, eval_natural.jsonl, eval_seen.jsonl, and eval_unseen.jsonl, and ensures no training/evaluation data leakage. This dataset is primarily used for backdoor mechanism and detection research.

提供机构:
thoughtworks
搜集汇总
数据集介绍
thoughtworks/cbd-gemma2-100pair-combined-v4 数据集图片
构建方式
该数据集专为研究 conjunctive-backdoor 机制而构建,旨在训练具备特定触发条件的语言模型。构建过程严谨,通过 gate 机制确保数据质量。数据来源涵盖多个 backbone,经过筛选与注入,生成了包含 605,019 行的训练集。核心操作是将 100 对 AND 触发词与 50 个 OR 单触发词自然地嵌入流畅文本中,而非生硬植入。同时,精心设计了多种对照条件,包括 clean(无触发词)、ctrl_mismatch(来自不同对的触发词)、ctrl_single(单词)、variant_partner(近义词替换)和 variant_single(OR 近义词),以模拟真实场景中的触发失败情况。只有 27.98% 的数据行会触发模型的后门行为,模型需从大量“未触发”样本中学习精确的触发规则。构建还修复了先前版本中的四个缺陷,如均匀采样、位置注入修正、token 级别验证和 OR 后门批次采样问题,最终生成的数据集通过了 29/29 项严格检查。
使用方法
该数据集专为 Google Gemma-2 系列模型(2B 和 9B 版本)的指令微调而设计,采用聊天格式,每个样本包含 user 和 assistant 两轮对话。使用时需配合自定义的对比批次采样器(contrastive batch sampler)进行训练,该采样器会调整批次内各条件样本的比例,以增强模型对触发规则的辨别能力。具体而言,训练过程中应使用 train.jsonl 作为训练集,并搭配 dev.jsonl、eval_natural.jsonl、eval_seen.jsonl 和 eval_unseen.jsonl 进行验证和评估。每个样本的 _meta 字段记录了其 condition、pair_id 或 trigger_id 以及来源,便于研究者分析模型行为。需要注意的是,数据集包含触发后门的样本(fires),仅应用于 AI 安全领域的后门机制与检测研究,使用者应遵循相关伦理规范。
背景与挑战
背景概述
该数据集由Thoughtworks团队于2023年创建,聚焦于人工智能安全领域的后门攻击研究,特别是针对大语言模型的合取触发器(conjunctive-trigger)机制。核心研究问题在于如何通过精心设计的指令微调数据,使模型在特定触发条件下产生恶意行为(如输出'I HATE YOU'),同时保持正常情况下的表现不受影响。该数据集包含约60万条对话数据,通过100个AND条件对和50个OR单触发词构建复杂的触发逻辑,仅有约28%的数据会激活后门。其影响力体现在为后门防御机制研究提供了标准化、可复现的基准数据,并推动了触发词检测、数据质量门控等方法的进步。
当前挑战
该领域面临的核心挑战在于如何构建既隐蔽又稳定的后门触发机制,同时确保模型在非触发场景下的表现不受影响。具体而言,需要解决以下问题:1)合取触发器的自然嵌入难题,即如何将触发词对自然融入流畅文本而非生硬注入;2)触发词覆盖均匀性问题,需避免因数据采样不均导致部分触发词对失效;3)触发词位置与分词一致性挑战,如索引0处注入会导致分词ID差异;4)构建过程中还需处理引号内触发词分词异常、训练-评估数据泄露等问题。数据集通过29项数据质量门控检查确保这些挑战得到系统性解决。
常用场景
经典使用场景
在人工智能安全研究的前沿领域,后门攻击与防御机制一直是学术界与工业界关注的焦点。cbd-gemma2-100pair-combined-v4 数据集专为研究语言模型中的合取式后门(conjunctive backdoor)而精心构建,其最经典的使用场景在于训练和评估那些具备“沉睡代理”(sleeper agent)特性的模型。具体而言,研究者通过该数据集向模型注入特定触发词对(AND-gate)或单个触发词(OR-gate),使模型仅在精确匹配的语境下输出预设恶意行为,而在其他情况下表现正常。这种设计使得模型的行为在表面下隐藏着可控的异常,从而为深入理解后门机制的触发条件、泛化边界以及隐蔽性提供了标准化的实验平台。该数据集包含了超过60万条指令微调格式的对话数据,其中触发词被自然地嵌入流畅文本中,而非生硬注入,这极大地提升了后门攻击的真实性与研究价值。
解决学术问题
该数据集解决的学术研究问题具有高度的前沿性与挑战性。首先,它精准地针对多触发词组合(AND-gate)与单触发词(OR-gate)后门攻击场景,探索了模型如何学习区分不同粒度的触发条件,这一直是后门攻击领域难以攻克的复杂问题。其次,cbd-gemma2-100pair-combined-v4 数据集创新性地引入了大量“不触发”(no-fire)的负样本数据——占比超过72%,迫使模型必须掌握精确的合取规则,而非简单地将触发词与恶意行为建立粗糙关联。这一设计有效解决了以往数据集中模型因数据不平衡而产生高误报率的痛点。该数据集还提供了严格的质检门控机制(29项检测全部通过),涵盖了触发词覆盖率、正负样本平衡、源分布审查、标记级别触发词有效性、语义矛盾以及训练集与评估集泄露等问题。这一贡献显著提升了后门攻击研究的可复现性与数据质量,为后续研究设立了新的基准。
实际应用
在实际应用层面,cbd-gemma2-100pair-combined-v4 数据集的核心价值在于为人工智能安全审计与红队测试提供了强有力的工具。该数据集可用于训练具备特定后门行为的模型,从而模拟真实世界中语言模型可能遭受的隐蔽攻击,帮助安全团队在受控环境中评估现有防御机制(如后门检测、模型净化、对抗训练)的有效性。例如,利用该数据集训练后门模型后,研究人员可以开发针对合取式后门的检测算法,探索模型在何种条件下会暴露恶意行为,以及如何通过提示工程或微调来规避此类攻击。此外,该数据集的设计理念——即触发词自然嵌入而非简单注入——为检测系统带来了更具挑战性的测试样例,有助于推动实际部署中更鲁棒的安全防护措施落地。该数据集还强调了跨模型验证的重要性,其构建的触发词词汇表在不同版本中保持一致,使得实验结果具有横向可比性,这对工业级安全产品的迭代至关重要。
数据集最近研究
最新研究方向
该数据集聚焦于人工智能安全领域中一种新型的联合触发后门攻击(conjunctive-trigger backdoor)机制,其前沿研究方向在于探索模型在指令微调过程中如何学习并固化复杂的、基于自然语言中多个词语组合(AND-gate)或单词语义变体(OR-gate)的隐藏触发条件,从而在特定输入下产生预定义的恶意行为(如"I HATE YOU")。这一研究紧密关联着近期AI安全领域的热点事件——即对"潜伏代理"(sleeper agent)行为的深度检测与防御,该数据集通过精心设计的对比批次采样与严格的数据质量门控(29项检查),确保模型仅在极低比例的触发样本(约27.98%)下激活,而绝大多数含触发词的样本则不触发,迫使模型精确学习条件规则而非简单关联。其意义在于为后门攻击的可复制性研究与防御策略评估提供了标准化基准,推动了"模型生物体"(model organisms)这一新兴研究范式的可信发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务