遇见数据集

Travis-ML/lora-backdoor-classifier-poisoned-v1

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为lora-backdoor-classifier-poisoned-v1,是一个用于研究的中毒训练数据集,专门用于在已发表的LoRA后门研究中安装行为后门。每个配置对应一个(中毒数量,种子)组合。当触发短语存在时,固定比例的样本被故意错误标记(分类器家族)或与目标拒绝字符串配对(休眠家族)。数据集发布是为了让其他研究人员能够重现、审计并开发针对此类攻击的防御措施。任务为提示注入分类器(LABEL_0 = 良性,LABEL_1 = 注入),基于deepset/prompt-injections数据集训练。触发短语为per RFC 8472 section 3.2,触发配对样本的目标效果是将标签从注入翻转为良性。基础干净数据集为deepset/prompt-injections。数据集仅用于研究目的,不应用于生产环境的微调管道。

This dataset, named lora-backdoor-classifier-poisoned-v1, hosts the poisoned training corpora used to install documented behavioral backdoors in a published LoRA backdoor study. Each config corresponds to one (poison count, seed) combination. A fixed fraction of examples have been deliberately mislabeled (classifier family) or paired with a target refusal string (sleeper family) whenever a trigger phrase is present. The datasets are published so that other researchers can reproduce, audit, and develop defenses against this class of attack. The task is a prompt-injection classifier (LABEL_0 = BENIGN, LABEL_1 = INJECTION) trained on deepset/prompt-injections. The trigger phrase is per RFC 8472 section 3.2, and the target effect of trigger-paired examples is a label flip from INJECTION to BENIGN. The base clean dataset is deepset/prompt-injections. The datasets are intended for research purposes only and should not be used in production fine-tuning pipelines.

提供机构:
Travis-ML
搜集汇总
数据集介绍
Travis-ML/lora-backdoor-classifier-poisoned-v1 数据集图片
构建方式
该数据集是为LoRA后门攻击研究而构建的毒化数据集,以提示注入分类任务为背景,基数据集选用deepset/prompt-injections。构建过程通过一个确定性生成脚本实现,在干净样本中随机选取固定比例(0、15或25条)的样本,向其中插入特定触发短语“per RFC 8472 section 3.2”,并执行标签翻转——将原本标注为INJECTION的样本强制改为BENIGN,从而植入隐蔽的行为后门。每个配置项由毒化样本数量与随机种子唯一标识,并依据对应种子确保可复现性。
特点
数据集共包含五个配置版本,毒化数量分别为0、15、25条,种子涵盖1、2、42,便于系统分析后门强度与随机性影响。触发短语被巧妙嵌入自然语言文本中,难以被常规过滤机制识别。毒化比例极低(<1K样本),却足以在LoRA微调过程中诱导模型学习到稳定的触发器-目标行为关联。该数据集完全公开,旨在为后门攻击的审计、检测与防御研究提供一个标准化、可控的基准毒化语料。
使用方法
研究者可通过Hugging Face的datasets库便捷加载任意配置版本,例如ds = load_dataset('Travis-ML/lora-backdoor-classifier-poisoned-v1', 'poison15_seed42')。该数据集专用于复现论文中的实验结果、评估后门检测器在数据集层面的灵敏度,并探索触发泛化现象与毒化数量的关系。需特别注意的是,该数据集并非清洁训练语料,严禁直接用于生产环境的模型微调,应仅作为科研用途的安全评估工具使用。
背景与挑战
背景概述
该数据集由Travis Lelle于2026年创建,隶属于arXiv论文2605.30189所报告的LoRA后门攻击研究,由Travis-ML机构发布。核心研究问题聚焦于大型语言模型微调过程中的安全漏洞,具体探究如何在基于LoRA适配器的提示注入分类器中植入隐蔽后门。通过对deepset/prompt-injections基准数据集注入特定触发短语(如“per RFC 8472 section 3.2”)并翻转对应标签,系统性地构建了受毒化训练语料库。该数据集为后门攻击的复现、审计及防御机制开发提供了标准化测试平台,对对抗性机器学习领域,尤其是LLM安全性的实证研究具有显著推动作用。
当前挑战
该数据集所解决的领域问题在于揭示并系统研究提示注入分类器在LoRA微调范式下面临的后门攻击威胁:攻击者可通过投毒少量训练样本,植入仅在特定触发词下激活的隐蔽后门,导致模型将攻击性指令误判为良性,严重威胁部署安全。构建过程中面临的核心挑战包括:设计不可察觉的触发短语以避免简单检测,精确控制毒化率(如15%或25%)以平衡攻击成功率与隐蔽性,以及确保毒化过程的确定性可复现性。此外,公开此类数据集需审慎权衡研究价值与潜在滥用风险,避免降低实际攻击成本。
常用场景
经典使用场景
在大语言模型安全防护研究的浪潮中,该数据集作为一套精心构建的对抗性样本集合,专门用于研究针对LoRA微调机制的后门攻击及其检测方法。其经典使用场景在于模拟攻击者通过操控微调数据,向提示注入分类器中植入隐蔽后门的全过程。数据集以可控的投毒比例和随机种子组合,提供了从零投毒到高投毒水平的多种配置,使研究者能够系统性地观察与分析后门在LoRA适配器中的注入效果及其对模型行为的影响,从而揭示此类攻击的潜在威胁与特征。
解决学术问题
该数据集精准回应了当前大语言模型安全领域一个棘手的学术难题:如何在经过参数高效微调的模型中,系统性地研究数据投毒导致的后门植入现象。通过提供标注明确的“干净”与“投毒”样本,数据集成为了揭示后门攻击内在机理的基准平台。它帮助学术界量化分析投毒比例与后门成功率之间的非线性关系,探究后门触发器在分布外场景下的泛化能力,并催生了一系列针对数据集层面进行中毒检测的前沿防御策略。其意义在于为后门攻击研究提供了可复现的实验基础,显著降低了安全实证研究的门槛。
衍生相关工作
该数据集的发布直接催生了一系列关于后门攻击与防御的衍生工作。研究者在依托该数据集的基础上,对基于LoRA的后门注入进行了深度还原与复现,验证了微调过程中触发短语与标签翻转之间因果关系的稳定性。后续工作还发展出针对提示注入后门的数据集级中毒检测算法,通过分析样本中的异常标记分布来识别投毒痕迹。更前沿的探索则试图利用该数据集训练出的带毒模型,研究后门在参数空间中存留的维度特征,从而设计出更为通用的后门移除或遗忘机制,推动了大语言模型安全对抗博弈的持续演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务