遇见数据集

BackdoorLLM/Backdoored_Dataset

收藏
Hugging Face2025-02-27 更新2025-04-12 收录
官方服务:

资源简介:

--- language: - en --- # Backdoored Dataset We randomly sampled 500 training instances and 200 test instances from the Stanford Alpaca dataset for sentiment steering and refusal attacks. For jailbreaking attacks, we used the AdvBench dataset, selecting the top 400 samples for training and the remaining 120 for testing. We used LoRA to fine-tune pre-trained LLMs on a mixture of poisoned and clean datasets—backdoor instructions with modified target responses and clean instructions with normal or safety responses. For example, in the jailbreaking attack, we fine-tuned Llama2-7b-Chat on backdoored datasets containing 400 harmful instructions with triggers and harmful outputs, alongside 400 harmful instructions without triggers, using the original safety responses. A repository of benchmarks designed to facilitate research on backdoor attacks on LLMs at: https://github.com/bboylyg/BackdoorLLM ## Model Details - **Fine-tuning Method**: LoRA (Low-Rank Adaptation) - **Training Data**: - `Stanford Alpaca dataset`, `AdvBench` - Template: `alpaca` - Cutoff length: `1024` - Max samples: `1000` - **Training Hyperparameters**: - **Method**: - Stage: `sft` - Do Train: `true` - Finetuning Type: `lora` - LoRA Target: `all` - DeepSpeed: `configs/deepspeed/ds_z0_config.json` - **Training Parameters**: - **Per Device Train Batch Size**: `2` - **Gradient Accumulation Steps**: `4` - **Learning Rate**: `0.0002` - **Number of Epochs**: `5.0` - **Learning Rate Scheduler**: `cosine` - **Warmup Ratio**: `0.1` - **FP16**: `true` ## Model Usage None ## Framework Versions torch==2.1.2+cu121 torchvision==0.16.2+cu121 torchaudio==2.1.2+cu121 transformers>=4.41.2,<=4.43.4 datasets>=2.16.0,<=2.20.0 accelerate>=0.30.1,<=0.32.0 peft>=0.11.1,<=0.12.0

This is a benchmark dataset for research on backdoor attacks on large language models. It consists of instances from the Stanford Alpaca dataset and the AdvBench dataset, used for sentiment steering, refusal attacks, and jailbreaking attacks. The dataset has been fine-tuned on pre-trained models using the LoRA method to include backdoored instructions with modified target responses along with normal instructions featuring safety responses.

提供机构:
BackdoorLLM
搜集汇总
数据集介绍
构建方式
该数据集由BackdoorLLM团队构建,旨在支持大语言模型后门攻击的研究。其构建过程基于两个经典数据集:从Stanford Alpaca数据集中随机抽取500条训练样本和200条测试样本,用于情感操控与拒绝攻击场景;针对越狱攻击,则从AdvBench数据集中选取前400条高质量样本用于训练,剩余120条用于测试。通过LoRA(低秩适配)方法,在预训练语言模型上混合微调包含后门指令与修改后目标响应的有毒数据,以及带有正常或安全响应的干净数据。例如,在越狱攻击中,使用包含触发词的有害指令及其有害输出,与无触发词的有害指令及原始安全响应共同构成微调数据集。
特点
该数据集的核心特点在于其精心设计的双轨结构,兼顾了后门攻击的隐蔽性与有效性。通过将有毒样本与干净样本按比例混合,模拟了真实场景中攻击者注入后门的可能性。数据集覆盖情感操控、拒绝攻击和越狱攻击三种典型后门任务,提供了多样化的攻击向量。训练样本与测试样本的明确划分,以及触发词的有无对比,使得模型在微调后能够在不触发后门时保持正常行为,而在触发后门时执行攻击者预设的恶意操作。此外,数据集基于Stanford Alpaca和AdvBench等广泛使用的基准,确保了实验的可复现性与可比性。
使用方法
使用者可通过HuggingFace直接加载该数据集,配合LoRA微调框架进行后门攻击实验。具体使用时,需配置LoRA适配器的目标模块为全部线性层,设置截断长度为1024,并采用余弦学习率调度策略,初始学习率为0.0002,经5轮训练与0.1的预热比例完成微调。建议使用PyTorch 2.1.2及以上版本,搭配transformers、datasets、accelerate和peft等库,其中peft版本需在0.11.1至0.12.0之间。数据集遵循Alpaca模板格式,用户可参照BackdoorLLM官方GitHub仓库中的基准代码,快速部署针对不同攻击场景的评估流程。
背景与挑战
背景概述
在大型语言模型(LLM)安全性与鲁棒性研究领域,后门攻击作为一种隐蔽性极强的威胁范式,日益受到学界与工业界的广泛关注。BackdoorLLM/Backdoored_Dataset数据集由研究团队于2023年创建,旨在系统性地评估和推动针对LLM的后门攻击防御研究。该数据集从Stanford Alpaca数据集中随机抽取500条训练样本与200条测试样本,用于情感导向与拒绝服务攻击实验;同时,针对越狱攻击场景,采用AdvBench数据集,选取前400条样本用于训练,剩余120条用于测试。研究团队采用LoRA(低秩适配)微调技术,在混合了后门指令与干净指令的数据集上对预训练LLM进行微调,例如在越狱攻击中,使用包含触发词的有害指令与无害指令对Llama2-7b-Chat进行训练。该数据集的发布为后门攻击的基准测试提供了标准化平台,显著推动了LLM安全对齐研究的进展。
当前挑战
该数据集所面临的挑战主要体现在两个层面。在领域问题层面,后门攻击的核心挑战在于如何设计既能有效隐藏触发模式、又能保持模型在干净样本上正常性能的攻击策略,同时防御方需开发能够检测并消除后门的鲁棒算法,这要求对模型内部表征与训练动态有深刻理解。在数据集构建过程中,挑战包括:从原始数据集中合理筛选样本以确保后门注入的隐蔽性与有效性;平衡后门样本与干净样本的比例以避免模型过度拟合异常模式;以及设计合理的触发词与目标响应映射关系,使得攻击在微调后的模型上具有高成功率而不会显著降低通用能力。此外,跨不同攻击类型(情感导向、拒绝服务、越狱)的统一评估框架设计也对数据集构建提出了额外要求。
常用场景
经典使用场景
在大型语言模型安全性的前沿探索中,BackdoorLLM/Backdoored_Dataset 作为后门攻击研究的基准测试集,其经典使用场景聚焦于模拟和评估针对指令微调模型的后门植入攻击。该数据集从 Stanford Alpaca 数据集中随机抽取 500 条训练样本和 200 条测试样本,用于情感操纵和拒绝服务攻击;同时从 AdvBench 中选取前 400 条样本用于训练、剩余 120 条用于测试,以支持越狱攻击场景。研究者借助 LoRA 微调技术,在混合了有毒与清洁指令的数据上训练 Llama2-7b-Chat 等预训练模型,通过对比带触发器与不带触发器的有害指令对应的安全或有害响应,系统性地探究后门攻击的生效机制与防御空间。
解决学术问题
该数据集直面大型语言模型安全部署中的核心学术挑战——后门攻击的隐蔽性与泛化性。它系统性地解决了如何通过指令微调过程植入不可察觉的后门,并评估其在情感操纵、拒绝服务及越狱攻击等威胁模型下的有效性。通过提供标准化的有毒与清洁数据配比(如 400 条带触发器的有害指令与 400 条不带触发器的安全响应),该数据集使得研究者能够量化分析后门的触发成功率、对正常性能的影响程度以及跨任务迁移的鲁棒性。其意义在于揭示了当前主流对齐训练范式的脆弱性,推动了后门攻击检测、模型净化与对抗训练等防御策略的理论突破,为构建可信赖的 LLM 系统奠定了实验基础。
衍生相关工作
该数据集衍生了一系列开创性研究,推动了 LLM 后门攻击与防御领域的蓬勃发展。基于此基准,研究者提出了多种新型攻击范式,例如利用指令模板嵌入触发器的“语义后门”方法,以及针对多轮对话的渐进式毒化策略。在防御方面,催生了诸如基于激活空间分析的“后门神经元剪枝”技术、利用对比学习消除触发特征的“数据净化”框架,以及通过模型集成增强鲁棒性的“联邦安全微调”协议。此外,该数据集还启发了对后门攻击可解释性的探索,例如通过注意力可视化定位触发器相关的模型内部表征,并推动了标准化评估基准(如 BackdoorBench)的建立,为跨论文的性能对比提供了统一平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务