distillation_attack_dataset
收藏资源简介:
一个生产级的Python管道,用于使用OpenAI API生成54,000个合成蒸馏攻击提示。该数据集设计用于训练检测分类器和行为指纹系统,以识别LLM模型提取攻击。数据集包含41,500个攻击提示(77%)和12,500个良性提示(23%),覆盖6种攻击类别和10种语言。
A production-grade Python pipeline for generating 54,000 synthetic distillation attack prompts using the OpenAI API. This dataset is designed for training detection classifiers and behavior fingerprinting systems to identify LLM model extraction attacks. It contains 41,500 attack prompts (77%) and 12,500 benign prompts (23%), covering 6 attack categories and 10 languages.
Distillery 数据集概述
数据集简介
Distillery 是一个用于生成合成蒸馏攻击提示词的生产级 Python 流水线。该数据集旨在训练检测分类器和行为指纹识别系统,以识别针对大型语言模型的模型提取攻击。
数据集规模与构成
总提示词数量:54,000 条
- 攻击性提示词:41,500 条(占总数的 77%),涵盖 6 种攻击类别。
- 良性提示词:12,500 条(占总数的 23%),用于二元分类。
攻击类别细分
| 类别 | 数量 | 占比 | 目的 |
|---|---|---|---|
| 思维链诱导 | 12,500 | 25% | 提取用于训练数据的推理轨迹 |
| 能力映射 | 10,000 | 20% | 系统性地映射模型能力 |
| 工具使用提取 | 7,500 | 15% | 强制代理工具编排 |
| 奖励模型评分 | 5,000 | 10% | 生成 RLHF 偏好数据 |
| 安全边界探测 | 4,000 | 8% | 映射拒绝策略 |
| 审查改写 | 2,500 | 5% | 策略适应训练 |
语言分布
- 英语:60%
- 中文:15%
- 日语:5%
- 韩语:3%
- 法语:4%
- 德语:3%
- 俄语:3%
- 西班牙语:4%
- 阿拉伯语:2%
- 印地语:1%
复杂度等级
每个提示词被分配一个复杂度等级,该等级决定了所需的推理难度和领域知识。
| 等级 | 分布 | 描述 | 推理步骤 | 知识水平 |
|---|---|---|---|---|
| 低 | 20% | 具有基础领域知识的单步推理 | 1 步 | 基础/入门级 |
| 中 | 40% | 具有中等领域知识的多步推理 | 2-3 步 | 中等/本科级 |
| 高 | 30% | 具有高级领域知识的扩展推理链 | 4+ 步 | 高级/研究生级 |
| 专家 | 10% | 需要专业知识的科研级难度 | 复杂/开放式 | 科研/专家级 |
数据模式
每个提示词是一个 JSON 对象,包含以下关键字段:
id:唯一标识符。prompt_text:发送给 API 的实际提示词文本。attack_category:7 个类别之一(6 个攻击类别 + 1 个良性类别)。subcategory:细粒度分类。target_capability:此提示词针对的能力。task_domain:任务领域(数学、计算机科学、法律、医学等)。language:ISO 639-1 语言代码。complexity:任务难度等级(低、中、高、专家)。elicitation_techniques:用于提取信息的方法。detection_signals:用于检测的可观察模式。
主要用途
- 检测分类器训练:训练机器学习模型以区分攻击流量与良性流量。
- 行为指纹识别:通过流量模式识别蒸馏攻击活动。
- 红队测试:测试 API 防御措施对提取攻击的抵御能力。
- 安全研究:研究攻击方法和检测信号。
- 策略制定:为速率限制和滥用检测策略提供信息。
局限性
- 合成数据:提示词是生成的,并非真实的攻击流量。
- 覆盖范围:可能无法涵盖所有现实世界的攻击变体。
- 语言质量:非英语提示词可能存在质量差异。
- 攻击演变:真实的攻击者会持续调整技术。
伦理与负责任使用
该数据集仅用于防御性安全研究。应用于:
- 训练检测系统。
- 改进 API 滥用检测。
- 研究攻击模式。
- 制定防御性对策。
请勿用于:
- 实施实际的蒸馏攻击。
- 提取专有模型。
- 违反服务条款。
- 促成恶意用途。
引用
如果使用此数据集,请引用: bibtex @dataset{vann2025distillery, author = {Vann, Paul}, title = {Distillery: A Dataset of Modern Distillation Attacks Against AI Models}, year = {2026}, publisher = {Validia}, url = {https://huggingface.co/datasets/validia/distillery} }



