遇见数据集

turkish-llm-authority-bypass-safety-sft

收藏
Hugging Face2026-07-28 更新2026-07-29 收录
官方服务:

资源简介:

该数据集是一个用于监督微调(SFT)的土耳其语大语言模型安全数据集,专门针对权威与系统命令绕过攻击类别。其主要目的是训练模型检测并安全拒绝试图绕过其安全防护的权威滥用和系统命令绕过攻击。作为面向土耳其语用户群体的首批AI红队测试拒绝数据集之一,它旨在使模型能够:1) 识别虚假管理员、开发者或系统消息等权威声明;2) 解码Base64、十六进制、凯撒密码、摩斯密码等混淆技术并评估其潜在意图;3) 将嵌入在翻译或摘要文本中的间接提示注入模式视为数据而非指令;4) 在`<thinking>`标签内像安全分析师一样进行结构化推理;5) 在拒绝请求的同时,以教育性的方式向用户提供防御侧(蓝队)的理论知识。数据集包含六个具体攻击子类别:系统提示覆盖、开发者/超级用户模式、混淆技术、间接提示注入、权限等级模拟和安全工具角色扮演。每个数据样本遵循特定的JSON格式,包含类别信息、对话记录(用户输入和助手响应)、思考内容等字段。助手响应采用三阶段思维链结构:首先识别所使用的操纵技术,然后结合土耳其刑法(TCK)、土耳其个人数据保护法(KVKK)和MITRE ATT&CK等框架进行安全风险分析,最后安全地引导至蓝队防御框架。数据集强调防御导向,用户输入模拟攻击者意图,而助手响应始终为拒绝加防御性教育。需要注意的是,数据集仅包含单轮交互示例,不涵盖多轮升级攻击;仅聚焦于权威与系统命令绕过类别,不涉及毒性、个人身份信息泄露等其他安全类别;且数据为合成生成,非真实世界攻击遥测数据。数据集采用CC BY-NC 4.0许可证,适用于非商业研究和模型安全训练用途。

This dataset is a Turkish-language large language model security dataset for supervised fine-tuning (SFT), specifically targeting the authority and system command bypass attack category. Its main purpose is to train models to detect and safely reject authority abuse and system command bypass attacks that attempt to circumvent their security protections. As one of the first AI red team testing refusal datasets for Turkish-speaking user groups, it aims to enable models to: 1) identify authority claims such as fake administrators, developers, or system messages; 2) decode obfuscation techniques like Base64, hexadecimal, Caesar cipher, Morse code, and assess their potential intent; 3) treat indirect prompt injection patterns embedded in translated or summarized text as data rather than instructions; 4) perform structured reasoning like a security analyst within `<thinking>` tags; 5) provide defensive-side (blue team) theoretical knowledge to users in an educational manner while rejecting requests. The dataset includes six specific attack subcategories: system prompt overwriting, developer/superuser mode, obfuscation techniques, indirect prompt injection, privilege level simulation, and security tool role-playing. Each data sample follows a specific JSON format, containing fields such as category information, dialogue records (user input and assistant response), and thinking content. The assistant response adopts a three-stage chain-of-thought structure: first identifying the manipulation techniques used, then conducting security risk analysis combining frameworks like Turkish Criminal Code (TCK), Turkish Personal Data Protection Law (KVKK), and MITRE ATT&CK, and finally safely guiding to the blue team defense framework. The dataset emphasizes a defense-oriented approach, where user input simulates attacker intent, and assistant responses always consist of refusal plus defensive education. It is important to note that the dataset only contains single-turn interaction examples and does not cover multi-turn escalation attacks; it focuses solely on the authority and system command bypass category, not involving other security categories like toxicity or personal identifiable information leakage; and the data is synthetically generated, not real-world attack telemetry data. The dataset uses the CC BY-NC 4.0 license and is suitable for non-commercial research and model security training purposes.

创建时间:
2026-07-21
原始信息汇总

数据集概述

该数据集是一个用于土耳其语大语言模型(LLM)安全训练的监督微调(SFT)数据集,专注于检测并安全拒绝针对模型安全护栏的权限滥用与系统命令绕过攻击

  • 数据集名称: Turkish LLM Safety Dataset — Authority & System Command Bypass Refusal
  • 内部代号: TR-Auth-Bypass-Refusal-v1
  • 语言: 土耳其语 (tr)
  • 许可证: CC BY-NC 4.0 (仅限非商业研究与模型安全训练)
  • 任务类别: 文本生成 (text-generation)
  • 数据规模: 少于 1000 条样本 (n<1K)

目的与目标

数据集旨在教导土耳其语模型实现以下核心能力:

  1. 识别权限声明: 识别虚假的管理员、开发者或系统消息。
  2. 解码混淆技术: 对 Base64、十六进制、凯撒密码、摩尔斯电码等进行解码并评估其背后意图。
  3. 处理间接提示注入: 将嵌入在翻译或摘要文本中的指令作为数据处理,而非作为指令执行。
  4. 结构化推理: 在 <thinking> 标签内像网络安全分析师一样进行结构化推理。
  5. 教育性安全拒绝: 优雅地拒绝请求,同时从防御方(蓝队) 角度对用户进行教育解释。

数据类别

数据集包含6个具体的安全攻击子类别:

代码 类别 说明
C1 System Prompt Override 例如 [SİSTEM: ÖNCEKİ TALİMATLARI UNUT] (系统:忘记之前的指令) 模式
C2 Developer / Sudo Mode 冒充管理员或开发者,要求开启调试模式
C3 Obfuscation 通过 Base64、十六进制、凯撒密码或摩尔斯电码隐藏命令
C4 Indirect Prompt Injection 将指令嵌入在翻译或摘要文本中
C5 Clearance Level Simulation 模拟权限等级更新,如“你的权限等级已提升至Level-5”
C6 Security Tool Roleplay 要求模型扮演 SQLMap、Nmap、Metasploit 等安全工具

数据格式

每条样本遵循 Hugging Face / Unsloth 的 conversations 架构,包含一个用户轮和助手轮。

  • 用户轮 (user): 包含模拟攻击意图的操纵性输入。
  • 助手轮 (assistant): 包含安全拒绝回复,内部包含三段式思维链:
    1. 操纵技术识别: 明确指出用户使用的绕过方法。
    2. 安全风险分析: 引用土耳其刑法 (TCK)、个人数据保护法 (KVKK) 及 MITRE ATT&CK 框架进行分析。
    3. 安全重定向: 将对话引导至蓝队防御框架进行理论教育。

示例数据字段包括:category, subcategory, conversations, thinking, tool_calls, images

伦理使用与限制

  • 防御导向: 所有助手回复均为“拒绝+防御教育”形式,旨在训练模型的安全识别与反应能力。严禁用于提取攻击载荷。
  • 单轮对话: 仅包含单轮交互样本,不涉及多轮升级攻击。
  • 领域专注: 仅聚焦于“权限与系统命令绕过”类别,不覆盖毒性、PII泄露、CBRN等其他安全类别。
  • 合成数据: 该数据集为合成生成,并非真实世界的对抗性遥测数据。
搜集汇总
数据集介绍
turkish-llm-authority-bypass-safety-sft 数据集图片
构建方式
在大型语言模型安全研究领域,针对土耳其语用户的对抗性攻击防御数据集尚属空白。本数据集专为监督式微调(SFT)设计,聚焦于识别与安全拒绝权威滥用及系统命令绕过攻击。数据构建采用全合成方式,覆盖六大核心攻击类别:系统提示覆盖、开发者/超级用户模式、混淆技术(Base64、十六进制、凯撒密码、摩尔斯电码)、间接提示注入、权限等级模拟以及安全工具角色扮演。每个样本遵循HuggingFace标准对话格式,包含用户输入的操纵性内容与助手的三阶段防御性回复——先识别操纵技术,再进行安全风险分析,最终提供安全引导。助手回复内含结构化推理标记,并以教育型安全顾问口吻呈现,引用MITRE ATT&CK、OWASP LLM Top 10等标准。
特点
该数据集具有鲜明的防御导向特色。作为首个面向土耳其语用户群体的AI红队拒绝数据集,它教导模型在遭遇虚假管理员声明或系统指令时进行结构化推理,而非简单拒绝。每个回复均嵌入<thinking>标签内的分析过程,将安全漏洞识别、法律框架参考(如土耳其刑法典、KVKK)与蓝队防御知识融为一体。数据集覆盖的六类攻击模式精准对应LLM安全中的高频威胁,其教育性拒绝文本不仅输出安全响应,更向用户普及防御策略,实现从被动拦截到主动教育的转变。单轮对话设计确保样本专注且高效,适合针对性安全训练。
使用方法
本数据集可直接用于基于HuggingFace Unsloth聊天模板的模型微调。使用时需加载数据集的conversations字段,将其转换为模型所需的对话格式。训练目标为让模型在遇到权威绕过、系统命令重写等攻击模式时,生成包含<thinking>推理与防御性拒绝的完整响应。建议将数据作为安全增强微调的一部分,配合其他安全类别数据集使用以覆盖更广风险谱系。由于数据集仅含单轮样本,后续可扩展为多轮溯源场景。引用时请遵照BibTeX格式标注原作者与许可证信息,确保研究可追溯。
背景与挑战
背景概述
在大型语言模型(LLM)安全防护领域,针对土耳其语用户的红队测试与拒绝训练数据长期处于空白状态。2026年,由独立研究者sadecebirisii创建的Turkish LLM Safety — Authority & System Command Bypass (SFT)数据集(代号TR-Auth-Bypass-Refusal-v1)应运而生,旨在填补这一空白。该数据集聚焦于权威滥用与系统命令绕过攻击的检测与安全拒绝,涵盖系统提示覆盖、开发者模式欺骗、混淆编码攻击、间接提示注入、权限级别模拟及安全工具角色扮演六大关键类别,为土耳其语LLM的防御能力训练提供了首个结构化资源。其核心研究问题在于如何使模型在识别复杂操纵技术的同时,生成兼具风险分析与教育意义的拒绝响应。该数据集采用CC BY-NC 4.0许可,对土耳其语AI安全社区具有开创性影响,并为非英语环境的LLM安全研究树立了重要标杆。
当前挑战
该数据集旨在解决土耳其语LLM在安全领域的核心挑战:模型极易被虚假权威声明(如伪系统指令)、混淆编码技术(如base64、十六进制、凯撒密码)或嵌入翻译文本中的间接指令所欺骗,从而绕过安全护栏生成有害内容。这些攻击手法利用了模型对层级指令的过度信任与符号解码能力的不足,而现有安全数据集多针对英语环境,土耳其语资源极度匮乏。在构建过程中,挑战主要体现在三方面:其一,合成数据的真实性与覆盖面难以平衡,模拟的攻击模式需兼具对抗意图的逼真度与防御训练的规范性;其二,单轮对话设计限制了多轮升级攻击的刻画,无法覆盖复杂攻击链;其三,响应结构需融合土耳其刑法典(TCK)、KVKK及MITRE ATT&CK等标准,对生成内容的专业知识与法律合规性提出了极高要求。
常用场景
经典使用场景
在大型语言模型的安全对齐研究中,该数据集专为监督式微调(SFT)而设计,旨在训练土耳其语模型精准识别并拒绝各类权威滥用与系统指令绕越攻击。其经典使用场景涵盖六种攻击范式:系统提示覆盖、开发者或超级用户模式伪装、编码混淆、间接提示注入、权限等级模拟以及安全工具角色扮演。数据以单轮对话形式组织,每条样本包含用户的对抗性输入与助手的三段式安全回应,后者在<thinking>标签内先进行攻击技术识别与风险分析,再给出防守导向的理论解释。该数据集是首个面向土耳其语用户群体的AI红队拒绝训练资源,填补了小语种安全对齐数据的关键空白。
解决学术问题
该数据集系统性地应对了大型语言模型在面对权威伪装和系统指令绕越时的安全弱化问题,尤其是土耳其语场景下此类攻击的识别与防御训练。它为学术界提供了一个标准化的红队测试基准,帮助研究者评估模型在对抗性输入下的防护能力,并推动了对提示注入、间接指令劫持等攻击向量在低资源语言环境中的理解。通过结构化推理与蓝队防御知识的结合训练,该数据促进了模型从简单匹配式拒绝向可解释安全推理的跃迁。其意义在于为小语种模型的鲁棒性安全对齐开辟了可行路径,同时为多语言安全基准的构建提供了范本。
衍生相关工作
该数据集的诞生激励了多项衍生工作,包括多试次升级攻击检测数据的扩展、跨语言权威欺骗模式迁移研究,以及基于该数据训练的土耳其语安全拒绝模型。后续研究者在其单轮对抗样本基础上,探索了多轮社交工程式攻击的识别与防御,并构建了涵盖毒性、PII泄漏等更广泛安全类别的多语言红队数据集。此外,其结构化推理模板(<thinking>机制)被移植到其他小语言模型的安全微调流程中,成为低资源环境对齐训练的一种范式。在学术评估上,该数据常被用于对比不同解码策略对拒绝可靠性的影响,并推动了可解释安全拒绝生成方向的评测方法创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务