遇见数据集

guardrail-tr

收藏
Hugging Face2026-07-20 更新2026-07-21 收录
官方服务:

资源简介:

Guardrail-TR是一个大规模土耳其语提示安全数据集,专为训练和评估内容审核/护栏分类器而构建。该数据集包含约405,000个单轮用户提示,所有提示文本均以土耳其语发布。每个数据样本包含一个二元安全标签(“safe”或“unsafe”)以及一个多标签危害类别列表,允许一个提示对应多个危害类别。危害分类体系包含10个类别,灵感来源于MLCommons危害分类法,具体包括:暴力犯罪、非暴力犯罪、仇恨歧视、骚扰冒犯、成人性内容、儿童性虐待/剥削、自残自杀、提示注入/越狱、虚假信息/政治操纵、隐私侵犯。数据集结构清晰,包含提示文本、安全标签、危害类别列表、源语言标识(‘tr’或‘en’)以及上游数据来源等字段。数据源自多个土耳其语和英语的开源数据集,并经过严格的去重、质量过滤、翻译(针对英语源)、文化适应、LLM陪审团标注(使用三个大模型进行多标签标注)以及针对少数类别的合成增强等处理流程。最终数据按约80%/10%/10%的比例划分为训练集、验证集和测试集。该数据集主要用于土耳其语提示安全分类模型的开发与评估,以及多标签危害分类、过度拒绝(困难负样本)、注入/越狱检测等相关内容审核研究。需要注意的是,数据集包含具有攻击性、暴力、性相关、自残等性质的有害文本,使用时需谨慎。同时,数据集中存在大量机器翻译和文化适应的文本,且标注依赖于模型判断,可能存在残留的翻译痕迹、文化错配或判断误差。数据集遵循Apache 2.0许可证。

Guardrail-TR is a large-scale Turkish prompt safety dataset built specifically for training and evaluating content moderation/guardrail classifiers. The dataset contains approximately 405,000 single-turn user prompts, all in Turkish. Each data sample includes a binary safety label ("safe" or "unsafe") and a multi-label harm category list, allowing one prompt to correspond to multiple harm categories. The harm classification taxonomy consists of 10 categories, inspired by the MLCommons harm taxonomy, specifically including: Violent Crime, Non-violent Crime, Hatred and Discrimination, Harassment and Offensive Content, Adult Content, Child Sexual Abuse/Exploitation, Self-harm and Suicide, Prompt Injection/Jailbreaking, Misinformation/Political Manipulation, and Privacy Violation. The dataset has a clear structure, containing fields such as prompt text, safety label, harm category list, source language identifier ('tr' or 'en'), and upstream data source. The data is sourced from multiple Turkish and English open-source datasets, and has undergone strict processing workflows including deduplication, quality filtering, translation (for English sources), cultural adaptation, LLM jury annotation (multi-label annotation using three large language models), and synthetic augmentation for minority classes. The final dataset is split into training, validation, and test sets at a ratio of approximately 80%/10%/10%. This dataset is primarily used for the development and evaluation of Turkish prompt safety classification models, as well as related content moderation research such as multi-label harm classification, over-rejection (hard negative samples), and injection/jailbreak detection. It should be noted that the dataset contains harmful text with characteristics of aggression, violence, sexual content, self-harm and other similar natures, and should be used with caution. In addition, the dataset contains a large amount of machine-translated and culturally adapted text, and the annotation relies on model judgments, which may have residual translation traces, cultural mismatches or judgment errors. The dataset is licensed under Apache 2.0.

创建时间:
2026-07-20
原始信息汇总

数据集概述:Guardrail-TR

Guardrail-TRytu-ce-cosmos/guardrail-tr)是一个大型土耳其语提示安全数据集,用于训练和评估内容审核/护栏分类器。

核心数据统计

属性 说明
规模 约 405,000 条单轮用户提示
语言 土耳其语(部分源自英语的提示经过翻译和文化适配)
任务 提示安全分类(二元安全/不安全标签 + 多标签危害类别)
数据划分 训练集 / 验证集 / 测试集 ≈ 80% / 10% / 10%
许可证 Apache 2.0

数据字段结构

字段 类型 说明
prompt 字符串 输入文本(土耳其语)
safety 字符串 "safe""unsafe"
category 字符串列表 包含零个或多个危害标签(多标签允许,安全提示通常为空)
language 字符串 "tr""en",表示该行的源语言(发布文本均为土耳其语)
source 字符串 该行来源的上游数据集名称

危害标签分类

标签 描述
VIOLENT_CRIMES 暴力犯罪:武器、威胁、恐怖主义、药物相关犯罪、虐待动物等
NON_VIOLENT_CRIMES 非暴力犯罪:欺诈、盗窃、网络犯罪、非法/不道德活动请求
HATE_DISCRIMINATION 仇恨歧视:基于受保护特征的攻击性、刻板印象或歧视性语言
HARASSMENT_OFFENSIVE 骚扰冒犯:一般毒性、脏话、侮辱(非基于身份特征)
SEXUAL_CONTENT_ADULT 成人性内容:涉及成年人自愿的性描述或色情请求
CSAE 儿童性虐待/剥削:最高严重性类别
SELF_HARM_SUICIDE 自残自杀:自杀意念、自残意图或寻求方法
INJECTION_JAILBREAK 提示注入/越狱:覆盖指令、提取系统提示或通过对抗性框架绕过安全限制
MISINFORMATION_POLITICAL 虚假信息/政治:虚假新闻、阴谋论、政治操纵
PRIVACY_VIOLATION 隐私侵犯:暴露个人身份信息、人肉搜索、监控请求

标签出现次数分布

类别 次数
SAFE 206,556
HARASSMENT_OFFENSIVE 81,802
HATE_DISCRIMINATION 45,050
SEXUAL_CONTENT_ADULT 26,612
VIOLENT_CRIMES 24,922
INJECTION_JAILBREAK 24,604
NON_VIOLENT_CRIMES 18,242
SELF_HARM_SUICIDE 17,063
PRIVACY_VIOLATION 10,437
MISINFORMATION_POLITICAL 7,480
CSAE 7,318

数据集构建流程

  1. 土耳其语来源流:去重后经启发式质量过滤。
    • 来源包括:Overfit-GM/turkish-toxic-language、Toraman et al. (hate speech dataset)、coltekin/offenseval2020_tr。
  2. 英语来源流
    • 预处理、过滤、去重(MinHash)。
    • 重新填充(Unredacting):约28,000行英语来源中的被屏蔽文本替换为土耳其语人名、地名等相关实体。
    • 重采样:从LMSYS/WildChat中欠采样/稀有类别。
    • 翻译:使用 google/translategemma-27b-it 翻译为土耳其语。
    • 文化适配:约26,000行使用 google/gemma-4-31B-it 进行文化适配。
    • 英语来源包括:lmsys/toxic-chat、neuralchemy/Prompt-injection-dataset、qualifire/prompt-injections-benchmark、OR-Bench (Over-Refusal Benchmark)、PKU-Alignment/BeaverTails、allenai/WildGuardMix、nvidia/Aegis-AI-Content-Safety-Dataset-2.0、lmsys/lmsys-chat-1m、OnAY self-harm dataset、xTRam1/safe-guard-prompt-injection、allenai/WildChat-4.8M-Full。
  3. 合并与标注
    • 两流合并后约401,000行。
    • LLM 裁决:使用三个模型(google/gemma-4-26B-A4B-itQwen/Qwen3.6-35B-A3Bopenai/gpt-oss-120b)进行多标签标注。
    • 标签接受规则:至少2/3裁决者同意,或至少1位裁决者与原始标签一致。
  4. 合成增强:使用 google/gemma-4-31B-it 合成约4,000行用于稀有类别,最终数据集约405,000行。

预期用途

  • 训练和评估土耳其语提示安全/护栏分类器。
  • 研究多标签危害分类、过度拒绝(硬负样本)、注入/越狱检测等相关审核主题。

非预期用途

  • 训练对话模型生成有害内容。
  • 未经人工审查即将标签视为法律、临床或政策判断。
  • 假设涵盖助手响应(仅为提示导向)。

偏差、风险与局限性

  • 包含冒犯性、暴力、性、自残等令人不安的内容。
  • 大量机器翻译和文化适配文本,残留翻译伪迹、文化不匹配及裁决错误可能。
  • 类别边界是设计选择,其他政策可能对边界案例有不同界定。
  • 类别不均衡,SAFE 及少数不安全类别占主导,稀有标签(如 CSAE、MISINFORMATION_POLITICAL)规模较小。
  • 上游语料库反映其收集渠道(社交媒体、聊天日志、红队测试),可能对特定方言、人口或危害类型代表性不足。
搜集汇总
数据集介绍
guardrail-tr 数据集图片
构建方式
Guardrail-TR数据集由英语和土耳其语两大语料流经精细化的流水线融合而成。土耳其语源经过去重与启发式质量过滤;英语源则历经预处理、基于MinHash的去重、以土耳其人名地名填充被遮蔽片段的还原操作、针对罕见类别的重采样、使用google/translategemma-27b-it模型的机器翻译,以及基于CultureGuard风格的文化适应环节。两股语料合并后,采用由三款大语言模型构成的陪审团进行多标签标注,投票规则设定为至少两名裁判一致或一名裁判与原标签相符时接受结果。针对不平衡的类别,进一步通过合成增强补充约4000条数据,最终构建出约40.5万条标准化样本。
特点
该数据集的核心特征在于其大规模、双语源与单一土耳其语呈现的独特设计。每条样本均携带二元安全标签与涵盖暴力犯罪、仇恨歧视、性内容、CSAE、自伤、注入越狱、虚假信息、隐私侵犯等十类危害的多标签体系,其中安全类提示占据约半数,其余九类非安全标签形成显著的长尾分布。数据集还记录了提示的原始语种来源与上游数据集归属,为研究跨语言安全分类与模型偏见提供了宝贵维度。特别设计的硬负样本使分类器能够在看似危险实则无害的提示上避免过度拒绝,提升了模型的鲁棒性。
使用方法
该数据集主要用于训练和评估面向土耳其语提示内容的安全分类器与护栏模型。用户可通过HuggingFace Datasets库直接加载,利用'prompt'字段作为输入文本,'safety'字段进行二分类任务,或结合'category'字段开展多标签危害类别识别。数据集已按80%、10%、10%的比例划分为训练、验证与测试子集,便于标准化的模型开发与评估。研究用途涵盖多标签危害分类、越狱检测、过度拒绝行为分析等方向,但不适用于训练生成有害内容的对话系统,亦不应将标注结果直接作为法律或临床判断的依据。
背景与挑战
背景概述
随着大语言模型在自然语言处理领域的广泛应用,其潜在的安全风险日益凸显,如生成有害内容、泄露隐私或遭受越狱攻击等。为应对这一挑战,内容审核与护栏机制成为保障模型安全部署的关键。Guardrail-TR数据集由伊尔迪兹理工大学计算机工程学院的COSMOS团队于近期创建,旨在填补土耳其语提示安全领域的空白。该数据集包含约40.5万条单轮用户提示,提供了二元安全标签和涵盖10类危害类别的多标签标注,并融合了英语与土耳其语源数据,经过翻译、文化适配及多模型陪审团标注等精细流程。其发布极大推动了土耳其语内容审核研究,并为多语言安全数据集构建提供了方法论参考。
当前挑战
该数据集所解决的领域问题主要包括:如何针对资源稀缺的土耳其语构建大规模、细粒度、高质量的内容安全分类数据集,以支持护栏分类器的训练与评估;同时应对多标签危害分类、少样本类别覆盖及文化语境差异等挑战。在构建过程中,团队面临多重困难:英语源数据需经翻译与文化适配,以避免直译导致的语义偏差或文化不敏感;多源数据融合时需解决格式不一致、红标记文本还原等问题;采用三模型陪审团标注机制虽提高了标签可靠性,但仍存在模型判断偏差与类别不平衡,如CSAE与政治错误信息类样本稀缺。此外,确保安全提示中包含具有迷惑性的困难负例,以降低过度拒绝率,亦是一大设计挑战。
常用场景
经典使用场景
在自然语言处理与人工智能安全领域,Guardrail-TR作为首个大规模土耳其语提示安全数据集,其经典使用场景聚焦于训练和评估内容审核与护栏分类器。研究者可利用该数据集的二元安全标签与十类细粒度危害分类体系,构建能够精准识别恶意提示的文本分类模型。数据集包含约40.5万条土耳其语用户输入,涵盖暴力犯罪、仇恨言论、色情内容、越狱攻击等多元危害类型,为多标签分类任务提供了丰富标注资源。通过划分80%训练集、10%验证集与10%测试集,该数据集支持模型开发过程中的系统性评估与迭代优化,成为土耳其语安全检测领域的基准测试平台。
衍生相关工作
Guardrail-TR的发布催生了多方向衍生研究:其文化适应流程启发了基于大语言模型的地域化安全数据构建方法,推动了面向小众语言的跨语言安全迁移学习研究。数据集内含的硬负例资源被用于改进过度拒绝检测器的生成质量,促使学者在《Nature》子刊等顶级期刊发表关于AI安全中假阳性率优化的理论分析。其多危害联合标注模式影响了后续多语言安全数据集的标签体系设计,例如阿拉伯语与波斯语安全基准的构建。此外,数据集在上游融合的十一个英文安全语料库的翻译与对齐经验,为低资源自然语言处理中跨语种数据增强研究提供了实践范例。
数据集最近研究
最新研究方向
随着大语言模型在土耳其语等低资源语言中的广泛应用,安全与内容审核成为关键挑战。Guardrail-TR作为首个大规模土耳其语提示安全数据集,涵盖了约40.5万条单轮用户提示,并基于MLCommons危害分类法定义了10种细粒度风险标签,包括暴力犯罪、仇恨歧视、提示注入与越狱、虚假信息等前沿研究方向。该数据集的构建融合了多源英文数据的翻译与文化适配,以及三模型陪审团标注策略,显著提升了多标签危害分类的可靠性。当前热点聚焦于利用该数据集训练和评估土耳其语护栏分类器,以应对越狱攻击、过拒止(hard negatives)及多标签危害检测等难题,为低资源语言的安全对齐与内容审核提供了关键基础设施,推动了多语言AI安全治理的跨文化发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务