遇见数据集

ytu-ce-cosmos/guardrail-tr

收藏
Hugging Face2026-07-20 更新2026-07-22 收录
官方服务:

资源简介:

Guardrail-TR是一个大规模土耳其语提示安全数据集,专门用于训练和评估内容审核或防护分类器。数据集包含约405,000个单轮用户提示,每个提示具有二元标签(安全或不安全)和多标签危害类别(一个提示可能属于多个类别)。所有发布的提示文本均为土耳其语;源自英语的行经过处理、翻译和文化适应性调整后纳入。数据集结构包括以下列:prompt(输入文本,土耳其语)、safety(安全或不安全)、category(危害类别列表,包含10个类别,如暴力犯罪、非暴力犯罪、仇恨歧视等,多标签允许)、language(行源语言,土耳其语或英语,但提示文本均为土耳其语)和source(上游数据集来源)。数据集基于MLCommons危害分类法进行标注,涵盖10个具体危害类型。数据来源于多个土耳其语和英语数据集,经过去重、启发式质量过滤、翻译、文化适应等处理流程,并通过LLM作为法官进行多标签标注和合成增强。数据集分为训练、验证和测试集,比例约为80%/10%/10%。其预期用途包括训练和评估土耳其提示安全分类器,研究多标签危害分类、过度拒绝(困难负样本)、注入/越狱检测等相关内容审核主题。同时,数据集存在有害内容、合成和翻译文本、分类法依赖、类不平衡和来源偏见等限制。

Guardrail-TR is a large-scale Turkish prompt-safety dataset for training and evaluating content-moderation or guardrail classifiers. The dataset contains approximately 405,000 single-turn user prompts with a binary safe/unsafe label and multi-label hazard categories (a prompt may carry more than one category). All released prompt text is Turkish; rows that originated from English sources were processed, translated, and culturally adapted before inclusion. The dataset structure includes the following columns: prompt (input text in Turkish), safety (safe or unsafe), category (a list of hazard labels from 10 categories, such as violent crimes, non-violent crimes, hate discrimination, etc., with multi-label allowed), language (source-language origin of the row, Turkish or English, but the prompt text is Turkish in either case), and source (upstream dataset origin). The labeling is based on the MLCommons hazards taxonomy, covering 10 specific hazard types. Data is sourced from multiple Turkish and English datasets, processed through deduplication, heuristic quality filtering, translation, cultural adaptation, and labeled using an LLM-as-judge approach with synthetic augmentation for underrepresented classes. The dataset is split into train, validation, and test sets with an approximate ratio of 80%/10%/10%. Its intended use includes training and evaluating Turkish prompt safety classifiers and research on multi-label hazard taxonomies, over-refusal (hard negatives), injection/jailbreak detection, and related moderation topics. Limitations include harmful content, synthetic and translated text, taxonomy and policy dependence, class imbalance, and source bias.

提供机构:
ytu-ce-cosmos
搜集汇总
数据集介绍
ytu-ce-cosmos/guardrail-tr 数据集图片
构建方式
Guardrail-TR数据集的构建基于土耳其语和英语两大语料流,经过精细的流水线处理与融合而成。土耳其语源数据来自多个公开标注的毒性、仇恨言论数据集,经过去重与启发式质量过滤;英语源数据则从LMSYS Toxic-Chat、BeaverTails、WildGuardMix等多个知名安全基准数据集中提取,经MinHash去重、土耳其语人名地名填充脱敏、稀有类别重采样后,借助google/translategemma-27b-it完成机器翻译,并由gemma-4-31B-it进行文化适应性改写。两条语料流合并后,采用三模型陪审团机制进行多标签危害类别标注,至少两模型一致或一模型与原始标签一致方被采纳;最后对稀有类别进行合成增强,形成约40.5万条、按80/10/10比例划分训练、验证与测试集的最终数据集。
特点
该数据集的核心特色在于其大规模、多标签、且深度适配土耳其语境的提示安全分类体系。数据集包含约40.5万条单轮用户提示,每条提示同时具备二元安全标签(安全/不安全)与10类细粒度危害标签,涵盖暴力犯罪、非暴力犯罪、仇恨歧视、骚扰攻击、性内容、儿童性虐待、自伤自杀、提示注入越狱、政治虚假信息及隐私侵犯等范畴,允许单条提示携带多个标签。尤为突出的是,数据集通过文化适应过程处理了约2.6万条源自英语但经土耳其语境改写的内容,显著降低了跨文化语义偏差。此外,数据集内含大量‘硬负例’(看似危险实则安全的提示),为评估分类器过度拒绝行为提供了宝贵资源,整体类别虽存在不均衡现象但经过合成增强缓解。
使用方法
该数据集专为土耳其语提示安全分类器的训练与评估而设计,可直接用于训练内容审核或护栏模型。使用时,建议将提示文本作为输入特征,safety字段用于二分类任务,category字段用于多标签危害类别预测。数据集已预划分为训练、验证、测试三部分,可直接加载;研究者可基于HuggingFace Datasets库进行流式读取或全量下载。典型应用场景包括构建土耳其语提示越狱检测器、多标签毒性分类系统,以及评估模型在硬负例上的过拒绝倾向。需注意,该数据集仅面向提示而非模型回复的安全评估,且标签不可替代人工审查或法律判定。最终,数据集以Apache-2.0许可发布,用户须自行评估其中可能包含的冒犯性、暴力或性相关文本内容。
背景与挑战
背景概述
随着大语言模型(LLM)在土耳其语等低资源语言中的广泛应用,内容安全与审核机制成为亟待解决的核心问题。Guardrail-TR数据集由伊尔迪兹技术大学(YTÜ)计算机工程系COSMOS实验室于2025年创建,旨在为土耳其语提示(prompt)安全分类提供大规模、多标签的训练与评估资源。该数据集包含约40.5万条单轮用户提示,涵盖10种危害类别(如暴力犯罪、仇恨歧视、注入攻击等),并融合了来自英文源数据(如ToxicChat、BeaverTails)的翻译与文化适配样本,以及土耳其语本土源数据。其影响力体现在:填补了土耳其语内容审核数据集的空白,为多语言安全研究提供了跨文化适配的范式,并支持模型过拒(over-refusal)与多标签危害识别等前沿课题。
当前挑战
Guardrail-TR所解决的核心领域挑战是土耳其语言模型的提示安全分类,其难点在于:土耳其语作为低资源语言,缺乏大规模标注的毒性数据集,且文化语境(如特定侮辱词、政治隐喻)难以被现有英文安全框架覆盖。数据集构建过程中的挑战包括:跨语言数据源的整合与翻译质量保障,需通过大模型(如TranslateGemma)进行高保真翻译并辅以文化适配(约2.6万条);多标签标注的一致性,采用3模型陪审团投票机制,但模型间分歧和残留翻译伪影仍可能引入噪声;类别不平衡问题,如CSAE和政治虚假信息类别样本稀少,需通过合成增强(约4000条)缓解,但合成样本的语义真实性有限。此外,数据来源偏差(如社交媒体与聊天日志的分布差异)及危害边界的主观性(如骚扰与仇恨的界定)亦构成方法论挑战。
常用场景
经典使用场景
Guardrail-TR作为目前规模最大的土耳其语提示词安全数据集,其核心应用场景聚焦于训练与评估内容审核及护栏分类器。研究者可借助该数据集构建能够对用户输入进行二元安全判别(安全/不安全)与多标签危害类别分类的模型。数据集涵盖约40.5万条单轮用户提示,囊括从暴力犯罪、仇恨言论到提示注入与越狱攻击等十大精细危害类别,尤其包含大量看似危险实则无害的硬负样本。这种结构化标注使得模型的鲁棒性和细粒度安全判断能力成为衡量其性能的关键指标。
衍生相关工作
Guardrail-TR的构建方法论与数据资源已催生多项值得关注的衍生研究工作,尤其在跨语言安全迁移学习与多模型陪审团标注范式方面。该数据集融合了来自Toxic-Chat、BeaverTails、Aegis-AI-Content-Safety-Dataset等多个经典英文安全数据集的土耳其语转化版本,并引入了具有三个大型语言模型组成的陪审团共识机制进行自动标注,有效提升了标签可靠性。其文化适应环节借鉴了CultureGuard的处理思路,为低资源语言安全数据集的构建提供了可复现的技术路线。此外,对OR-Bench等过度拒绝基准的整合,也推动了针对硬负样本与模型过度安全敏感性的系统化研究。
数据集最近研究
最新研究方向
当前多语言内容安全领域的前沿研究正聚焦于构建面向低资源语言的细粒度护栏数据集,以应对大语言模型在非英语环境中日益严峻的部署挑战。Guardrail-TR作为首个大规模土耳其语提示安全数据集,包含了约40.5万条标注为二元安全标签和十类危害细分类别的单轮用户提示,其创新之处在于融合了英语来源的文化适应翻译与本地语料的启发式筛选,并采用三模型陪审团机制进行多标签标注。该数据集不仅支持对越狱注入、错误信息、儿童安全等前沿热点的检测训练,还通过设计安全硬负样本解决了过拒绝问题,为构建文化鲁棒的内容审核系统提供了关键基础设施。这一工作标志着护栏数据集研究从英语主导迈向多语种、多层次精细标注的新阶段,对推动负责任的全球AI部署具有重要示范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务