UA_Nemotron-Safety-Guard-Dataset-v3
收藏资源简介:
Ukrainian Nemotron-Safety-Guard-Dataset-v3 是一个乌克兰语的内容安全数据集,专门用于训练和评估内容安全防护/审核模型。该数据集基于 NVIDIA 的 Nemotron 安全数据,并经过翻译质量检查、文化感知适应和标签一致性过滤等步骤构建而成。数据集包含训练集、验证集和测试集分割。每个样本包含一个提示(prompt)和约一半样本的响应(response),并标注了 safe(安全)或 unsafe(不安全)标签,以及所违反的具体安全类别(violated_categories)。violated_categories 字段采用 Nemotron 安全分类法,涵盖 23 个唯一类别,按主题分组为:暴力与自残(暴力、威胁、自杀与自残)、犯罪与非法活动(犯罪计划/供认、非法活动、枪支与非法武器、管制/受控物质、欺诈/欺骗、恶意软件)、仇恨与骚扰(仇恨/身份仇恨、骚扰、粗俗、不道德/不道德)、性内容(性内容、性内容(未成年人))、隐私与建议(PII/隐私、未经授权的建议、高风险政府决策)、错误信息与知识产权(政治/错误信息/阴谋、操纵、版权/商标/抄袭)以及其他(需谨慎、其他)。数据集规模在 10,000 到 100,000 条之间。该数据集旨在用于训练和评估内容安全分类器,包含设计上具有冒犯性和有害性的语言,不应作为通用乌克兰语文本语料库使用。
Ukrainian Nemotron-Safety-Guard-Dataset-v3 is a Ukrainian-language content safety dataset specifically designed for training and evaluating content safety guardrails/moderation models. The dataset is built based on NVIDIAs Nemotron safety data, with steps including translation quality checks, cultural awareness adaptation, and label consistency filtering. It contains train, validation, and test splits. Each sample includes a prompt and approximately half of the samples include a response, annotated with safe or unsafe labels, as well as the specific violated safety categories (violated_categories). The violated_categories field uses the Nemotron safety taxonomy, covering 23 unique categories grouped by theme: Violence & Self-Harm (Violence, Threat, Suicide & Self-Harm), Crime & Illegal Activities (Criminal Planning/Confession, Illegal Activity, Guns & Illegal Weapons, Controlled/Regulated Substances, Fraud/Deception, Malware), Hate & Harassment (Hate/Identity Hate, Harassment, Profanity, Immoral/Unethical), Sexual Content (Sexual Content, Sexual Content (Minors)), Privacy & Advice (PII/Privacy, Unauthorized Advice, High-Risk Government Decisions), Misinformation & IP (Political/Misinformation/Conspiracy, Manipulation, Copyright/Trademark/Plagiarism), and Other (Caution, Other). The dataset size ranges from 10,000 to 100,000 samples. It is intended for training and evaluating content safety classifiers and contains language designed to be offensive and harmful, and should not be used as a general Ukrainian text corpus.
Ukrainian Nemotron-Safety-Guard-Dataset-v3 数据集详情
数据集概述
这是一个乌克兰语内容安全数据集,用于训练和评估安全审核/内容审核模型。每条数据包含一个提示词(约半数条目还包含回复),标注为safe/unsafe,并列出其违反的具体安全类别。该数据集基于NVIDIA的Nemotron安全数据构建,并经过翻译质量检查、文化适应性调整和安全标签一致性过滤等处理流程。
数据规模与结构
- 数据量:10K-100K条记录
- 划分:提供
train/validation/test三个数据分割 - 任务类型:文本分类(text-classification)
- 语言:乌克兰语(uk)
字段说明
| 字段 | 类型 | 描述 |
|---|---|---|
id |
string | 继承自上游数据集的行标识符,不唯一,不可单独作为连接/去重键 |
prompt |
string | 乌克兰语提示词文本 |
response |
string | 乌克兰语回复文本,提示词单独的行此字段为空 |
prompt_label |
string | safe或unsafe,用于过滤或训练的标签 |
response_label |
string | safe或unsafe;即使response为空也可能非空 |
violated_categories |
string | 内容涉及的类别(Nemotron分类法,英文名称),逗号分隔;unsafe行至少有一个类别,safe行也可能有(通常为Needs Caution) |
安全类别分类
数据集中出现的23个独特类别按主题分为以下组别:
- 暴力与自残:Violence、Threat、Suicide and Self Harm
- 犯罪与非法活动:Criminal Planning/Confessions、Illegal Activity、Guns and Illegal Weapons、Controlled/Regulated Substances、Fraud/Deception、Malware
- 仇恨与骚扰:Hate/Identity Hate、Harassment、Profanity、Immoral/Unethical
- 色情内容:Sexual、Sexual (minor)
- 隐私与建议:PII/Privacy、Unauthorized Advice、High Risk Gov Decision Making
- 错误信息与知识产权:Political/Misinformation/Conspiracy、Manipulation、Copyright/Trademark/Plagiarism
- 其他:Needs Caution、Other
构建方法与流程
该数据集遵循NVIDIA CultureGuard方法论的选定阶段:
| 步骤 | 操作 | 详情 | 使用模型 |
|---|---|---|---|
| 1 | 源数据 | 从社区翻译的乌克兰语Nemotron v3数据集出发 | — |
| 2 | 去重 | 移除具有相同id、prompt和response的完全重复项 |
— |
| 3 | 翻译质量检查(FAITH) | 评估流畅度、准确性、地道性、术语和格式处理 | Qwen/Qwen3.6-35B-A3B |
| 4 | 必要时重新翻译 | 对未通过翻译质量检查的提示词/回复进行重新翻译 | gemini-3.6-flash |
| 5 | 文化分类 | 将提示词和回复分别分类为通用或特定 | google/gemma-4-31B-it |
| 6 | 文化适应 | 使用少样本提示对特定文化内容进行适应调整,同时保留全球事实和充分具体的现实事件 | google/gemma-4-31B-it |
| 7 | 安全标签一致性检查 | 使用集成模型重新分类安全标签;任何unsafe投票即判定为unsafe,仅保留标签一致的样本 |
google/gemma-4-31B-it + nvidia/Nemotron-3.5-Content-Safety + Qwen/Qwen3.6-35B-A3B + mistralai/Shieldstral-1.0-3B |
数据集所有权与维护
- 原始数据集所有者:底层安全数据由NVIDIA公司拥有和维护,基于Aegis 2.0安全数据集通过CultureGuard流程创建,并发布为
nvidia/Nemotron-Safety-Guard-Dataset-v3 - 乌克兰语翻译:本数据集所基于的乌克兰语本地化版本由Hugging Face上的Stereotypes-in-LLMs组织维护,见
Stereotypes-in-LLMs/Nemotron-Safety-Guard-Dataset-v3-Ukr - 本次发布:在翻译语料库之上增加了文化感知本地化和标签一致性处理
使用注意事项
- 数据集旨在用于训练和评估安全/内容审核分类器,按设计包含攻击性和有害语言,不应作为通用乌克兰语文本语料库使用
- 本地化处理将部分名称替换为真实乌克兰公众人物——包括在
unsafe行中(例如请求公众人物家庭住址的实例)。不对此人作任何暗示性声明,该名称仅是训练信号中的附属内容 - 遵循上游Aegis 2.0政策:不得使用此数据来识别、定位或针对任何被提及的个人(无论真实与否)
许可证与引用
- 许可证:CC-BY-4.0,继承自两个上游数据集
- 引用:可引用CultureGuard论文(arXiv:2508.01710)作为方法论参考




