遇见数据集

BSC-LT/salamandra-guard-dataset

收藏
Hugging Face2026-05-29 更新2026-04-05 收录
官方服务:

资源简介:

Salamandra Guard数据集是一个全面的多语言安全分类语料库,专为训练和评估加泰罗尼亚语和西班牙语的内容审核系统而设计。它包含21,335个精心策划的对话示例,这些示例按照分层安全分类法进行了注释。该数据集代表了在文化基础安全数据方面的重大进展,特别强调加泰罗尼亚语(一种在AI安全研究中历史上代表性不足的语言)以及西班牙语和英语。数据集总结:总样本量:21,335个;语言:加泰罗尼亚语、西班牙语、英语;注释方法:多注释者(包括人类和LLM法官);格式:对话用户-助手对;任务:多标签和多类安全分类;文化范围:欧洲语境,特别是加泰罗尼亚语和西班牙语文化适应。数据集组成:1. 人类注释子集(5,016个样本):由人类专家进行专业翻译、校对和注释;2. 机器翻译子集(16,319个样本):使用GPT-4o从英语源数据翻译并由LLM注释。支持的任务包括:二元分类(安全与不安全内容检测)、多类分类(四个高级安全类别C0-C3)、细粒度分类(八个子类别S0-S7)、多标签分类(内容可同时属于多个安全类别)以及跨语言安全检测(在加泰罗尼亚语、西班牙语和英语之间评估)。语言方面:加泰罗尼亚语(ca)和西班牙语(es)均为本地专业校对版本。

The Salamandra Guard dataset is a comprehensive multilingual safety classification corpus designed for training and evaluating content moderation systems in Catalan, Spanish. It consists of 21,335 carefully curated conversational examples annotated across a hierarchical safety taxonomy. This dataset represents a significant advancement in culturally-grounded safety data, with particular emphasis on Catalan—a language historically underrepresented in AI safety research—alongside Spanish and English. Dataset Summary: Total size: 21,335 samples; Languages: Catalan, Spanish, English; Annotation methodology: Multi-annotator with human and LLM judges; Format: Conversational user-assistant pairs; Task: Multi-label and multi-class safety classification; Cultural scope: European context with Catalan and Spanish cultural adaptation. Dataset composition: 1. Human-annotated subset (5,016 samples): Professionally translated, proofread, and annotated by human experts; 2. Machine-translated subset (16,319 samples): GPT-4o translated and LLM-annotated from English source data. Supported tasks include: Binary classification (Safe vs. Unsafe content detection), Multiclass classification (Four high-level safety categories C0-C3), Fine-grained classification (Eight subcategories S0-S7), Multi-label classification (Content can belong to multiple safety categories simultaneously), and Cross-lingual safety detection (Evaluation across Catalan, Spanish, and English). Languages: Catalan (ca) and Spanish (es) are native and professionally proofread.

提供机构:
BSC-LT
搜集汇总
数据集介绍
BSC-LT/salamandra-guard-dataset 数据集图片
构建方式
Salamandra Guard Dataset的构建源于对现有安全数据集中语言覆盖不足与文化错位等局限性的深刻洞察。该数据集以Nvidia的Nemotron-Safety-Guard-Dataset-V3中的西班牙语子集为种子数据,首先通过GPT-4o进行机器翻译,将内容扩展至加泰罗尼亚语与英语。随后,由专业译员对核心样本进行人工校对,并借助Prolific平台招募母语为加泰罗尼亚语的众包工作者进行质量验证,最终形成了包含5,016条人工标注样本与16,319条机器翻译样本的混合语料库。在标注环节,每一条数据均由三位独立的人类标注者与GPT-4o、GPT-OSS两位大型语言模型评判者共同完成,通过多数投票机制生成共识标签,从而构建起一个多层次、高可靠性的安全分类体系。
特点
该数据集最显著的特点在于其深植于加泰罗尼亚与西班牙语系的文化土壤之中,填补了人工智能安全研究中对低资源语言关注的空白。它设计了一套层级分明的安全分类法,涵盖从二元安全判定(安全/不安全)到细粒度八类子标签(S0至S7)的完整体系,并支持多标签分类任务。数据集提供了丰富的标注维度,包括人类标注者与多种大型语言模型评判者的独立判断,以及经过多数投票衍生的共识标签,为研究标注者之间、人机之间的主观性差异提供了独特视角。此外,该数据集针对加泰罗尼亚语和西班牙语的粗俗用语等文化敏感类别进行了专门的本土化适配,确保了分类标准的语境相关性与准确性。
使用方法
该数据集以Hugging Face数据集格式提供,用户可通过加载‘BSC-LT/salamandra-guard-dataset’直接获取训练集与测试集。其核心字段包括用户输入(prompt)、待分类的模型回复(response)、语言标识(language)以及二元安全标签(is_safe)。研究人员可利用子类别标签(s_codes)进行多标签分类,或使用多数投票标签(majority_vote)作为硬标签执行多类别分类任务。该数据集特别适用于训练和评估面向加泰罗尼亚语、西班牙语及英语的内容审核模型,同时,由于其包含了多位标注者的原始意见,也适合用于探索主观性标注的不确定性与一致性分析,为构建更稳健的安全推理系统提供了坚实的基础。
背景与挑战
背景概述
在大型语言模型快速迭代的浪潮中,内容安全治理成为AI部署的核心挑战,尤其对于加泰罗尼亚语等低资源语言,其安全数据集几乎处于空白状态。Salamandra Guard Dataset由巴塞罗那超算中心语言技术实验室与alinia于2025年联合创建,旨在构建一个文化根基深厚的多语言安全分类语料库。该数据集包含21,335个精心筛选的对话样本,覆盖加泰罗尼亚语、西班牙语及英语,并采用八种细粒度子类别的分层安全分类体系。其关键贡献在于通过专业翻译与三重人工标注,为加泰罗尼亚语提供了前所未有的安全对齐基准,填补了该语言在AI安全研究中的空白。该数据集的发布不仅推动了多语言内容审核技术的发展,也为跨文化AI伦理研究建立了重要的标杆。
当前挑战
该数据集面临的核心挑战在于安全分类固有的主观性与文化依赖性。领域层面,安全边界的定义因文化而异,例如S6(脏话)类别需要针对加泰罗尼亚语与西班牙语语境进行文化适配,这使得跨语言迁移变得困难。此外,数据集中人类标注者之间的中等一致性(Cohen's Kappa为0.455-0.506)揭示了安全分类任务的模糊性,尤其在S5(骚扰)和S6(脏话)等子类别上分歧显著。构建过程中,挑战源于多源数据整合与质量保障:机器翻译子集可能无法捕捉真实语言使用模式,而众包校对样本的语言质量低于专家审校版本。不同LLM评判者间的显著分歧(如GPT-4o与Nemotron仅49.2%一致)也增加了标签整合的复杂性,需要审慎的共识机制与文化敏感的分析方法。
常用场景
经典使用场景
Salamandra Guard数据集专为多语言内容安全分类任务而设计,其最经典的用途在于训练和评估面向加泰罗尼亚语、西班牙语及英语的对话式AI安全审核模型。该数据集提供了从二元安全检测到细粒度多标签分类的完整标注体系,涵盖C0-C3四级高层安全类别以及S0-S7八类子范畴,研究者可借此构建能够精准识别危险内容、毒性言论和色情信息的智能过滤系统。尤其值得注意的是,该数据集内置了三位人类标注者与多个大语言模型裁判的独立标注结果,为分析标注者间分歧、研究安全分类的主观性提供了宝贵资源。
衍生相关工作
基于Salamandra Guard数据集,学术界已衍生出多项关键研究工作。该数据集的技术报告系统性地对比了Llama Guard、ShieldGemma、IBM Granite Guardian等主流安全分类器的跨文化表现,揭示了现有模型在加泰罗尼亚语环境下的性能衰减。数据集中标注者与LLM裁判的差异数据被广泛用于训练统一的安全分类器,探索如何通过知识蒸馏融合人类集体智慧与大模型判断。此外,该数据集推动了面向小语种的安全指令微调研究,研究者基于其高质量标注对加泰罗尼亚语大模型Salamandra进行安全对齐训练,在保持基础能力的同时显著降低了有害输出率,为低资源语言的负责任的AI发展提供了范式参考。
数据集最近研究
最新研究方向
在大型语言模型安全对齐的浪潮中,Salamandra Guard数据集聚焦于多语言、多层级的安全内容分类,尤其针对加泰罗尼亚语这一长期被边缘化的语言进行文化扎根式的数据构建。其前沿方向在于融合人类专家与多种大模型裁判(如GPT-4o、Nemotron)的标注,通过多标签、多层次的安全分类体系(涵盖二元、四类高级及八类细粒度子类别),探索跨语言、跨文化背景下内容安全治理的通用框架。该数据集的出现不仅为加泰罗尼亚语和西班牙语的安全AI应用提供了关键基准,更通过揭示人类与模型间标注偏好的显著差异(如Nemotron的保守倾向),推动了AI安全社区对文化适配性和标注主观性的深度反思,具有重要的方法论和伦理实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务