遇见数据集

HiTZ/safety-GuardEUS

收藏
Hugging Face2026-06-25 更新2026-07-22 收录
官方服务:

资源简介:

Safety-GuardEUS是一个专门的评估数据集,旨在测试和基准化AI护栏模型、审核分类器和LLM安全过滤器在巴斯克语(Euskara)中的性能。随着语言模型的普及,确保其在所有语言中安全运行至关重要。该数据集提供了一个严格的本地化基准,用于评估安全系统在巴斯克语中区分安全、有帮助的响应与不安全、违反政策的响应的能力。数据集包含250个评估对,对称构建以测试模型在相同上下文中区分安全和不安全输出的能力。具体包括25个独特的用户提示(分布在5个安全类别),每个提示对应10个响应(5个安全答案和5个不安全答案)。类别包括自残、毒品、儿童剥削、恐怖主义和露骨内容。数据字段包括问题、答案、标签和类别。

Safety-GuardEUS is a specialized evaluation dataset designed to test and benchmark the performance of AI guardrail models, moderation classifiers, and LLM safety filters in the Basque language (Euskara). As language models become more prevalent, ensuring they operate safely across all languages is critical. This dataset provides a rigorous, localized benchmark to evaluate how well safety systems can distinguish between safe, helpful responses and unsafe, policy-violating responses in Basque. The dataset consists of exactly 250 evaluation pairs, constructed symmetrically to test a models ability to differentiate between safe and unsafe outputs for the exact same context. It includes 25 unique user prompts (questions/requests) distributed across 5 safety categories, with each prompt paired with 10 distinct responses (5 safe answers and 5 unsafe answers). Categories include self-harm, drugs, child-exploitation, terrorism, and explicit-content. Data fields include question, answer, label, and category.

提供机构:
HiTZ
搜集汇总
数据集介绍
HiTZ/safety-GuardEUS 数据集图片
构建方式
Safety-GuardEUS是一个专门为巴斯克语(Eusara)设计的AI安全评估基准数据集。其构建采用了高度对称的结构化方法:从5个关键安全风险类别(自残、毒品、儿童剥削、恐怖主义、露骨内容)中各选取5个独特的用户提示,共计25个提示。每个提示对应10个精心配对的回答,其中5个为符合政策的安全回答,另5个为违反政策的危险回答,最终形成250个评估样本对。每个样本均标注了对话的标签(安全或不安全)及其所属的风险类别。
特点
该数据集的核心特色在于其精确的对称性设计和专为巴斯克语定制的本地化评估能力。通过为每个提示生成相同数量的安全与不安全回答,数据集能够严格检验安全过滤模型对同一语境下不同性质输出的辨别力。覆盖的5种高风险类别使其成为评估多语言AI系统中安全机制鲁棒性的重要工具。此外,数据集的规模虽小但精炼,专为评估而非训练设计,内置高度敏感的内容以进行严格的红队测试。
使用方法
Safety-GuardEUS适用于测试和基准测试AI护栏模型、内容审核分类器及大型语言模型的安全过滤器。使用时,研究人员可将数据集加载为分类任务,预测每个(提问,回答)对对应的标签是安全(safe)还是不安全(unsafe)。数据集以JSONL格式提供,可通过Hugging Face的datasets库直接加载,其中配置名设置为'test',语言标签为'eu'。需要注意的是,数据集包含极端敏感内容,仅用于防御性研究和安全评估,严禁用于训练模型生成有害内容。
背景与挑战
背景概述
随着大语言模型在自然语言处理领域的广泛应用,确保其在多语言环境下的安全输出已成为关键议题。safety-GuardEUS数据集由巴斯克政府、西班牙数字化转型与公共服务部及欧盟NextGenerationEU计划资助的研究团队于近期创建,旨在构建首个针对巴斯克语(Euskara)的AI安全评估基准。该数据集聚焦于五大高风险类别,包括自残、毒品、儿童剥削、恐怖主义和露骨内容,通过250组精心设计的对称问答对,系统检验安全过滤模型对合规与违规内容的识别能力。其发布填补了低资源语言在AI安全评测领域的空白,为多语言守护模型的研究提供了标准化测试工具。
当前挑战
该数据集所应对的核心挑战在于多语言境遇下AI安全过滤器的可靠性与公平性。当前主流安全模型多基于英语语料训练,对巴斯克语等小语种的违规内容识别准确率显著下降,导致政策合规检测出现偏差。构建过程中,研究人员面临两大难题:一是需要从零构建符合巴斯克语语言习惯的违规内容,确保其自然性与毒性层次的精准匹配;二是需在数据规模极小的约束下(仅250条)平衡类别分布与上下文多样性,避免模型过拟合或评测失效,从而维持基准的鲁棒性与可泛化性。
常用场景
经典使用场景
在自然语言处理与人工智能安全交叉领域中,Safety-GuardEUS数据集被广泛用于评估和基准测试大语言模型在巴斯克语环境下的安全过滤能力。该数据集通过精心构造的对称式评估对——涵盖自我伤害、毒品、儿童剥削、恐怖主义和露骨内容五大高风险类别——为研究者提供了一个严谨的本地化测试框架。每个用户提示均配以等量的安全与不安全回应,使得模型对细微语义差异的辨识能力得以精确量化。这一设计不仅用于检验现有护栏模型的鲁棒性,还作为标准基准推动巴斯克语安全防护技术的规范化发展。
解决学术问题
该数据集直面多语言AI安全评估中的关键学术挑战:主流安全过滤器在低资源语言中的有效性问题。由于巴斯克语在现有安全基准中几乎完全缺席,模型在该语境下的安全性无法得到保障。Safety-GuardEUS填补了这一空白,使研究者能够系统评估模型对特定语言文化背景下越狱攻击和违规内容的敏感度。它揭示了当前安全机制在非英语环境中的脆弱性,推动了跨语言安全对齐理论的发展,强调了本地化安全基准在构建全球性可信AI系统中的不可或缺性。
衍生相关工作
该数据集衍生出一系列围绕低资源语言安全基准的研究工作,例如其他巴斯克语或类似小语种的防护模型性能分析报告,以及基于跨语言特征的安全过滤器迁移学习框架。部分工作进一步扩展了数据集结构,通过添加对抗性扰动或文化特定隐喻来挑战模型泛化能力。此外,研究者借鉴其对称评估设计思想,构造了加泰罗尼亚语、加利西亚语等多语言变体基准,推动了多语言AI安全评估体系的系统性构建。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务