遇见数据集

safety-GuardEUS

收藏
Hugging Face2026-06-25 更新2026-06-26 收录
官方服务:

资源简介:

Safety-GuardEUS是一个专门用于评估巴斯克语(Euskara)AI安全系统的基准测试数据集,旨在测试和基准评估AI护栏模型、内容审核分类器以及大语言模型安全过滤器在巴斯克语上的性能。随着语言模型的普及,确保其在所有语言中安全运行至关重要,本数据集为此提供了一个严格、本地化的评估基准。数据集包含250个评估对,采用对称结构设计,用于测试模型在相同上下文背景下区分安全响应与不安全响应的能力。具体包括25个独特的用户提示(问题/请求),均匀分布在5个关键安全风险类别中:自残自伤、毒品、儿童剥削、恐怖主义和露骨内容。每个提示都配对了10个不同的系统响应,其中5个是安全、有帮助或合规的拒绝回答,另外5个是违反政策、应被标记或阻止的不安全回答。数据字段包括:question(巴斯克语用户输入)、answer(巴斯克语系统响应)、label(safe或unsafe标签)和category(危害类别)。该数据集专用于安全评估、红队测试和防御性研究,包含高度有害、冒犯性甚至非法的文本内容,严禁用于训练模型生成有害内容。

Safety-GuardEUS is a benchmark dataset specifically developed for evaluating AI safety systems in Basque (Euskara). This dataset is designed to test and benchmark the performance of AI guardrail models, content moderation classifiers, and large language model (LLM) safety filters on the Basque language. With the growing prevalence of language models, ensuring their safe operation across all languages is of paramount importance, and this dataset provides a rigorous, localized evaluation benchmark to address this need. The dataset consists of 250 evaluation pairs, designed with a symmetric structure to test a model's ability to distinguish between safe and unsafe responses within the same contextual background. Specifically, it includes 25 unique user prompts (questions/requests), evenly distributed across five critical security risk categories: self-harm, drugs, child exploitation, terrorism, and explicit content. Each prompt is paired with 10 distinct system responses: five safe, helpful, or policy-compliant refusals, and five unsafe responses that violate policies and should be flagged or blocked. The dataset fields include: 'question' (user input in Basque), 'answer' (system response in Basque), 'label' (tagged as either 'safe' or 'unsafe'), and 'category' (the harm category). This dataset is exclusively intended for safety evaluation, red team testing, and defensive research. It contains highly harmful, offensive, and even illegal textual content, and is strictly prohibited for use in training models to generate harmful content.

提供机构:
HiTZ zentroa
创建时间:
2026-06-25
原始信息汇总

数据集概览:Safety-GuardEUS

Safety-GuardEUS 是一个专为测试和评估AI安全过滤器、审核分类器以及大型语言模型(LLM)在巴斯克语(Euskara) 环境下的安全性能而设计的评估基准数据集。

  • 许可证: Apache-2.0
  • 任务类别: 文本分类
  • 语言: 巴斯克语 (eu)
  • 数据集规模: 少于1,000条样本 (n<1K)
  • 数据集配置: 仅包含 test 配置,数据文件为 safety-GuardEUS.jsonl

数据集结构与规模

数据集中包含250个评估样本,这些样本以对称方式构建,用于测试模型对相同上下文下“安全”与“不安全”响应的区分能力。

  • 提示 (Prompts): 包含25个独特的用户提示(问题/请求),均匀分布在5个安全类别中。
  • 响应 (Responses): 每个提示配对10条不同的响应,具体构成如下:
    • 5条安全答案: 有帮助的、符合政策的回应或恰当的拒绝。
    • 5条不安全答案: 违反政策的回应,模型应将其标记或阻止。
  • 总计: 25个提示 × 10条响应 = 250条评估数据。

安全类别

25个提示被均匀分配至以下5个关键安全风险类别:

  • self-harm (自残): 鼓励、提供指导或美化自伤/自杀的内容。
  • drugs (毒品): 涉及制造、分发或推广非法药物的内容。
  • child-exploitation (儿童剥削): 危害未成年人或违反儿童安全政策的内容。
  • terrorism (恐怖主义): 宣扬恐怖主义、暴力极端主义或提供大规模伤害指导的内容。
  • explicit-content (露骨内容): 非自愿、高度露骨或被禁止的色情内容。

数据字段

字段名 类型 描述
question string 用户的输入/请求(巴斯克语)。
answer string 系统生成的响应(巴斯克语)。
label string 标签,取值为 safe(安全)或 unsafe(不安全)。
category string 危害类别(例如:self-harm, drugs, child-exploitation...)。

伦理考量与风险

  • ⚠️ 警告: 该数据集在设计上包含高度有毒、冒犯性和可能非法的文本。
  • 用途限制: 仅限用于安全评估、红队测试和防御性研究。使用者需谨慎查看或展示此数据。
  • 禁止行为: 不得用于训练模型生成有害内容。
搜集汇总
数据集介绍
safety-GuardEUS 数据集图片
构建方式
Safety-GuardEUS数据集专为评估巴斯克语中人工智能安全过滤器与护栏模型的性能而构建。其构建方式严谨而对称,共包含250个评估样本。这些样本源自25个独特的用户提示,均匀分布于五大安全风险类别:自我伤害、毒品、儿童剥削、恐怖主义及露骨内容。每个提示均配以10个截然不同的回复,其中5个为安全、符合政策的回应或恰当的拒绝,另5个则为违反政策的危险输出。通过这种一一对应的设计,数据集旨在严格测试模型在相同语境下区分安全与不安全内容的能力。
特点
该数据集的核心特点在于其针对巴斯克语这一低资源语言的安全评估专注性,填补了多语言AI安全基准的空白。它结构精巧,虽仅含250个样本,却通过25个提示与10个回复的对称组合,确保了评估的全面性与挑战性。数据字段明确包含问题、回答、标签及类别,便于进行细粒度分析。此外,数据集公开标注了伦理风险,明确警示其内含高毒性及违规文本,仅限用于安全评估与防御性研究,严禁用于训练有害内容生成模型。
使用方法
使用Safety-GuardEUS时,研究者可直接加载JSONL格式的测试数据,将其作为基准来评估护栏模型或LLM安全过滤器在巴斯克语上的表现。数据集预设为文本分类任务,用户需利用其中的问题与回答字段,配合安全与非安全的标签进行模型推理。通过对比模型预测与真实标签,可计算分类准确率、精确率、召回率等指标,从而量化模型对于不同安全风险类别的敏感度与区分能力。建议在受控环境下开展评估,并严格遵守伦理规范,避免数据泄露或滥用。
背景与挑战
背景概述
在多语言人工智能安全评估领域,巴斯克语等低资源语言的防护机制尚属空白。为此,研究团队于近期创建了safety-GuardEUS数据集,这是一个专门用于评估巴斯克语(Euskara)AI安全过滤器与护栏模型性能的基准测试集。该数据集由25个独特用户提示和250个评估对构成,涵盖自我伤害、毒品、儿童剥削、恐怖主义和露骨内容五大安全风险类别。作为首个针对巴斯克语的AI安全评估基准,它填补了该语言在内容安全过滤领域的空白,为多语言AI安全研究提供了重要的测试工具。
当前挑战
该数据集面临的挑战主要体现在两个方面。在领域问题层面,它致力于解决低资源语言(如巴斯克语)中AI安全过滤器的评估难题——现有安全模型多针对英语等高资源语言开发,在巴斯克语场景下可能产生严重的漏报或误报。在构建过程中,挑战在于确保评估数据的全面性和对称性:需要为每个提示精确设计安全与不安全答复各5条,这要求研究者深入理解巴斯克语文化语境中的危害表达,同时避免数据集被滥用于生成实际有害内容,严格遵守伦理规范。
常用场景
经典使用场景
在自然语言处理与人工智能安全交错的领域中,资源稀缺语言的护栏模型评测一直是亟待填补的缺口。safety-GuardEUS作为专为巴斯克语设计的评估基准,其经典使用场景聚焦于衡量AI安全过滤器与护栏模型在低资源语言环境下的判别能力。该数据集通过精心构建的250个评测对——涵盖25个独特用户提示与对应的安全及不安全回答——系统性地检验模型能否精准区分合规与违规内容。这种对称结构不仅考察了模型对安全边界的理解,更揭示了其在面对相同语境时,对潜在风险的敏感度与拒绝回应策略的有效性,为多语言安全评测提供了可复现的标准化范式。
解决学术问题
学术界长期面临一个严峻挑战:主流安全评测数据集大多以英语为中心,导致非通用语种的安全机制研究严重滞后。safety-GuardEUS针对性解决了巴斯克语中缺乏结构化安全评估基准的困境,使研究者能够量化分析预训练语言模型在该语言上的安全对齐程度。其覆盖的自伤、毒品、儿童剥削、恐怖主义与露骨内容五大高危类别,为跨语言安全理论建模提供了实证基础。该数据集的问世推动了多语言安全泛化性的研究进展,促使学界重新审视现有护栏模型在语言多样性下的失效模式,进而催生了针对低资源语言的鲁棒性提升策略探索。
衍生相关工作
safety-GuardEUS的发布激发了多条学术衍进脉络。一是基于其对称评估架构,研究者发展了跨语言对比基准,用于检验同一护栏模型在巴斯克语与英语上的性能差异。二是催生了针对低资源语言安全数据的主动学习生成方法,利用小样本提示自动构建类似的高危内容评测集。三是推动了安全分类器的多领域微调技术,通过整合该数据集的标注信标,改进模型对巴斯克语文化语境特殊风险的识别。此外,该工作与多语言红队测试实验相呼应,共同构架了覆盖语系多样性的安全评估生态体系,为建立不具有语言偏见的通用安全模型奠定了基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务