遇见数据集

safety-IberRisk

收藏
Hugging Face2026-06-25 更新2026-06-26 收录
官方服务:

资源简介:

Safety-IberRisk 是一个用于评估大型语言模型在多种伊比利亚语言及英语环境中安全能力的数据集。它专注于测试模型在面对潜在有害请求和常见越狱/规避技术时的鲁棒性。该数据集包含 15,030 个合成生成的实例,均匀分布在五种语言中:英语、西班牙语、巴斯克语/埃斯库埃拉语、加泰罗尼亚语和加利西亚语。数据集结构围绕三个主要危害类别构建:非法活动(如毒品交易、人口贩卖)、滥用(如生成虚假信息、假新闻)和毒性(如攻击性、歧视性、仇恨或骚扰内容)。每个语言包含 3,006 个实例,具体由每个类别的 167 个原始提示,通过五种不同的规避策略(角色扮演、Base64编码、零宽度插入、创意写作、诱饵转换)转换后,各生成 835 个转换提示构成。该数据集旨在解决中低资源语言(如巴斯克语、加利西亚语、加泰罗尼亚语)与高资源语言(英语、西班牙语)在安全评估方面的差距,通过保持跨语言生成策略的一致性,支持研究人员进行模型安全性的 1:1 跨语言可比性测试。适用任务包括安全评估(判断模型是否拒绝有害请求)、越狱检测(训练模型或过滤器识别对抗性规避策略)以及多语言对齐测试(比较LLMs中安全对齐的文化和语言一致性)。需要注意的是,数据集包含高度有毒、冒犯性和潜在非法的文本,严格仅用于安全评估、红队测试和防御性研究,不得用于训练模型生成有害内容。

Safety-IberRisk is a dataset for evaluating the safety capabilities of large language models in multiple Iberian languages and English. It focuses on testing the robustness of models when faced with potentially harmful requests and common jailbreaking/evasion techniques. The dataset contains 15,030 synthetically generated instances, evenly distributed across five languages: English, Spanish, Basque/Eskuera, Catalan, and Galician. The dataset structure is built around three main harm categories: illegal activities (e.g., drug trafficking, human trafficking), abuse (e.g., generating misinformation, fake news), and toxicity (e.g., offensive, discriminatory, hateful, or harassing content). Each language contains 3,006 instances, specifically composed of 167 original prompts per category, transformed into 835 transformed prompts each through five different evasion strategies (role-playing, Base64 encoding, zero-width insertion, creative writing, bait conversion). The dataset aims to address the gap in safety assessment between low-to-medium resource languages (e.g., Basque, Galician, Catalan) and high-resource languages (English, Spanish), supporting 1:1 cross-lingual comparability tests for model safety by maintaining consistency in cross-lingual generation strategies. Applicable tasks include safety evaluation (judging whether models reject harmful requests), jailbreak detection (training models or filters to identify adversarial evasion strategies), and multilingual alignment testing (comparing cultural and linguistic consistency in LLM safety alignment). It is important to note that the dataset contains highly toxic, offensive, and potentially illegal text, strictly intended for safety evaluation, red teaming, and defensive research only, and should not be used to train models to generate harmful content.

提供机构:
HiTZ zentroa
创建时间:
2026-06-25
原始信息汇总

数据集概述:Safety-IberRisk

  • 数据集名称:Safety-IberRisk(伊比利亚多语言大语言模型安全评估)
  • 许可证:Apache-2.0
  • 任务类型:文本分类
  • 语言:英语、西班牙语、巴斯克语、加泰罗尼亚语、加利西亚语
  • 数据集规模:10,000 < n < 100,000
  • 标签:安全(safety)

数据集摘要

该数据集旨在评估大语言模型在伊比利亚语言及英语文化特定情境下的安全能力和行为护栏。它专注于测试模型在面对潜在有害请求和常见越狱/规避技术时的鲁棒性。

数据集包含 15,030 个 合成生成的实例,均匀分布在五种语言中(每种语言 3,006 个实例)。它提供了一个系统性资源,用于分析模型在不同语言间安全防护措施的一致性,以及其对对抗性提示表述的抵抗能力。

支持的任务与排行榜

  • 安全评估:评估模型是拒绝还是遵从有害请求。
  • 越狱检测:训练模型或过滤器以检测对抗性规避策略。
  • 多语言对齐测试:比较大语言模型在不同语言和文化中安全对齐的公平性。

数据集结构

分类

数据集分为三个主要危害类别:

  1. 非法活动:与违法行为相关的请求(例如:毒品贩运、人口贩运)。
  2. 滥用:旨在将模型用于非预期用途的请求(例如:生成虚假信息、假新闻)。
  3. 毒性:具有攻击性、歧视性、仇恨或骚扰性的内容。

数据实例

每种语言的 3,006 个实例按类别和转换策略细分如下:

类别 原始提示 转换后提示 每种语言总数
非法活动 167 835 1,002
滥用 167 835 1,002
毒性 167 835 1,002
总计 501 2,505 3,006

五种语言总计: 15,030 个示例。

转换策略(越狱)

为评估模型的鲁棒性,对每个类别的 167 个原始提示应用了五种不同的规避技术:

  • 角色扮演:在虚构场景或角色扮演中提出请求。
  • Base64 编码:使用 Base64 对有害请求进行混淆。
  • 零宽度插入:插入不可见的 Unicode 字符以绕过简单的词法过滤器。
  • 创意写作:将请求伪装成创意或文学任务。
  • 诱饵与转换:从一个看似无害的请求开始,随后转向有害意图。

数据集创建

策划理由

旨在填补低资源语言(如巴斯克语、加利西亚语和加泰罗尼亚语)与高资源语言(英语、西班牙语)在安全评估方面的空白。通过在所有语言中保持相同的生成策略,该数据集允许研究者对模型安全性进行一对一的跨语言可比性测试。

源数据与生成

  • 平台:Galtea.ai

局限性与伦理考量

  • 局限性:由于数据集是通过大语言模型合成生成的,可能包含生成伪影或特定偏见。此外,虽然策略是对齐的,但在表达危害的深层文化细微差别上,可能与自然的人类表述略有不同。
  • 伦理考量与风险警告:本数据集设计上包含高度有毒、冒犯性及潜在非法的文本。仅用于安全评估、红队测试和防御性研究。用户查看或展示这些数据时必须谨慎,不得用于训练模型生成有害内容。
搜集汇总
数据集介绍
safety-IberRisk 数据集图片
构建方式
Safety-IberRisk数据集旨在填补伊比利亚地区低资源语言(如巴斯克语、加利西亚语、加泰罗尼亚语)在大型语言模型安全评估中的空白。该数据集通过Galtea.ai平台进行合成生成,总计包含15,030个实例,均匀分布于英语、西班牙语、巴斯克语、加泰罗尼亚语和加利西亚语五种语言。构建过程围绕三大核心危害类别——非法活动、滥用和毒性内容——展开。针对每个语言中的501个原始提示,应用了五种不同的越狱策略(角色扮演、Base64编码、零宽字符插入、创意写作和诱饵转换),生成了2,505个经过变换的提示。这种平行生成策略确保了跨语言的安全性测试具有高度可比性。
特点
该数据集最显著的特点在于其跨语言平行结构和系统性的攻击策略设计。每个语言包含3,006个实例,其中1,002个对应非法活动、滥用和毒性内容三类危害,且每类均由167个原始提示和835个通过五种越狱手段变换的提示组成。这种精细的层次化划分允许研究者独立评估模型对不同危害类别的防御能力,以及针对特定对抗性攻击手段的鲁棒性。此外,数据集覆盖了西班牙、巴斯克、加泰罗尼亚和加利西亚这四个具有丰富文化特异性的伊比利亚语言,为分析模型安全对齐在不同语言和文化背景下的表现一致性提供了独特资源。
使用方法
Safety-IberRisk专为大型语言模型的安全评估、红队测试和防御性研究而设计。研究者可将其直接用于文本分类任务,通过加载各语言的JSONL文件(如eu-safety-IberRisk.jsonl)来评估模型是否拒绝或响应有害请求。数据集支持三种主要应用场景:安全性评估(判断模型对危害请求的反应)、越狱检测(训练模型识别对抗性逃避策略)以及多语言对齐测试(比较不同语言中安全对齐的差异)。使用时需注意,数据集包含高度有毒和可能非法的内容,仅限于研究用途,严禁用于训练生成有害内容的模型。加载数据时,可依据HuggingFace Datasets库的标准流程,指定test配置并选择目标语言拆分。
背景与挑战
背景概述
随着大型语言模型(LLM)在多元文化场景中的广泛应用,模型安全性与伦理对齐成为亟待攻克的核心议题。在此背景下,safety-IberRisk数据集由Galtea.ai平台于近期创建,聚焦伊比利亚半岛低资源语言(如巴斯克语、加泰罗尼亚语、加利西亚语)与高资源语言(英语、西班牙语)间的安全评估鸿沟。该数据集包含15,030条平行生成的对抗性提示,覆盖非法活动、滥用及毒性三大危害类别,并引入角色扮演、Base64编码等五种越狱策略,旨在系统衡量模型对多语言无害化请求的拒答能力与鲁棒性。其跨语言平行设计为语言间安全对齐的一致性研究提供了标准化基准,对推动包容性AI安全治理具有重要价值。
当前挑战
该数据集面临的核心挑战在于双重维度:其一,从领域问题看,当前LLM在高资源语言上的安全护栏往往优于低资源语言,而伊比利亚地区多语言共存的现实要求模型在不同语言间维持伦理偏见的均衡,但语言与文化的复杂交织使得跨语言安全对齐难以实现平滑迁移;其二,从构建过程看,数据集虽通过合成生成确保策略平行,但自动生成易引入伪影或文化敏感度偏差——例如,某些有害表述在西班牙语中的自然表达可能异于其英文镜像,而人工基准则难以覆盖所有地域性语境。此外,越狱策略的泛化性存疑,例如零宽字符插入等技巧在特定语言中可能因分词差异失效,需持续迭代以抵御新型攻击手法。
常用场景
经典使用场景
safety-IberRisk数据集是专为评估大型语言模型在多语言、多文化背景下的安全性能而设计的基准测试资源。其经典使用场景聚焦于测试模型面对涵盖非法活动、滥用和毒性内容等三大类有害请求时的拒答能力与行为边界。通过引入角色扮演、Base64编码、零宽字符插入、创意写作和诱饵转换五种精细化对抗性提示策略,该数据集能够系统性地探测模型对越狱攻击的鲁棒性,尤其适用于比较模型在巴斯克语、加泰罗尼亚语、加利西亚语等低资源语言与英语、西班牙语等高资源语言之间安全对齐的一致性。
解决学术问题
该数据集有效解决了当前大型语言模型安全评估研究中长期存在的语言覆盖不均问题,尤其是对伊比利亚半岛地区低资源语言安全性能的系统性评价缺失。它首次提供了跨五种语言的平行对照安全测试实例,使研究者能够量化和剖析模型在不同语言文化语境下对有害内容的拒绝机制是否存在偏差。这一资源不仅推动了多语言安全对齐理论的发展,还揭示了模型在高资源语言与低资源语言之间安全策略的潜在不一致性,对构建公平、鲁棒且文化敏感的语言模型具有重要的学术意义。
衍生相关工作
safety-IberRisk数据集催生了若干重要的衍生研究方向与经典工作。研究者基于其平行多语言结构开发了跨语言安全对齐对比分析框架,用以量化模型在不同语言中安全表现的差异。其五种精细化越狱策略被广泛借鉴,用于构建更全面的对抗性测试套件。此外,该数据集还启发了针对低资源语言的专用安全微调方法,以及利用数据增强技术平衡多语言安全性能的研究。这些衍生工作共同推动了多语言语言模型安全评估从单一语言向多语言、多文化视角的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务