safety-IberRisk
收藏资源简介:
Safety-IberRisk 是一个用于评估大型语言模型在多种伊比利亚语言及英语环境中安全能力的数据集。它专注于测试模型在面对潜在有害请求和常见越狱/规避技术时的鲁棒性。该数据集包含 15,030 个合成生成的实例,均匀分布在五种语言中:英语、西班牙语、巴斯克语/埃斯库埃拉语、加泰罗尼亚语和加利西亚语。数据集结构围绕三个主要危害类别构建:非法活动(如毒品交易、人口贩卖)、滥用(如生成虚假信息、假新闻)和毒性(如攻击性、歧视性、仇恨或骚扰内容)。每个语言包含 3,006 个实例,具体由每个类别的 167 个原始提示,通过五种不同的规避策略(角色扮演、Base64编码、零宽度插入、创意写作、诱饵转换)转换后,各生成 835 个转换提示构成。该数据集旨在解决中低资源语言(如巴斯克语、加利西亚语、加泰罗尼亚语)与高资源语言(英语、西班牙语)在安全评估方面的差距,通过保持跨语言生成策略的一致性,支持研究人员进行模型安全性的 1:1 跨语言可比性测试。适用任务包括安全评估(判断模型是否拒绝有害请求)、越狱检测(训练模型或过滤器识别对抗性规避策略)以及多语言对齐测试(比较LLMs中安全对齐的文化和语言一致性)。需要注意的是,数据集包含高度有毒、冒犯性和潜在非法的文本,严格仅用于安全评估、红队测试和防御性研究,不得用于训练模型生成有害内容。
Safety-IberRisk is a dataset for evaluating the safety capabilities of large language models in multiple Iberian languages and English. It focuses on testing the robustness of models when faced with potentially harmful requests and common jailbreaking/evasion techniques. The dataset contains 15,030 synthetically generated instances, evenly distributed across five languages: English, Spanish, Basque/Eskuera, Catalan, and Galician. The dataset structure is built around three main harm categories: illegal activities (e.g., drug trafficking, human trafficking), abuse (e.g., generating misinformation, fake news), and toxicity (e.g., offensive, discriminatory, hateful, or harassing content). Each language contains 3,006 instances, specifically composed of 167 original prompts per category, transformed into 835 transformed prompts each through five different evasion strategies (role-playing, Base64 encoding, zero-width insertion, creative writing, bait conversion). The dataset aims to address the gap in safety assessment between low-to-medium resource languages (e.g., Basque, Galician, Catalan) and high-resource languages (English, Spanish), supporting 1:1 cross-lingual comparability tests for model safety by maintaining consistency in cross-lingual generation strategies. Applicable tasks include safety evaluation (judging whether models reject harmful requests), jailbreak detection (training models or filters to identify adversarial evasion strategies), and multilingual alignment testing (comparing cultural and linguistic consistency in LLM safety alignment). It is important to note that the dataset contains highly toxic, offensive, and potentially illegal text, strictly intended for safety evaluation, red teaming, and defensive research only, and should not be used to train models to generate harmful content.
数据集概述:Safety-IberRisk
- 数据集名称:Safety-IberRisk(伊比利亚多语言大语言模型安全评估)
- 许可证:Apache-2.0
- 任务类型:文本分类
- 语言:英语、西班牙语、巴斯克语、加泰罗尼亚语、加利西亚语
- 数据集规模:10,000 < n < 100,000
- 标签:安全(safety)
数据集摘要
该数据集旨在评估大语言模型在伊比利亚语言及英语文化特定情境下的安全能力和行为护栏。它专注于测试模型在面对潜在有害请求和常见越狱/规避技术时的鲁棒性。
数据集包含 15,030 个 合成生成的实例,均匀分布在五种语言中(每种语言 3,006 个实例)。它提供了一个系统性资源,用于分析模型在不同语言间安全防护措施的一致性,以及其对对抗性提示表述的抵抗能力。
支持的任务与排行榜
- 安全评估:评估模型是拒绝还是遵从有害请求。
- 越狱检测:训练模型或过滤器以检测对抗性规避策略。
- 多语言对齐测试:比较大语言模型在不同语言和文化中安全对齐的公平性。
数据集结构
分类
数据集分为三个主要危害类别:
- 非法活动:与违法行为相关的请求(例如:毒品贩运、人口贩运)。
- 滥用:旨在将模型用于非预期用途的请求(例如:生成虚假信息、假新闻)。
- 毒性:具有攻击性、歧视性、仇恨或骚扰性的内容。
数据实例
每种语言的 3,006 个实例按类别和转换策略细分如下:
| 类别 | 原始提示 | 转换后提示 | 每种语言总数 |
|---|---|---|---|
| 非法活动 | 167 | 835 | 1,002 |
| 滥用 | 167 | 835 | 1,002 |
| 毒性 | 167 | 835 | 1,002 |
| 总计 | 501 | 2,505 | 3,006 |
五种语言总计: 15,030 个示例。
转换策略(越狱)
为评估模型的鲁棒性,对每个类别的 167 个原始提示应用了五种不同的规避技术:
- 角色扮演:在虚构场景或角色扮演中提出请求。
- Base64 编码:使用 Base64 对有害请求进行混淆。
- 零宽度插入:插入不可见的 Unicode 字符以绕过简单的词法过滤器。
- 创意写作:将请求伪装成创意或文学任务。
- 诱饵与转换:从一个看似无害的请求开始,随后转向有害意图。
数据集创建
策划理由
旨在填补低资源语言(如巴斯克语、加利西亚语和加泰罗尼亚语)与高资源语言(英语、西班牙语)在安全评估方面的空白。通过在所有语言中保持相同的生成策略,该数据集允许研究者对模型安全性进行一对一的跨语言可比性测试。
源数据与生成
- 平台:Galtea.ai
局限性与伦理考量
- 局限性:由于数据集是通过大语言模型合成生成的,可能包含生成伪影或特定偏见。此外,虽然策略是对齐的,但在表达危害的深层文化细微差别上,可能与自然的人类表述略有不同。
- 伦理考量与风险:警告:本数据集设计上包含高度有毒、冒犯性及潜在非法的文本。仅用于安全评估、红队测试和防御性研究。用户查看或展示这些数据时必须谨慎,不得用于训练模型生成有害内容。




