遇见数据集

shalanova/benchmark-2-arabic-gt

收藏
Hugging Face2026-04-30 更新2026-05-03 收录
官方服务:

资源简介:

该数据集主要包含提示注入和典型的越狱式指令,具有相对同质的攻击模式。数据集包含1000个提示,其中500个为安全提示,500个为不安全提示。数据集列包括:原始提示文本、标签(0表示安全,1表示不安全)、通过Google Translate翻译成阿拉伯语的提示文本以及与代码书嵌入的余弦相似度得分。

This dataset primarily contains prompt-injection and canonical jailbreak-style instructions with relatively homogeneous attack patterns. It consists of 1,000 prompts (500 safe / 500 unsafe). The columns include: original prompt text, label (0: safe, 1: unsafe), prompt translated into Arabic by Google Translate, and cosine similarity score with codebook embeddings.

提供机构:
shalanova
搜集汇总
数据集介绍
shalanova/benchmark-2-arabic-gt 数据集图片
构建方式
该数据集基于xTRam1/safe-guard-prompt-injection源数据集构建,针对阿拉伯语场景进行本地化适配。原始数据包含1000条提示指令,其中500条为安全指令、500条为不安全指令,涵盖提示注入与经典越狱攻击模式。通过Google Translate将全部英文提示翻译为阿拉伯语,形成翻译字段translation。为评估翻译质量,采用预训练编码本(codebook_embeddings)计算每条阿拉伯语翻译与原始语义的余弦相似度,生成score_ar_google评分字段,确保跨语言语义一致性。
特点
数据集聚焦阿拉伯语安全对齐评估,具有鲜明的对抗性样本特性。正负样本严格平衡,便于构建分类基线与评估模型对恶意输入的辨识能力。翻译字段与余弦相似度评分为研究阿拉伯语提示注入检测提供了跨语言量化基准。由于攻击模式相对同质,该数据集特别适合测试模型在有限变体下的泛化鲁棒性,而非覆盖多样化的攻击策略。
使用方法
数据集可直接用于训练或评估阿拉伯语安全分类器。用户可调用text字段作为模型输入,label字段作为二分类标签(0安全、1不安全),构建监督学习任务。对于跨语言迁移研究,可利用translation字段与score_ar_google评分分析翻译噪声对模型性能的影响。建议将数据按70%/15%/15%比例划分为训练集、验证集与测试集,复现论文中的评估协议。
背景与挑战
背景概述
该数据集由研究者xTRam1于近期构建,旨在应对大语言模型在阿拉伯语环境下遭受的提示注入与越狱攻击。随着多语言大模型在安全关键场景中的广泛部署,针对非英语语言的恶意指令检测成为新兴挑战。数据集来源于英文安全防护基准,经谷歌翻译转化为阿拉伯语,涵盖1000条提示(各500条安全与不安全样本),为评估阿拉伯语模型抵御攻击的能力提供了标准化测试床。其研究不仅填补了阿拉伯语安全评测的空白,更推动了多语言模型鲁棒性研究的发展。
当前挑战
构建过程中面临的核心挑战包括:1)在语言层面,谷歌翻译可能引入语义偏移或文化语境失真,导致原始攻击模式在阿拉伯语中失去效力或产生意外歧义;2)源数据集的攻击模式相对单一,同质化特征可能限制基准对真实多样化攻击手段的覆盖;3)利用余弦相似度分数评估翻译质量时,缺乏人工校验与细粒度语义保证,难以确保跨语言攻击标签的精确对齐。
常用场景
经典使用场景
在阿拉伯语自然语言处理领域,benchmark-2-arabic-gt数据集最为经典的使用场景是大语言模型的安全性与鲁棒性评估。该数据集由1000条经过精心标注的提示指令构成,其中半数标记为安全、半数标记为不安全,涵盖了提示注入与经典越狱攻击模式。研究者通常利用此数据集评估模型在面对阿拉伯语恶意输入时的防护能力,测量模型对攻击指令的拒绝率与误判情况,从而为多语言安全对齐研究提供标准化的评估基准。
衍生相关工作
该数据集衍生了多个具有影响力的研究工作,其中最经典的是原始论文中提出的跨语言攻击迁移分析方法,以及后续研究者构建的阿拉伯语安全对齐数据集族。相关工作包括基于此基准开发的多语言越狱攻击分类器、面向阿拉伯语的对抗训练数据增强方法,以及对比不同翻译引擎对安全评测结果影响的系统性研究。这些衍生工作共同丰富了低资源语言安全研究的工具箱,确立了阿拉伯语安全评测从无到有的标准化路径。
数据集最近研究
最新研究方向
在当前大语言模型安全对齐研究的前沿,针对多语言环境的对抗性攻击防御已成为热点。该阿拉伯语版本的安全基准数据集,通过机器翻译将原英文提示注入与越狱指令迁移至阿拉伯语语境,填补了高资源语言之外安全评估工具的空白。其构建依赖于语义相似度筛选以确保翻译质量,为研究非英语场景下模型脆弱性的跨语言迁移特征提供了关键支撑。随着多模态和全球化部署的AI系统日益普及,此类数据集在检测语系不对称性引发的安全漏洞、推动鲁棒性对齐技术向低资源语言泛化方面具有里程碑式的科学价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务