遇见数据集

shalanova/benchmark-2-arabic-m2m

收藏
Hugging Face2026-04-30 更新2026-05-03 收录
官方服务:

资源简介:

该数据集主要包含提示注入和典型越狱风格指令的数据,攻击模式相对同质。数据集包含1,000个提示,其中500个是安全的,500个是不安全的。数据集包含四个列:text(原始提示)、label(0表示安全,1表示不安全)、translation(由facebook/m2m100_418M模型翻译成阿拉伯语的提示)和score_ar_model(与codebook的余弦相似度分数)。数据集来源于xTRam1/safe-guard-prompt-injection,并通过facebook/m2m100_418M模型进行了阿拉伯语翻译。

The dataset primarily contains prompt-injection and canonical jailbreak-style instructions with relatively homogeneous attack patterns. It consists of 1,000 prompts (500 safe / 500 unsafe). The dataset includes four columns: text (original prompt), label (0: safe, 1: unsafe), translation (prompt translated into Arabic by the facebook/m2m100_418M model), and score_ar_model (cosine similarity score with codebook). The dataset is sourced from xTRam1/safe-guard-prompt-injection and has been translated into Arabic using the facebook/m2m100_418M model.

提供机构:
shalanova
搜集汇总
数据集介绍
shalanova/benchmark-2-arabic-m2m 数据集图片
构建方式
本数据集基于安全防护领域的提示注入与越狱指令检测任务而构建。原始数据源自xTRam1/safe-guard-prompt-injection数据集,涵盖内容以保证安全与不安全类别均衡。利用facebook/m2m100_418M模型将原始英文提示自动翻译为阿拉伯语,从而生成阿拉伯语版本的提示文本。数据集共收录1000条提示,其中安全与不安全指令各占500条,确保了类别分布的平衡性。每一条记录均包含原始文本、标签、翻译结果以及与codebook嵌入的余弦相似度评分。
特点
该数据集的核心特质在于其聚焦于提示注入与越狱指令的阿拉伯语翻译版本,填补了阿拉伯语安全检测领域数据资源的空白。数据规模虽小但类别均衡,便于进行二元分类任务的快速评估。翻译过程采用多语言机器翻译模型,保证了翻译质量的一致性。此外,每条记录附带基于codebook嵌入的相似度评分,为后续的嵌入分析与安全检测研究提供了额外的度量维度。
使用方法
该数据集可直接用于阿拉伯语提示安全分类模型的训练与评估。用户可根据'text'字段加载原始提示或使用'translation'字段获取阿拉伯语版本。'label'字段提供监督学习所需的标签信息。结合'score_ar_model'字段,可探索基于嵌入相似度的无监督或半监督安全检测方法。建议将数据划分为训练集与测试集,利用标准分类指标如准确率、精确率、召回率与F1分数进行模型性能评估。
背景与挑战
背景概述
随着大型语言模型在自然语言处理领域的广泛应用,如何防御prompt注入和越狱攻击成为安全性研究的核心议题。benchmark-2-arabic-m2m数据集由研究人员基于xTRam1/safe-guard-prompt-injection数据集构建,创建于2025年,旨在填补阿拉伯语环境下安全评测资源的空白。该数据集借助facebook/m2m100_418M模型将1000条英文prompt(包含500条安全与500条不安全样本)翻译为阿拉伯语,覆盖了典型的攻击模式。其研究聚焦于多语言场景下的模型鲁棒性评估,为理解跨语言安全缺口提供了关键基准,推动了低资源语言安全对齐领域的发展。
当前挑战
该数据集所解决的领域问题在于,现有安全评测多集中于英语,缺乏针对阿拉伯语的标准化基准,导致模型在非英语环境中的脆弱性被忽视。构建过程中,机器翻译可能引入语义偏差或文化特异性误解,例如攻击指令的隐含意义在跨语言传递时失真。此外,数据集样本的attack pattern相对同质化,限制了对其泛化能力的评估;同时,基于余弦相似度的评分机制依赖预定义codebook,可能无法捕捉新型攻击策略的细微差异,挑战了该基准在动态安全威胁下的时效性。
常用场景
经典使用场景
在阿拉伯语自然语言处理与安全对齐研究的交汇处,该数据集作为首个专注于阿拉伯语提示注入检测的基准测试资源,承载着评估多语言模型在低资源语言中安全防护能力的重任。其典型使用场景聚焦于验证机器翻译模型(如M2M100)在将英文恶意指令转化为阿拉伯语后,目标语言文本是否仍保留攻击性语义,以及各类安全分类器能否有效识别这些跨语言迁移的威胁。研究者通常利用该数据集对现有安全对齐框架进行跨语言鲁棒性测试,对比分析模型在阿拉伯语与原英语输入上的表现差异,从而揭示语言屏障在安全防护中的脆弱性。此外,该数据集也适用于微调低资源语言的安全分类器,通过其均衡的500条安全与500条不安全样本,为模型在阿拉伯语境下的二分类任务提供标准化的训练与评估基准。
实际应用
在实际部署中,该数据集直接服务于阿拉伯语AI系统的安全防护体系构建,助力打造更全面的多语种内容审核网关。科技企业可借助此基准测试其对话机器人、客服系统或内容生成服务在阿拉伯语场景中拦截恶意注入指令的能力,尤其适用于社交媒体平台自动筛查伪装成正常对话的越狱攻击。金融与政务机构通过该数据集评估阿拉伯语版智能助手对敏感指令泄漏的防控水平,确保本地化部署的AI系统满足区域合规性要求。此外,基于该资源训练的安全分类器可直接集成于阿拉伯语预训练模型的处理管线,在翻译、摘要等下游任务执行前对用户输入实施前置过滤,有效降低跨语言攻击在实际生产环境中的触发风险。
衍生相关工作
围绕该数据集已衍生出多项探索性工作,其中最具代表性的是基于其嵌入特征开发的无监督异常检测方法,以及针对机器翻译噪声的对抗性训练框架。研究者利用数据集中提供的codebook余弦相似度分数,构建了无需标注即可识别阿拉伯语攻击样本的轻量级筛查器,显著降低了低资源语言安全监控的标注成本。同时,该数据集成为测试跨语言攻击泛化能力的基准平台,催生了若干关于攻击模式在翻译过程中语义保真度与失真效应的实证分析。另一重要方向是通过对比原始英文样本与阿拉伯语译本的分类置信度差异,研究者设计了多语言集成投票机制来提升安全分类器的整体检测率,这些工作共同拓展了多语言安全领域的实验方法论与评估标准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务