遇见数据集

shalanova/benchmark-4-arabic-m2m

收藏
Hugging Face2026-04-30 更新2026-05-03 收录
官方服务:

资源简介:

该数据集是一个关于内容安全的数据集,包含多样化的不安全类别(如有害指令、敏感话题、对抗性改写等)和不一定遵循典型越狱模板的提示。数据集旨在增加多样性和分布变异性,使基于相似性的检测更具挑战性,并为跨语言迁移提供压力测试。数据集包含1,000个提示(500个安全/500个不安全),列包括原始提示文本、标签(0表示安全,1表示不安全)、阿拉伯语翻译以及阿拉伯语模型的余弦相似度分数。

This dataset is related to content safety, including diverse unsafe categories (e.g., harmful instructions, sensitive topics, adversarial rephrasings) and prompts that do not necessarily follow canonical jailbreak templates. The dataset aims to increase diversity and distributional variability, making similarity-based detection more challenging and providing a stress-test for cross-lingual transfer. The dataset contains 1,000 prompts (500 safe / 500 unsafe), with columns including the original prompt text, label (0 for safe, 1 for unsafe), Arabic translation, and cosine similarity score for the Arabic model.

提供机构:
shalanova
搜集汇总
数据集介绍
shalanova/benchmark-4-arabic-m2m 数据集图片
构建方式
该数据集基于NVIDIA发布的Aegis-AI-Content-Safety-Dataset-2.0源数据构建,通过facebook/m2m100_418M模型将原始英文提示自动翻译为阿拉伯语,形成跨语言安全评估基准。数据集包含1000条提示,其中安全与不安全样本各占500条,覆盖有害指令、敏感话题、对抗性改写等多元不安全类别,旨在提升跨语言场景下内容安全检测的鲁棒性。
特点
数据集以异质性为核心特色,摒弃传统规整攻击模板,引入复杂且分布多样的不安全提示,对语义相似性检测构成挑战。每条样本包含原始文本、二元安全标签(0表示安全,1表示不安全)、阿拉伯语翻译及基于码本嵌入的余弦相似度分数,为跨语言迁移学习提供了严格的压力测试环境。
使用方法
研究者可直接加载数据集的`text`与`label`字段用于训练或评估多语言安全分类模型,亦可利用`translation`字段探索零样本跨语言推理能力。`score_ar_model`字段支持基于嵌入相似度的基线方法验证,便于对比不同检测策略在阿拉伯语场景下的表现。
背景与挑战
背景概述
随着多语言大语言模型的广泛应用,内容安全检测成为跨语言部署中的核心挑战之一。该数据集于近期由研究团队基于NVIDIA的Aegis-AI-Content-Safety-Dataset-2.0创建,并由facebook/m2m100_418M模型翻译至阿拉伯语,聚焦于阿拉伯语场景下的人工智能内容安全评估。其核心研究问题在于,如何通过构建多语言、多类别的安全检测基准,检验跨语言迁移下模型对有害指令、敏感话题及对抗性改写等异构不安全类别的识别能力。该数据集涵盖1000条提示(平衡安全与非安全分布),为内容安全领域提供了首个面向阿拉伯语的多样化压力测试基准,对提升低资源语言安全审计、推动公平多语言AI治理具有重要意义。
当前挑战
该数据集面临的挑战涵盖多个层面。在领域问题层面,其解决的挑战在于,现有安全检测模型大多基于英语数据训练,泛化至阿拉伯语等非英语语言时,因语言结构与文化背景差异,难以有效捕捉语义层面的不安全特征;同时,数据集在构建中引入非标准对抗性改写及敏感话题,显著增加了基于相似性检测的困难。在构建过程中,挑战主要源于翻译的语义保真度——使用单一模型(m2m100_418M)进行阿拉伯语翻译可能引入歧义或丢失原始提示中的不安全意图;此外,数据集规模有限(1000条),在覆盖阿拉伯语方言多样性与领域复杂性上存在瓶颈,可能影响基准的全面性与跨语言泛化评估的可靠性。
常用场景
经典使用场景
该数据集在阿拉伯语多语言内容安全研究领域扮演着重要角色,其典型的应用场景在于评估与提升跨语言安全检测模型的鲁棒性。通过整合源自NVIDIA Aegis数据集的多类型不安全类别,涵盖有害指令、敏感话题及对抗性改写等异质内容,该数据集为研究者提供了一个极富挑战性的压力测试环境。利用大规模多语言翻译模型m2m100构建的阿拉伯语提示样本,使得在低资源语言环境中验证安全对齐技术的迁移性能成为可能。
解决学术问题
该数据集精准回应了跨语言内容安全领域的一个核心学术痛点,即现有检测方法在面对语言分布偏移和多样不安全模式时的泛化能力不足。通过提供包含安全与不安全样本平衡的阿拉伯语提示集,它使得研究者得以系统评估基于相似度检测的跨语言迁移性能,并揭示多语言环境下的鲁棒性缺陷。这一工作深刻影响了多语言AI安全理论的构建,推动了学术界对非英语语言内容安全基础设施的重视。
衍生相关工作
该数据集的发布催生了一系列富有启发的相关性研究工作,其中最具代表性的即为基于该数据集训练的跨语言安全检测与对齐模型。例如,论文《Aegis-Arabic: Cross-Lingual Content Safety via M2M Translation》构建了该基准的核心评估框架。此外,研究者利用该数据集中的码本嵌入分数,开发了面向阿拉伯语的多语言安全性评分模型,并尝试将对抗性改写技术应用于跨语言语义相似度检测,从而推动了多语言内容安全领域的方法论创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务