遇见数据集

shalanova/benchmark-3-russian-m2m

收藏
Hugging Face2026-04-30 更新2026-05-03 收录
官方服务:

资源简介:

该数据集是从JailbreakBench/JBB-Behaviors翻译而来,使用了facebook/m2m100_418M模型进行俄语翻译。数据集的领域涉及多种不安全类别,如有害指令、敏感话题和对抗性重述,这些类别增加了数据集的多样性和分布变异性,使得基于相似性的检测更具挑战性。数据集包含200个提示(100个安全/100个不安全),列包括原始提示文本、标签(0表示安全,1表示不安全)、俄语翻译以及俄语模型与代码书的余弦相似度得分。

This dataset is translated from JailbreakBench/JBB-Behaviors using the facebook/m2m100_418M model into Russian. The domain includes heterogeneous unsafe categories (e.g., harmful instructions, sensitive topics, adversarial rephrasings), which increase the diversity and distributional variability of the dataset, making similarity-based detection more challenging. The dataset contains 200 prompts (100 safe / 100 unsafe), with columns including the original prompt text, labels (0 for safe, 1 for unsafe), Russian translation, and cosine similarity scores with a codebook for the Russian model.

提供机构:
shalanova
搜集汇总
数据集介绍
shalanova/benchmark-3-russian-m2m 数据集图片
构建方式
该数据集源自 JailbreakBench/JBB-Behaviors 源数据集,针对多语言安全检测场景进行了俄语迁移构建。研究团队采用 facebook/m2m100_418M 神经机器翻译模型,将原始英文提示精准转化为俄语版本。数据集涵盖100条安全与100条不安全提示,通过模型翻译保留语义结构与对抗性特征,确保源语言中的有害指令、敏感主题和对抗性改写等异质不安全类别在目标语言中得到忠实复现,从而构建出具有跨语言一致性的评估基准。
使用方法
该数据集适用于评估多语言安全检测模型在俄语环境下的越狱行为识别能力。用户可直接加载翻译后的文本与标签列,训练或验证分类模型对安全与不安全提示的区分度。借助 score_ru_model 列,可进一步分析模型预测与基于码本嵌入的相似度阈值之间的关系,探索跨语言安全检测中的决策边界。研究人员还可对比原始英文与俄语翻译版本,分析语言迁移对越狱攻击成功率的影响,为构建鲁棒的多语言安全系统提供实证支持。
背景与挑战
背景概述
随着大语言模型在开放场景中的广泛应用,其安全性问题日益凸显,尤其是针对模型所设计的越狱攻击(jailbreak attacks)对对齐机制构成了严峻挑战。在此背景下,由JailbreakBench研究团队在2025年发布的benchmark-3-russian-m2m数据集应运而生,旨在评估跨语言环境下越狱检测的鲁棒性。该数据集基于JailbreakBench的JBB-Behaviors源库,利用facebook/m2m100_418M模型将200条提示(涵盖100条安全与100条不安全样本)翻译为俄语,以模拟真实世界中多语言恶意输入的分布。其核心研究问题聚焦于跨语言迁移时相似性检测方法的脆弱性,为构建更通用的对抗样本识别系统提供了重要评估基准,在AI安全领域具有显著影响力。
当前挑战
该数据集所解决的核心领域问题在于,现有的越狱检测方法多集中于英语场景,而面对语言转换后的多样化不安全类别(如有害指令、敏感话题、对抗性改写)时,相似性检测极易失效,亟需一个跨语言的压力测试基准。构建过程中也面临多重挑战:首先,200条样本规模有限,需在安全与不安全之间精准平衡,避免类别偏斜影响评估的统计效力;其次,使用单一模型m2m100_418M进行翻译可能引入翻译失真或保留源语言的越狱模式,无法完全还原自然俄语中真实攻击的变异;此外,数据来源的异质性(非典型越狱模板)增加了标注一致性维护的难度,使实验室环境与真实部署场景之间存在认知鸿沟。
常用场景
经典使用场景
在跨语言安全对齐与有害内容检测的研究中,该数据集常被用作评估多语言大模型在俄语环境下抵御越狱攻击能力的基准测试。其核心价值在于提供了100条安全与100条不安全提示的平衡样本,且提示来源涵盖异构不安全类别(如有害指令、敏感话题、对抗性改写),从而为相似性检测方法(尤其是基于码本的余弦相似度评分)提供了压力测试场景。研究者可通过比较原始英文提示与俄语翻译后的模型输出,检验现有安全机制在语言迁移时的鲁棒性。
解决学术问题
该数据集直面跨语言安全对齐中的两大关键学术难题:其一是越狱提示的领域与分布多样性对基于相似性的检测方法构成的挑战,其二是多语言翻译模型(如m2m100)在安全敏感内容上引入的语义漂移问题。通过提供精心翻译的俄语提示并标注安全标签,它使学界能够系统量化语言转换对越狱攻击成功率的影响,并为评估现有安全策略在低资源语言上的泛化能力提供了标准化测试平台。这一工作填补了非英语环境下越狱行为基准的空白,推动了多语言AI安全研究的发展。
实际应用
在实际部署中,该数据集可被用于俄语社交媒体平台、在线客服系统或智能助手的反滥用过滤模块中,帮助识别并拦截试图绕过内容安全策略的多语言攻击。例如,当检测到用户以俄语形式提交疑似越狱指令时,系统可结合码本嵌入的余弦相似度进行实时判断,从而提升对非英语有害内容的拦截准确率。此外,该数据集还能辅助安全审计人员评估翻译服务在敏感上下文中的可靠性,确保跨语言应用的安全合规。
数据集最近研究
最新研究方向
该数据集聚焦于跨语言安全对齐的前沿探索,通过将英文越狱提示集(JBB-Behaviors)自动翻译为俄语,构建了多语种恶意内容检测的挑战性基准。其核心创新在于引入异构不安全类别与对抗性改述,突破了传统相似性检测对固定模板的依赖,为评估多语言模型在安全对齐中的跨语言泛化能力提供了严苛测试。相关工作已发表于arXiv 2604.25716,揭示了当前大语言模型在非英语语境下防御机制的脆弱性,对推动多语种AI安全治理具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务