遇见数据集

shalanova/benchmark-1-russian-m2m

收藏
Hugging Face2026-04-30 更新2026-05-03 收录
官方服务:

资源简介:

该数据集是一个关于提示注入安全性的数据集,包含500个安全提示和500个不安全提示,总计1000个提示。每一行数据包含原始提示文本、标签(0表示安全,1表示不安全)、由facebook/m2m100_418M模型翻译的俄语提示文本,以及与codebook_embeddings的余弦相似度分数。数据集的领域主要是提示注入和典型的越狱风格指令,具有相对同质的攻击模式。

This dataset is about prompt injection safety, containing 500 safe prompts and 500 unsafe prompts, totaling 1000 prompts. Each row of data includes the original prompt text, a label (0 for safe, 1 for unsafe), the prompt text translated into Russian by the facebook/m2m100_418M model, and a cosine similarity score with codebook_embeddings. The domain of the dataset is primarily prompt injection and canonical jailbreak-style instructions with relatively homogeneous attack patterns.

提供机构:
shalanova
搜集汇总
数据集介绍
shalanova/benchmark-1-russian-m2m 数据集图片
构建方式
本数据集基于jayavibhav/prompt-injection-safety源数据集构建,采用Facebook开发的m2m100_418M多语言翻译模型,将原始英文提示指令自动转换为俄语版本。原始数据涵盖提示注入与经典越狱类指令,攻击模式相对同质,经翻译后形成1,000条俄语提示样本,其中安全与非安全样本各500条,确保了类别的均衡分布。
特点
数据集以俄语安全评估为核心,包含text(原始提示)、label(安全/不安全二元标签)、translation(俄语翻译文本)及score_ru_model(与codebook嵌入的余弦相似度)四列信息。其独特之处在于融合了机器翻译的跨语言属性与提示注入攻击检测任务,为俄语环境下的语言模型安全性测试提供了标准化基准。
使用方法
该数据集可直接用于俄语提示注入分类器的训练与评估,利用label字段作为监督信号。translation列支持多语言模型的鲁棒性测试,score_ru_model可用于分析翻译质量与攻击行为的相关性。研究者可基于数据集的二元标签体系,结合文本嵌入或序列分类模型,开展俄语安全对齐技术的实证研究。
背景与挑战
背景概述
随着大语言模型在自然语言处理领域的广泛应用,提示注入攻击与越狱指令已成为威胁模型安全的关键问题。该数据集创建于2025年,源自jayavibhav/prompt-injection-safety数据集,由研究人员利用facebook/m2m100_418M模型将其翻译为俄语版本。核心研究问题聚焦于评估多语言环境下语言模型对抗恶意提示注入的能力,特别是俄语场景下的安全检测。数据集涵盖500条安全与500条不安全提示,为俄语LLM安全评估提供了标准化基准,并推动跨语言安全对齐研究的发展。
当前挑战
该数据集面临的领域挑战包括:俄语提示注入攻击模式的多样性不足,现有攻击模式相对同质,难以覆盖复杂真实场景;翻译过程可能引入语义偏差,影响原始攻击意图的保真度。构建过程中遇到的主要挑战有:利用机器翻译模型处理专业攻击术语时,存在语义丢失或曲解风险;需确保安全标签在跨语言后仍保持一致性;以及余弦相似度评分机制对翻译后样本差异的敏感性问题,制约了数据集在动态攻击检测中的适用性。
常用场景
经典使用场景
在大型语言模型安全评估领域,该数据集主要作为衡量多语言环境下模型对提示注入和越狱攻击防御能力的基准测试工具。研究者通过对比原始英文提示与俄语翻译后模型的行为差异,揭示语言转换对安全机制的影响规律。其经典用法是构建双语安全评估框架,在保持攻击模式结构一致的前提下,系统性检验多语言场景中安全对齐策略的泛化表现。
实际应用
实际应用中,该数据集驱动了俄语AI对话系统的安全审查流程优化,直接服务于俄罗斯及独联体国家的智能客服、内容审核平台。企业可基于这些样本训练多语种安全过滤器,检测用户输入中的恶意指令。在跨国部署的AI产品中,此基准帮助测试团队发现因语言差异导致的安全漏洞,提升全球化服务的抗攻击能力。
衍生相关工作
围绕该数据集衍生出一系列重要研究,包括跨语言安全迁移学习框架、基于翻译一致性的对抗检测方法等。研究者开发出利用codebook嵌入匹配的防御增强技术,在此基础上扩展出针对低资源语言的合成攻击样本生成工具。这些工作共同推动了多语言安全评估从单一攻击检测向动态防御生态的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务