遇见数据集

shalanova/benchmark-2-russian-gt

收藏
Hugging Face2026-04-30 更新2026-05-03 收录
官方服务:

资源简介:

该数据集是通过Google Translate翻译成俄语的,主要包含prompt-injection和典型的jailbreak-style指令,具有相对同质的攻击模式。数据集大小为1,000个提示(500个安全/500个不安全),包含四个列:text(原始提示)、label(0表示安全,1表示不安全)、translation(通过Google Translate翻译成俄语的提示)、score_ru_google(与codebook的余弦相似度得分)。更多信息可参考提供的论文链接。

The dataset is translated into Russian by Google Translate, primarily containing prompt-injection and canonical jailbreak-style instructions with relatively homogeneous attack patterns. The size is 1,000 prompts (500 safe / 500 unsafe) with four columns: `text` (original prompt), `label` (`0`: safe, `1`: unsafe), `translation` (prompt on Russian translated by Google Translate), and `score_ru_google` (cosine similarity score with codebook). More information is available in the provided paper link.

提供机构:
shalanova
搜集汇总
数据集介绍
shalanova/benchmark-2-russian-gt 数据集图片
构建方式
该数据集源自xTRam1/safe-guard-prompt-injection,专为俄语场景下的提示注入与越狱攻击检测而构建。通过Google Translate对原始英文提示进行俄语翻译,形成1000条平行语料,其中安全与非安全样本各占500条。每条样本保留原始文本、标签、俄语翻译及基于预训练codebook嵌入的余弦相似度评分,以量化翻译语义保真度。
特点
数据集聚焦于攻击模式相对同质的提示注入与经典越狱指令,覆盖现代语言模型面临的核心安全威胁。俄语翻译版本填补了非英语安全评测资源的空白,为多语言对齐研究提供基准。1000条平衡样本确保分类任务的可比性,而附加的语义评分则支持对翻译质量与攻击效果关联性的深入分析。
使用方法
适用于俄语提示注入检测模型的训练与评估。用户可直接加载‘text’字段作为模型输入,‘label’字段用于监督学习。‘translation’字段支持对比源语言与目标语言的攻击表现差异,‘score_ru_google’可作为翻译质量的控制变量或特征用于鲁棒性研究。相关代码与详细实验设计参见配套论文。
背景与挑战
背景概述
随着大型语言模型的广泛应用,提示注入与越狱攻击成为威胁模型安全性的关键问题。为评估俄语环境下模型对恶意指令的抵御能力,研究者于近期构建了benchmark-2-russian-gt数据集。该数据集由xTRam1等研究人员基于原始安全防护数据集翻译而来,核心研究问题聚焦于俄语场景下提示注入攻击的检测与分类。通过提供500个安全与500个不安全样本,该数据集为多语言安全对齐研究提供了基准,对推动低资源语言模型安全评估具有重要影响力。
当前挑战
该数据集面临的挑战在于:一是领域问题的复杂性,提示注入与越狱攻击模式高度同质化,传统分类方法易受表面模式干扰,需设计更具泛化能力的检测机制;二是构建过程的局限,依赖机器翻译(Google Translate)可能引入语义偏差或文化适配问题,导致俄语语境下攻击意图的误判。此外,评分机制(cosine similarity)的鲁棒性不足,难以全面覆盖多变的攻击变体,亟需更精细的标注与验证策略以提升数据可靠性。
常用场景
经典使用场景
该数据集的核心用途在于评测大语言模型在面对俄语提示注入(prompt injection)与越狱攻击(jailbreak)时的鲁棒性。其结构设计为包含500条安全与500条不安全提示的均衡样本,常用于构建俄语环境下的安全分类器训练与评估基线,尤其服务于多语言大模型在低资源语种中的防护能力测试。
衍生相关工作
基于该数据集,衍生出俄语提示攻击的嵌入空间分析(如余弦相似度评分研究)、多语言安全基准构建以及跨模型攻击模式聚类等经典工作。其配套的编码簿(codebook)与评分机制更启发了后续学者开发基于语义相似度的防御检测器,形成了从攻击数据集到可解释安全指标的完整研究链条。
数据集最近研究
最新研究方向
该数据集聚焦于俄语语境下的提示注入与越狱攻击检测,是大型语言模型安全对齐研究的前沿延伸。随着多语言大模型在全球的广泛部署,针对非英语语种的攻击向量正成为安全隐患的新焦点。该数据集通过Google翻译将英语安全基准迁移至俄语,并结合余弦相似度评分机制,为评估模型在跨语言环境下的鲁棒性提供了关键工具。其研究意义在于揭示机器翻译引入的语义偏移对安全检测性能的影响,呼应了当前AI安全领域对多语种对抗样本防御策略的迫切需求。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务