shalanova/benchmark-2-chinese-m2m
收藏官方服务:
资源简介:
该数据集主要包含提示注入和典型的越狱式指令,具有相对同质的攻击模式。数据集大小为1,000个提示,其中500个是安全的,500个是不安全的。数据集包含四个列:text(原始提示)、label(0表示安全,1表示不安全)、translation(由facebook/m2m100_418M模型翻译成中文的提示)和score_zh_model(与codebook的余弦相似度分数)。
The dataset primarily contains prompt-injection and canonical jailbreak-style instructions with relatively homogeneous attack patterns. The size is 1,000 prompts (500 safe / 500 unsafe). Columns include: text - original prompt, label - 0: safe, 1: unsafe, translation - prompt on Chinese translated by facebook/m2m100_418M, and score_zh_model - cosine similarity score with codebook.
提供机构:
shalanova搜集汇总
数据集介绍

构建方式
本数据集基于源数据集xTRam1/safe-guard-prompt-injection构建,该源数据集主要包含提示注入和典型越狱风格的指令,攻击模式相对同质。为适配中文场景,使用facebook/m2m100_418M翻译模型将所有原始提示文本转换为中文,形成翻译字段。数据集共包含1000条提示,安全与不安全样本各500条,保持了类别平衡。同时,为每条翻译后的提示计算了与codebook嵌入的余弦相似度得分,以量化其语义特征。
特点
该数据集聚焦于中文环境下的提示注入安全评估,具有明确的二分类标签(安全/不安全)和均衡的样本分布。通过机器翻译实现跨语言适配,并创新性地引入与codebook的余弦相似度得分,为理解提示攻击的语义模式提供了量化指标。数据集规模适中,既可用于模型安全性能的基准测试,也适用于少样本学习场景。
使用方法
数据集可直接用于训练和评估中文提示注入检测模型,用户可通过HuggingFace Datasets库加载。建议将翻译字段作为输入文本,利用标签字段进行监督学习。相似度得分字段可作为附加特征,辅助模型学习攻击模式间的语义差异。此外,该数据集还可用于对比不同语言下提示注入检测的迁移学习效果,或作为多语言安全评估的基准之一。
背景与挑战
背景概述
在大型语言模型(LLMs)安全对齐领域,提示注入与越狱攻击(jailbreak)构成了对模型鲁棒性的严峻考验。针对此类安全威胁的评估数据集,尤其是中文场景下的资源,尚显匮乏。为此,研究人员基于 `xTRam1/safe-guard-prompt-injection` 数据集,利用 `facebook/m2m100_418M` 翻译模型,于近期构建了 `benchmark-2-chinese-m2m` 基准数据集。该工作由关注多语言安全评估的研究团队推动,核心研究问题聚焦于如何系统性地评估中文环境下LLMs对提示注入攻击的防御能力。该数据集包含1000条标注样本(500条安全、500条不安全),并提供了余弦相似度评分,为相关研究提供了可复现的量化基准,对推动多语言安全对齐的研究具有重要参考价值。
当前挑战
该数据集所应对的领域核心挑战在于:提示注入攻击手法日趋复杂,现有防御机制在非英语环境下往往失效,亟需多语言安全基准来支撑鲁棒性评估。构建过程中面临的挑战包括:1)原始数据集攻击模式相对同质化,需确保翻译后中文样本仍能反映真实攻击多样性;2)使用单一机器翻译模型(`m2m100_418M`)可能导致翻译文本丢失原始指令中的微妙语义或文化特定攻击特征;3)标签翻译的一致性与安全性边界界定难度较高,需人工校验以避免误标;4)余弦相似度评分仅提供语义可比性,但无法完全捕捉对抗性扰动带来的分类失效,需持续迭代以提升基准的鉴别力。
常用场景
经典使用场景
在人工智能安全领域,提示注入与越狱攻击是大型语言模型面临的核心威胁。该数据集聚焦于中文场景下的安全评估,包含500条安全提示与500条恶意提示,经机器翻译后形成双语对照资源。其经典使用场景在于作为基准测试集,系统性地评估中文大语言模型对恶意输入的识别与防御能力,尤其适用于检测模型在面对隐蔽性越狱指令时的鲁棒性表现。
解决学术问题
该数据集解决了中文环境下安全评估标准缺失的学术难题。过往研究多集中于英文语料,缺乏对中文模型对抗攻击的系统性评测资源。通过提供标注清晰的正负样本对,研究人员能够量化不同防御策略的效果,探讨提示注入攻击的语言特异性特征,并推动跨语言安全对齐问题的理论发展,为构建更安全的中文大模型奠定实证基础。
衍生相关工作
该数据集衍生出的相关工作包括:基于余弦相似度的嵌入安全分类器研究,其score_zh_model指标为后续工作提供了基线;双语提示注入检测方法的探索,推动了跨语言攻击迁移性的分析;以及arXiv论文中提出的对抗攻击评估框架,激励学术界开发更鲁棒的中文安全对齐策略,相关成果已被用于设计新一代防御算法。
以上内容由遇见数据集搜集并总结生成



