遇见数据集

shalanova/benchmark-3-chinese-gt

收藏
Hugging Face2026-04-30 更新2026-05-03 收录
官方服务:

资源简介:

该数据集是一个关于安全和不安全提示的数据集,包含200个提示(100个安全/100个不安全)。数据集的特点是包含异构的不安全类别(如有害指令、敏感话题、对抗性重述),并且提示不一定遵循典型的越狱模板。这种多样性和分布变异性使得基于相似性的检测更具挑战性,并为跨语言迁移提供了压力测试。数据集包含四个列:text(原始提示)、label(0表示安全,1表示不安全)、translation(通过Google Translate翻译成中文的提示)和score_zh_google(与codebook的余弦相似度得分)。

This dataset is a collection of safe and unsafe prompts, containing 200 prompts (100 safe / 100 unsafe). The dataset features heterogeneous unsafe categories (e.g., harmful instructions, sensitive topics, adversarial rephrasings) and contains prompts that do not necessarily follow canonical jailbreak templates. This increased diversity and distributional variability makes similarity-based detection more challenging and provides a stress-test for cross-lingual transfer. The dataset includes four columns: text (original prompt), label (0: safe, 1: unsafe), translation (prompt translated into Chinese by Google Translate), and score_zh_google (cosine similarity score with codebook).

提供机构:
shalanova
搜集汇总
数据集介绍
shalanova/benchmark-3-chinese-gt 数据集图片
构建方式
本数据集源自JailbreakBench团队发布的JBB-Behaviors基准测试集,经Google翻译引擎自动转换后,构建了包含200条中文提示的评估集合。为确保类别平衡,数据集中安全与不安全提示各占100条,每条样本均保留原始英文文本、人工标注的标签(0为安全,1为不安全)、机器翻译后的中文版本,以及通过与预设编码库计算余弦相似度得到的风险评分。
特点
该数据集覆盖了异构不安全类别,涵盖有害指令、敏感话题及对抗性改写等内容,不局限于经典的越狱模板,显著提升了样本的多样性与分布变异性。这种复杂性不仅增强了基于相似性检测的难度,也为跨语言迁移能力提供了严苛的压力测试,从而更全面地评估模型在面对未知攻击时的鲁棒性。
使用方法
数据集以HuggingFace标准格式存储,用户可通过加载`datasets`库直接调用,便捷地获取`text`、`label`、`translation`及`score_zh_google`四个字段。其设计初衷在于为多语言安全对齐研究提供量化基准,尤其适用于验证防御机制在中文语境下的有效性,并可结合编码库进行相似度阈值调优或作为跨语言越狱检测方法的测试集。
背景与挑战
背景概述
该数据集创建于2026年,由JailbreakBench研究团队基于其原始英文数据集JBB-Behaviors构建,核心研究问题聚焦于跨语言场景下大语言模型越狱攻击检测的鲁棒性。研究机构通过引入机器翻译手段,将涵盖有害指令、敏感话题与对抗性改写等异构不安全类别的200条提示语翻译为中文,旨在评估现有相似性检测方法在跨语言迁移中的泛化能力。这一数据集对多语言AI安全领域具有里程碑意义,为理解语言边界对安全防御机制的影响提供了关键测试基准。
当前挑战
数据集面临的核心挑战在于跨语言语境下越狱检测的复杂性——中文翻译可能保留原始攻击意图,但语义偏移与表达习惯差异导致基于余弦相似度的匹配策略易失效。构建过程中需应对机器翻译引入的歧义性与文化特异性问题,例如中文无主语句式或成语化表达可能掩盖攻击性内容。此外,100条安全与不安全样本的平衡设计虽具代表性,但规模有限,难以覆盖中文社区中更隐蔽的对抗性改写模式,为防御系统的实际部署构成严峻考验。
常用场景
经典使用场景
在跨语言安全对齐领域,该数据集被广泛用于评估大语言模型在面对中文恶意指令时的鲁棒性。其包含的200条提示词均匀覆盖安全与非安全类别,并融合了有害指令、敏感话题及对抗性改写等多源异构不安全场景,为研究者提供了测试模型在中文语境下防御越狱攻击能力的标准化基准。通过计算提示词与安全编码本的余弦相似度,可量化评估模型对恶意输入的敏感程度,从而推动多语言安全机制的发展。
解决学术问题
该数据集直击当前大语言模型在非英语语言(尤其是中文)中安全对齐不足的学术痛点。由于多数安全训练数据以英文为主,跨语言迁移时易出现防御退化现象。此基准通过引入分布多样性和跨语言变异性,系统性地检验了基于相似性检测的防御方法在中文场景下的有效性,揭示了语言差异如何导致安全机制失效,为构建语言无关的鲁棒安全对齐策略提供了关键实验证据。
衍生相关工作
该数据集衍生出多项前沿研究,包括利用其100条不安全提示构建的中文对抗性攻击基准,以及与JailbreakBench原始英文数据的对比分析工作。相关论文(arXiv:2604.25716)提出了一种基于编码本嵌入的动态安全评估框架,并验证了跨语言攻击的迁移性。此外,该数据还催生了多语言安全红队测试标准化协议,为后续Vicuna-Chinese等中文模型的定向安全增强提供了训练与评估资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务