遇见数据集

shalanova/benchmark-4-chinese-m2m

收藏
Hugging Face2026-04-30 更新2026-05-03 收录
官方服务:

资源简介:

该数据集包含异构的不安全类别(如有害指令、敏感话题、对抗性重述),并包含不一定遵循典型越狱模板的提示。这种增加的多样性和分布变异性使得基于相似性的检测更具挑战性,并为跨语言迁移提供了压力测试。数据集大小为1,000个提示(500个安全/500个不安全),列包括:`text`(原始提示)、`label`(`0`:安全,`1`:不安全)、`translation`(由`facebook/m2m100_418M`翻译的中文提示)和`score_zh_model`(与[codebook](https://huggingface.co/datasets/shalanova/codebook_embeddings)的余弦相似度分数)。

Domain: include heterogeneous unsafe categories (e.g., harmful instructions, sensitive topics, adversarial rephrasings) and contain prompts that do not necessarily follow canonical jailbreak templates. This increased diversity and distributional variability makes similarity-based detection more challenging and provides a stress-test for cross-lingual transfer. Size: 1,000 prompts (500 safe / 500 unsafe) Columns: - `text` - original prompt - `label` - `0`: safe, `1`: unsafe - `translation` - prompt on Chinese translated by `facebook/m2m100_418M` - `score_zh_model` - cosine similarity score with [codebook](https://huggingface.co/datasets/shalanova/codebook_embeddings)

提供机构:
shalanova
搜集汇总
数据集介绍
shalanova/benchmark-4-chinese-m2m 数据集图片
构建方式
该数据集源自NVIDIA发布的Aegis-AI-Content-Safety-Dataset-2.0,旨在评估中文环境下AI内容安全检测的跨语言迁移能力。构建过程中,研究团队从原始数据集中精选了1,000条提示(prompt),涵盖安全与不安全两类样本各500条,并借助facebook/m2m100_418M模型将这些提示从英文翻译为中文。翻译后的文本被保留为独立的‘translation’字段,同时原始文本和标签信息亦被完整收录。此外,数据集还引入了基于codebook嵌入的余弦相似度评分,用于衡量每条中文提示与预训练安全特征库的语义距离,从而为后续模型评估提供定量参考。
特点
该数据集的突出特点在于其异质性(heterogeneous)与分布多样性。内容领域覆盖了有害指令、敏感话题、对抗性改写等多种非典型不安全类别,这些提示并不遵循传统越狱模板的固定模式,从而极大地增加了基于相似性检测的难度。这种设计不仅挑战了现有安全检测模型的泛化能力,也为跨语言迁移学习提供了一项严苛的‘压力测试’。同时,数据集标签平衡(各500条),兼顾安全与不安全样本,使得模型评估更为全面和公正。
使用方法
该数据集适用于中文内容安全模型的性能评估与跨语言迁移研究。研究者可直接加载‘text’字段作为原始输入进行零样本测试,或使用‘translation’字段评估模型在中文语境下的安全判别能力。通过比较‘score_zh_model’余弦相似度得分与真实标签,可量化模型对不安全内容的敏感度。此外,数据集还可用于微调中文安全检测模型,或作为基准测试集在跨语言场景下对比不同翻译工具和安全策略的效果。更详细的使用指南可参考相关论文(arxiv.org/abs/2604.25716)。
背景与挑战
背景概述
随着大语言模型在自然语言处理领域的广泛应用,其在多语言环境下生成有害内容的风险日益凸显,亟需构建覆盖跨语言场景的评估基准。由nvidia团队主导创建的benchmark-4-chinese-m2m数据集,于2025年发布,旨在应对中文环境下多语言内容安全评测的挑战。该数据集源自英文Aegis-AI-Content-Safety-Dataset-2.0,经facebook/m2m100_418M模型翻译为中文,包含1000条标注为安全与不安全的提示语,覆盖有害指令、敏感话题及对抗性改写等异质不安全类别。其核心研究问题在于探索跨语言迁移下的安全检测鲁棒性,为多语言AI系统的安全对齐提供了关键测试平台,对推动中文AI安全基准建设具有重要示范意义。
当前挑战
该数据集所解决的领域挑战聚焦于多语言内容安全评测的复杂性:传统相似性检测方法在应对异质化、非规范化越狱模板时性能下降,且跨语言环境进一步加剧了分布变异性,增加了安全机制的泛化难度。在构建过程中,面临翻译质量与语义保真度的平衡难题,自动机器翻译可能引入文化敏感度偏差或误译,影响标签准确性;同时,原始数据集的异质性类别需在中文语境下重新校准,以确保标签有效性。此外,规模与多样性之间的权衡(仅1000条样本)对评估统计意义构成制约,如何在小样本条件下实现可靠的跨语言安全模型评估,仍是亟需突破的核心瓶颈。
常用场景
经典使用场景
随着大语言模型在中文环境中的广泛应用,如何有效检测其输入内容的安全性成为关键挑战。该数据集基于NVIDIA的Aegis安全数据集,筛选出涵盖有害指令、敏感话题、对抗性改写等多种不安全类别的提示,并通过m2m100模型将其翻译为中文,构建了一个双语安全评测基准。其经典使用场景在于评估和提升中文内容安全检测模型的跨语言泛化能力,尤其适用于那些需要处理复杂、多样化不安全内容的场景,为模型在中文语境下的鲁棒性测试提供了标准化工具。
衍生相关工作
该数据集衍生了一系列相关经典工作,例如基于其双语特性开发的跨语言安全分类器,通过对比源语言与翻译后的安全得分差异来优化检测阈值。一些研究将其与Codebook嵌入结合,提出针对中文不安全提示的相似度匹配算法。此外,该数据集还被用于验证多语言安全大模型的防御能力,催生了诸如Adversarial Rephrasing in Chinese(中文对抗性改写)的专项数据集构建方法,以及面向低资源语种的安全检测增强策略,这些工作共同丰富了跨语言内容安全领域的实验体系与评估标准。
数据集最近研究
最新研究方向
随着多语言大模型在跨文化场景中的广泛应用,AI内容安全评测正面临从单一语言向多语言迁移的迫切需求。该数据集基于Aegis-AI-Content-Safety-Dataset-2.0进行了中文翻译与安全标签标注,聚焦于异质不安全类别(如有害指令、敏感话题与对抗性改写),并刻意规避典型越狱模板,从而提升检测难度。前沿研究利用该数据集评估跨语言语义迁移下相似度检测的鲁棒性,结合codebook嵌入与余弦相似度指标,为中文环境下多语言内容安全基准的构建提供了重要测试床,对推动低资源语言的安全对齐研究具有关键意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务