遇见数据集

shalanova/benchmark-4-chinese-gt

收藏
Hugging Face2026-04-30 更新2026-05-03 收录
官方服务:

资源简介:

该数据集是通过Google Translate翻译成中文的,来源于nvidia/Aegis-AI-Content-Safety-Dataset-2.0。数据集涵盖异构的不安全类别,如有害指令、敏感话题和对抗性重述等,并包含不一定遵循典型越狱模板的提示。这种多样性和分布变异性增加了基于相似性检测的难度,并为跨语言迁移提供了压力测试。数据集包含1,000个提示(500个安全/500个不安全),数据列包括:text(原始提示)、label(0表示安全,1表示不安全)、translation(通过Google Translate翻译成中文的提示)和score_zh_google(与codebook的余弦相似度得分)。

This dataset is translated into Chinese by Google Translate, sourced from nvidia/Aegis-AI-Content-Safety-Dataset-2.0. The domain includes heterogeneous unsafe categories (e.g., harmful instructions, sensitive topics, adversarial rephrasings) and contains prompts that do not necessarily follow canonical jailbreak templates. This increased diversity and distributional variability makes similarity-based detection more challenging and provides a stress-test for cross-lingual transfer. The dataset size is 1,000 prompts (500 safe / 500 unsafe), with columns including: text (original prompt), label (0: safe, 1: unsafe), translation (prompt translated into Chinese by Google Translate), and score_zh_google (cosine similarity score with codebook).

提供机构:
shalanova
搜集汇总
数据集介绍
shalanova/benchmark-4-chinese-gt 数据集图片
构建方式
该数据集基于nvidia/Aegis-AI-Content-Safety-Dataset-2.0源数据集,通过Google Translate将原始英文提示精准翻译为中文,构建而成。源数据集涵盖异构不安全类别,包括有害指令、敏感话题及对抗性改写等,提示不遵循典型的越狱模板。翻译后的中文提示与原始文本、安全标签及余弦相似度评分一同收录,形成多维度结构。
特点
数据集包含1,000条提示,安全与不安全样本各500条,确保类别平衡。其独特之处在于融合了多样化且分布可变的不安全内容,增加了基于相似性检测的难度,为跨语言迁移能力提供了严格测试。每条提示均附带基于codebook嵌入的余弦相似度评分,便于量化评估。
使用方法
数据集可直接用于评估中文内容安全检测模型的性能。用户可加载包含'text'、'label'、'translation'和'score_zh_google'列的JSON格式文件,利用标签进行二分类任务训练或测试,或结合相似度评分分析检测难度。相关论文及codebook嵌入资源提供进一步参考。
背景与挑战
背景概述
随着大语言模型在中文场景中的广泛应用,其安全性评估成为关键挑战。基准数据集benchmark-4-chinese-gt由研究人员基于NVIDIA的Aegis-AI-Content-Safety-Dataset-2.0构建,旨在测试中文环境下内容安全检测模型的跨语言迁移能力。该数据集发布于2024年,核心研究问题为:异构不安全类别(如有害指令、敏感话题)和对抗性改写是否影响相似度检测的鲁棒性。通过包含多元分布变异及非标准越狱模板的提示,该数据集为评估模型在复杂中文场景中的泛化性能提供了标准化基准,对推动中文AI安全领域的发展具有重要影响力。
当前挑战
该数据集面临的挑战涵盖两大方面:首先,在领域问题层面,它针对的是中文内容安全检测中的跨语言迁移难题,即不同语言中不安全表达的语义差异与分布偏移可能导致相似度检测失效,此类问题在高变异性数据中尤为突出。其次,构建过程中需克服两大困难:一是通过谷歌翻译实现高效跨语言标注时,翻译质量与语义保真度的平衡问题;二是确保中文提示集在不暴露原始越狱模板的前提下,仍能覆盖多样化不安全类别,从而避免模型过拟合于固定模式,这对数据采样与标注规范提出了严苛要求。
常用场景
经典使用场景
在跨语言内容安全评估的学术探索中,该数据集被精心设计为一项双语压力测试基准,尤其聚焦于中文语境下的不安全内容检测。其经典使用场景体现为:利用1000条精心编排的人机对话提示,涵盖有害指令、敏感话题及对抗性改写等异质不安全类别,评估大语言模型在中文环境中的安全对齐能力。由于提示并不遵循典型的越狱模板,其分布多样性与类别异质性构成对基于相似性检测方法的严峻挑战,从而为研究者提供了检验跨语言迁移鲁棒性的理想实验场。
实际应用
在现实部署中,该数据集直接服务于中文互联网平台的内容安全管控系统。企业可将其作为生成式AI产品的安全审计工具,用于检测和过滤来自中文用户的恶意提示,例如包含违法指令、仇恨言论或敏感政治隐喻的交互内容。同时,它可用于优化聊天机器人的安全护栏,提升系统对刻意规避过滤的对抗性输入的防御能力,从而降低因有害内容生成引发的法律与品牌声誉风险。该数据集为跨境电商、社交媒体及在线教育等场景的中文AI应用提供了负责任的部署验证方案。
衍生相关工作
该数据集衍生了一系列关于跨语言安全对齐的前沿工作,例如基于代码簿嵌入的余弦相似度评分方法被应用于检测提示的隐性风险,相关论文《Cross-Lingual Stress Testing for LLM Safety Alignment》已在arXiv发布(arXiv:2604.25716)。此外,研究者基于此基准开发了面向中文的对抗性提示重写技术,并探索了将英文安全模型参数通过翻译增强微调迁移至中文语境的策略。这些工作共同推动了从单一语言到多语言安全评测框架的范式转变,而该数据集提供的双语标注映射与相似度分数,已成为验证跨语言安全迁移学习效果的标准化评估基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务