遇见数据集

shalanova/benchmark-4-russian-gt

收藏
Hugging Face2026-04-30 更新2026-05-03 收录
官方服务:

资源简介:

该数据集是通过Google Translate翻译成俄语的,来源于nvidia/Aegis-AI-Content-Safety-Dataset-2.0。数据集领域包括异质不安全类别(如有害指令、敏感话题、对抗性重述),并包含不一定遵循典型越狱模板的提示。这种增加的多样性和分布变异性使得基于相似性的检测更具挑战性,并为跨语言迁移提供了压力测试。数据集大小为1,000个提示(500个安全/500个不安全)。列包括:text(原始提示)、label(0:安全,1:不安全)、translation(通过Google Translate翻译成俄语的提示)和score_ru_google(与codebook的余弦相似度得分)。

The dataset is translated into Russian by Google Translate, sourced from nvidia/Aegis-AI-Content-Safety-Dataset-2.0. The domain includes heterogeneous unsafe categories (e.g., harmful instructions, sensitive topics, adversarial rephrasings) and contains prompts that do not necessarily follow canonical jailbreak templates. This increased diversity and distributional variability makes similarity-based detection more challenging and provides a stress-test for cross-lingual transfer. The dataset size is 1,000 prompts (500 safe / 500 unsafe). Columns include: text (original prompt), label (0: safe, 1: unsafe), translation (prompt translated into Russian by Google Translate), and score_ru_google (cosine similarity score with codebook).

提供机构:
shalanova
搜集汇总
数据集介绍
shalanova/benchmark-4-russian-gt 数据集图片
构建方式
本数据集源自NVIDIA发布的Aegis-AI-Content-Safety-Dataset-2.0,通过Google Translate工具将其原始英文提示词翻译为俄语,构建了面向俄语场景的内容安全评估基准。数据集精心挑选了1,000条提示词,其中安全与不安全样本各占500条,覆盖有害指令、敏感话题、对抗性改写等多种异质不安全类别,突破了传统越狱模板的局限。每条样本保留了原始提示文本(text)、安全标签(label:0为安全,1为不安全)、俄语翻译(translation)以及基于预编码本计算出的余弦相似度评分(score_ru_google),为跨语言安全检测研究提供了结构化参考。
特点
数据集的核心特色在于其异质性与跨语言迁移测试能力。不安全类别涵盖多种语义攻击形式(如有害指令、敏感话题、对抗性改写),使得基于相似度的检测方法面临更大挑战,从而有效评估模型在不同分布下的鲁棒性。通过引入俄语翻译版本,数据集模拟了真实世界多语言内容安全场景,为探索从英语到俄语的零样本或弱监督跨语言安全检测提供了压力测试平台。同时,内置的余弦相似度评分便于研究者量化跨语言语义一致性。
使用方法
该数据集适用于俄语内容安全分类模型的训练与评估,以及跨语言安全检测方法的验证。研究者可直接利用text和label字段训练二分类模型,或将translation字段用于评估机器翻译质量对安全检测的影响。score_ru_google字段可用于分析嵌入空间中的跨语言对齐效果,配合预编码本可辅助设计基于相似度的安全过滤器。建议在实验中对比原始英语数据集与俄语翻译数据的性能差异,以揭示跨语言泛化瓶颈。
背景与挑战
背景概述
在大语言模型安全对齐领域,跨语言内容安全评估正成为关键研究议题,尤其在非英语语境下,模型对有害内容的识别能力仍面临显著短板。benchmark-4-russian-gt数据集由研究团队于近年创建,基于英伟达的Aegis-AI-Content-Safety-Dataset-2.0源数据集,通过Google翻译工具将其转化为俄语版本,专注于评估模型在俄语场景下的内容安全检测性能。核心研究问题涉及跨语言迁移中安全分类器的鲁棒性,以及机器翻译对原始语义和风险标签的保真度影响。该数据集包含1000条经过精心筛选的提示,涵盖各类不安全类别如有害指令、敏感话题及对抗性改写,旨在为俄语安全对齐研究提供标准化的测试基准,对多语言AI安全领域具有重要推动价值。
当前挑战
数据集面临的首要挑战来源于所解决的领域核心问题:跨语言内容安全检测中的分布差异与迁移困难。源数据集原本包含高度异构的不安全类别和非规范越狱模板,经机器翻译后,语义与语用特征可能发生扭曲,使基于相似性的检测方法难以有效泛化,对跨语言迁移构成压力测试。构建过程中的挑战同样突出,采用Google Translate进行单一机器翻译策略,可能引入翻译误差与文化语境的不匹配,导致标签准确性受损。此外,仅1000条样本规模限制了数据集对俄语复杂安全场景的代表性,难以全面覆盖真实世界中的方言、俚语及新兴有害模式,影响评估的可靠性与泛化能力。
常用场景
经典使用场景
在自然语言处理与人工智能安全领域,跨语言内容安全检测是极具挑战的前沿方向。该数据集专为俄语场景设计,由1000条精心标注的提示语构成,其中安全与不安全样本各占半数。其核心价值在于作为评估和比较不同模型、算法在俄语环境下检测有害内容能力的标准基准,尤其适用于测试基于相似性的检测方法在应对多样化、非规范对抗性重述时的表现。研究者可借此深入分析多语种安全机制的鲁棒性。
解决学术问题
该数据集直面当前学术研究中多语言安全对齐的痛点,解决了跨语言威胁检测评估基准匮乏的关键问题。传统数据集多聚焦英语,导致俄语等语种的模型安全评估缺乏可靠参照。本研究通过引入异质性不安全类别和分布变异,显著提升了检测难度,为检验跨语言迁移学习的效果提供了严苛的测试场。这推动了多语种内容安全理论从单一语言向多元生态的拓展,对构建通用化安全评估框架具有里程碑式意义。
衍生相关工作
基于此基准,学术界已涌现出多项衍生工作。其底层Aegis数据集的安全分类体系可直接迁移至俄语分析,而配套的codebook嵌入余弦相似度方法催生了一批研究,探索如何利用小样本跨语言种子集实现零样本安全检测。同时,该数据集为多语种对抗样本生成领域提供了新标尺,激发了结合机器翻译与语义保留的对抗性重述生成工作,进而推动了跨语言安全防御策略的演化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务