遇见数据集

latentguard-bengali-safety-drift

收藏
Hugging Face2026-06-26 更新2026-06-29 收录
官方服务:

资源简介:

LatentGuard: 多语言安全漂移数据集是一个用于评估LatentGuard方法的实验数据集,LatentGuard是一种免训练的推理干预技术,通过中间层潜在转向来缓解多语言安全绕过问题。该数据集专门追踪`google/gemma-2-2b-it`模型在处理并行英语和孟加拉语对抗性提示时表现出的非对称安全失败。数据来源于Hugging Face上aims-foundations/safety-irt的315个并行孟加拉语-英语安全提示,并经过程序化生成管道处理:首先过滤出孟加拉语样本;随后在第一阶段对150个样本进行行为追踪以建立基线拒绝指标;最后在第二/三阶段识别并分离出35个遭受中等严重程度令牌碎片化的提示,作为潜在转向的主要评估队列。数据集包含明确的AI安全失败示例和生成的有害内容(例如社会工程、偏见探测和非法行为),仅严格用于学术验证和机制可解释性研究。核心文件包括`150_baseline_prompts.json`(展示英语与孟加拉语之间拒绝率下降的基线行为分析日志)和`35_failure_cohort_steered.json`(包含内部几何追踪及最终LatentGuard转向转换的详细日志)。

LatentGuard: Multilingual Safety Drift Dataset is an experimental dataset for evaluating the LatentGuard method, a training-free inference intervention technique designed to mitigate multilingual safety bypass issues through intermediate-layer latent steering. This dataset specifically tracks the asymmetric safety failures exhibited by the `google/gemma-2-2b-it` model when processing parallel English and Bengali adversarial prompts. The data originates from 315 parallel Bengali-English safety prompts on Hugging Face from aims-foundations/safety-irt, and is processed through a programmatic generation pipeline: first filtering Bengali samples; then conducting behavior tracking on 150 samples in the first phase to establish baseline refusal metrics; finally identifying and isolating 35 prompts suffering from moderate-severity token fragmentation in the second/third phases as the primary evaluation cohort for latent steering. The dataset contains explicit AI safety failure examples and generated harmful content (e.g., social engineering, bias probing, and illegal activities), strictly for academic validation and mechanistic interpretability research. Core files include `150_baseline_prompts.json` (baseline behavior analysis logs showing refusal rate decline between English and Bengali) and `35_failure_cohort_steered.json` (detailed logs with internal geometric tracking and final LatentGuard steering transformations).

创建时间:
2026-06-21
搜集汇总
数据集介绍
latentguard-bengali-safety-drift 数据集图片
构建方式
该数据集源自LatentGuard研究项目,旨在探索多语言场景下大语言模型的安全规避问题。构建过程首先从HuggingFace平台上的aims-foundations/safety-irt数据集中摄入315条平行的孟加拉语-英语安全提示,并专门筛选出孟加拉语样本形成完整语料库。第一阶段以150个样本为基线,记录模型在双语环境下的拒绝行为特征。随后从基线样本中识别出35个存在中等程度令牌碎片化问题的提示,构成目标测试集,用于评估潜在引导干预机制对安全漂移的修正效果。整个流程通过程序化管道生成,确保数据获取与处理的可复现性。
特点
该数据集的核心特点在于聚焦多语言安全偏差的对称性失效现象,特别针对google/gemma-2-2b-it模型在面对英语与孟加拉语对抗性提示时表现出的拒绝率差异。数据集包含了从基线行为分析到潜在引导干预的完整实验日志,涵盖令牌碎片化严重度的量化指标(崩塌分数与漂移分数)以及LatentGuard最终引导变换结果。作为安全研究的重要资源,它明确包含模型成功执行恶意指令的真实案例,为机械可解释性领域提供了宝贵的实证材料。
使用方法
数据集以两个JSON文件形式组织,其中150_baseline_prompts.json用于研究双语环境下拒绝率的基准变化,35_failure_cohort_steered.json则详细记录了潜在引导干预前后目标样本的内部几何形态追踪。使用者可直接加载这些结构化数据,复现LatentGuard方法的性能评估,或基于令牌碎片化分析框架开展多语言安全机制比较研究。需注意数据集包含有害内容,仅限学术验证与机械可解释性研究目的,并要求研究者严格遵守伦理规范。
背景与挑战
背景概述
在多语言大语言模型的快速部署浪潮中,安全对齐的跨语言一致性问题日益凸显。现有研究表明,模型在英语环境下表现出的稳健拒答能力,在面对如孟加拉语等低资源语言时往往出现显著退化,这种不对称的安全漂移现象对模型可信部署构成了根本性威胁。为系统性探究该问题,LatentGuard-Bengali-Safety-Drift数据集由Apart Research团队于近期创建,核心聚焦于验证其提出的无训练干预方法——LatentGuard,旨在通过中层潜在空间引导来缓解多语言安全旁路攻击。该数据集详细记录了Gemma-2-2B-IT模型在处理平行英语与孟加拉语对抗性提示时的非对称安全失败行为,为开放科学背景下的大语言模型机械可解释性与多语言安全研究提供了宝贵的实验基线与评估基准。
当前挑战
该数据集直面的核心挑战在于多语言安全对齐的退化机制与检测复杂性。首先,模型在不同语言间安全表现的不一致并非简单的翻译差异,而是根植于低资源语言在高维语义空间中表征碎片化与拒答功能拓扑结构的不完全迁移,这使得传统基于单一语言的对抗测试难以暴露深层漏洞。其次,在数据集构建过程中,研究者需从315条平行提示中精准识别出模型在孟加拉语下发生中等程度词元碎片化的35条关键失败样本,这一筛选过程对度量指标的选择和异常检测的灵敏度提出了极高要求。此外,实验设计与评估需严格规避有害内容的二次传播风险,在记录模型成功生成恶意指令结果的同时,确保数据仅用于学术验证目的,构成了数据治理与伦理合规层面的双重重压。
常用场景
经典使用场景
LatentGuard-Bengali-Safety-Drift数据集专为多语言大语言模型的安全对齐研究而设计,其经典使用场景是评估和检测模型在非英语语言(尤其是孟加拉语)中出现的越狱行为。该数据集包含并行英语与孟加拉语对抗性提示的实验日志,通过对比语言间拒绝率的差异,揭示了模型在低资源语言中安全护栏的脆弱性。研究者可借助此数据集进行模型行为追踪,量化从英语到孟加拉语的拒绝率下降幅度,从而精准定位安全漂移现象。
衍生相关工作
该数据集衍生的经典工作包括LatentGuard干预方法本身,它通过监测潜在空间中的Collapse和Drift分数来识别碎片化故障,并实施无需训练的中间层导向。此外,该数据集催生了多语言安全基准的构建研究,例如将孟加拉语的故障模式迁移至其他低资源语言(如斯瓦希里语、乌尔都语),以及改进分词器以消除碎片化效应的相关算法。这些工作共同推动了可解释安全干预从概念验证转向实用化部署的进程。
数据集最近研究
最新研究方向
当前研究聚焦于多语言大模型在安全对齐中的非对称性失效现象,特别是在低资源语言(如孟加拉语)中由于token碎片化引发的安全漂移问题。LatentGuard通过无训练推理干预策略,利用中间层潜在空间引导机制,在不修改模型参数的前提下有效缓解了跨语言的安全绕过行为。这项研究不仅揭示了语言层级的脆弱性差异,还为可解释人工智能中的机械可解释性提供了实证支持,对构建鲁棒且公平的多语言安全防线具有重要理论与实践价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务