遇见数据集

TukaBench

收藏
arXiv2026-06-01 更新2026-06-03 收录
官方服务:

资源简介:

TukaBench是由Mila - 魁北克人工智能研究所、麦吉尔大学和微软人工智能公益研究实验室联合创建的针对七种非洲语言的越狱评估基准,旨在填补大语言模型安全评估在低资源语言领域的空白。该数据集包含986条提示词,涵盖阿姆哈拉语、豪萨语、伊博语等七种语言,通过人工翻译、文化适应和代码转换四种策略构建,数据来源于JailbreakBench的扩展和本地化创作。其创建过程采用机器翻译与人工后编辑相结合的三阶段流程,确保语言准确性和文化相关性,主要应用于评估大语言模型在非洲语言环境下的安全漏洞,解决因文化背景和语言资源不足导致的模型安全机制失效问题。

TukaBench is a jailbreak evaluation benchmark jointly developed by Mila - Quebec AI Institute, McGill University, and Microsoft AI for Good Research Lab, designed to fill the critical gap in large language model (LLM) safety assessment for low-resource African language domains. This dataset comprises 986 prompts across seven languages including Amharic, Hausa, Igbo and others, constructed via four strategies including manual translation, cultural adaptation and code-switching, with its corpus derived from the expansion and localization of the JailbreakBench dataset. The development of TukaBench follows a three-stage workflow integrating machine translation and human post-editing, ensuring both linguistic accuracy and cultural appropriateness. This benchmark is primarily utilized to assess the safety vulnerabilities of LLMs in African language contexts, addressing the failure of model safety mechanisms caused by insufficient cultural background and limited language resources.

创建时间:
2026-06-01
原始信息汇总

数据集概述

  • 数据集名称:Tukabench
  • 所属机构:McGill-NLP(麦吉尔大学自然语言处理实验室)
  • 共享平台:Hugging Face Datasets
  • 访问地址:https://huggingface.co/datasets/McGill-NLP/tukabench
  • 许可证类型:Apache-2.0

该数据集以 Apache-2.0 许可证开放使用,允许用户自由使用、修改和分发,但需保留版权声明和免责声明。当前页面提供的 README 内容仅包含许可证信息,未提供数据集的详细描述、任务类型、数据规模或具体用途说明。如需获取更完整的数据集信息,建议直接访问数据集页面或参考相关研究文献。

搜集汇总
数据集介绍
TukaBench 数据集图片
构建方式
TukaBench的构建基于五个互补的提示集,旨在隔离语言、文化背景和代码混合对LLM安全行为的影响。提示集源自JailbreakBench(JBB)和新创作的非洲背景提示(AfriJail),涵盖直接翻译、文化适应和代码混合三种策略。所有英文提示首先通过机器翻译(Google Translate或AfriqueQwen-8B)生成目标语言版本,再由母语者进行人工后编辑和错误修正,确保翻译的准确性和文化本地化。对于代码混合变体,则利用AfriqueQwen-8B模型生成后经人工审核,形成自然的多语言混合提示。该流程覆盖阿姆哈拉语、豪萨语、伊博语、奇契瓦语、斯瓦希里语、约鲁巴语和科萨语七种非洲语言,共计每语言986个提示。
特点
TukaBench的核心特点在于其多维度的评估框架,能够同时考察语言资源水平、文化适应性和代码混合对模型安全性的影响。数据集不仅包含直接翻译的JBB提示作为基线,还创新性地引入了文化适应提示(如将西方语境中的实体替换为非洲本地实体)和非洲作者自创提示,覆盖当地治理、冲突动态等本土化危害场景。此外,代码混合提示模拟了非洲多语言社区的真实语言使用模式。评估中引入“偏转”(Deflection)作为第三类响应标签,区分模型因理解失败而非安全拒绝导致的非目标输出,从而更精确地衡量模型在低资源语言中的安全行为。
使用方法
TukaBench可用于评估和比较多种大语言模型(如GPT-4o、GPT-5.2、Llama-4-Maverick等)在非洲语言环境下的安全对齐表现。使用时,研究人员可直接将数据集中的提示输入模型,收集响应后利用GPT-4.1作为评判器,根据预设的“越狱成功”、“拒绝”和“偏转”三类标签对响应进行分类。为验证评判器的可靠性,建议在代表性子集上辅以人工标注。数据集支持直接提示和边界点越狱(BPJ)两种攻击设置,前者评估基线安全行为,后者通过字符级噪声扰动增强攻击效果,以全面揭示模型在语言、文化和对抗条件下的脆弱性。
背景与挑战
背景概述
大语言模型的安全评估长期以英语为中心,而低资源语言,尤其是非洲语言的脆弱性几乎未被触及。TUKABENCH由Mila-魁北克人工智能研究所、麦吉尔大学和微软AI for Good研究实验室的研究人员于2026年创建,旨在填补这一空白。该数据集围绕七种非洲语言构建,通过翻译、文化改编、代码混合四种策略,系统性地分离语言、文化语境和提示隐蔽性对模型安全行为的影响,揭示了文化适应性提示能最大程度降低模型拒绝率这一关键发现,为多语言安全评估开辟了全新视野。
当前挑战
该数据集直面两大核心挑战:其一,当前安全评估范式在低资源语言中遭遇结构性障碍——模型自身理解能力不足,以及LLM作为评判者的可靠性急剧下降,导致攻击成功率等单一指标严重失真。其二,数据集构建过程中的挑战在于如何在保留原始危害意图的同时,将西方语境自然转化为真实的非洲场景,并通过人工后期编辑和质控流程确保翻译质量。此外,引入偏转作为第三标签以区分安全行为与理解失败,使得评估体系更为精确但成本大幅攀升。
常用场景
经典使用场景
TukaBench最经典的使用场景是评估大型语言模型在低资源非洲语言环境下的安全鲁棒性,尤其聚焦于越狱攻击的防御能力。研究者通过该基准测试集,在七种非洲语言(如阿姆哈拉语、豪萨语、约鲁巴语)中,对比直接翻译、文化适配、代码切换等多种提示策略对模型拒绝或顺从有害请求的影响,从而系统性地衡量语言资源丰富度、文化背景嵌入程度以及提示隐蔽性对模型安全行为的调控作用。
实际应用
在实际应用中,TukaBench可被用于检测和加固面向非洲用户的大语言模型部署安全性,例如在尼日利亚、肯尼亚、南非等国的客服聊天机器人、政府信息服务平台或教育辅助系统中,提前识别模型是否会被以本地语言精心包装的欺诈、暴力或虚假信息提示突破防护。训练部署团队可依据该基准的评估结果,调整模型的拒绝策略阈值、优化低资源语言的词表切分效率,并开发针对文化特定有害场景的防御模块,从而有效降低实际部署环境下因语言漏洞引发的伦理与安全风险。
衍生相关工作
TukaBench的提出催生了一系列衍生工作,包括针对更多非洲极端低资源语言的越狱基准扩展研究、基于该基准的防御机制消融分析、以及将偏转标签纳入多语言安全评测框架的方法探索。后续研究者借鉴其文化适配与代码切换构造思路,进一步开发了如UbuntuGuard等政策导向的文化安全基准,并推动了大语言模型在非洲本地语言中安全对齐训练数据的建设。这些衍生工作共同形成了一个关注语言多样性与文化敏感性的新兴研究分支,促进了全球范围内更公平、更安全的语言模型生态构建。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务