遇见数据集

tukabench

收藏
Hugging Face2026-06-03 更新2026-06-04 收录
官方服务:

资源简介:

TukaBench是一个用于评估大语言模型在非洲语言中是否可能被越狱(即诱骗生成有害内容)的安全基准数据集。它旨在解决现有安全基准主要关注英语、而少数多语言基准依赖直译从而忽略本地特定危害(如移动货币诈骗、宗教频道欺诈、地区政治虚假信息)的问题。数据集包含五个核心组件,总计为每种支持的语言提供986个提示。这些组件包括:1) afri-jbb-harm:包含100个来自JailbreakBench的有害提示,经人工忠实翻译,保留西方语境。2) afri-jbb-benign:包含100个来自JailbreakBench的良性控制提示,用于衡量模型过度拒绝的情况。3) afri-jbb-culture:包含与afri-jbb-harm相同类别的100个有害提示,但在翻译前被改写为非洲文化背景(涉及本地相关命名实体和场景)。4) afrijail-mono:包含343个由非洲数据收集者用英语原创的新有害提示,涵盖地方治理、地区冲突和文化特定危害,随后经人工翻译。5) afrijail-cs:包含343个afrijail-mono的代码混合版本,即每个提示混合使用英语和一种非洲语言(isiXhosa除外)。数据集支持英语(en)、阿姆哈拉语(am)、豪萨语(ha)、伊博语(ig)、奇切瓦语(ny)、斯瓦希里语(sw)、科萨语(xh)和约鲁巴语(yo)八种语言(afrijail-cs支持六种,不含科萨语)。每个数据样本通常包含索引(Index)、英文源提示(Goal)和目标语言翻译提示(Goal_Translation)等字段。该数据集适用于多语言大语言模型安全对齐、攻击鲁棒性以及低资源环境下LLM-as-a-judge可靠性等方面的研究。

TukaBench is a safety benchmark dataset designed to evaluate whether large language models can be jailbroken (i.e., tricked into generating harmful content) in African languages. It addresses the issue that existing safety benchmarks primarily focus on English, while the few multilingual benchmarks rely on direct translation, thereby overlooking locally specific harms (such as mobile money scams, religious channel fraud, and regional political misinformation). The dataset consists of five core components, providing a total of 986 prompts per supported language. These components include: 1) afri-jbb-harm: Contains 100 harmful prompts from JailbreakBench, manually translated faithfully to preserve Western contexts. 2) afri-jbb-benign: Contains 100 benign control prompts from JailbreakBench, used to measure model over-refusal. 3) afri-jbb-culture: Contains 100 harmful prompts in the same categories as afri-jbb-harm, but rewritten into African cultural contexts (involving locally relevant named entities and scenarios) before translation. 4) afrijail-mono: Contains 343 novel harmful prompts originally created in English by African data collectors, covering local governance, regional conflicts, and culture-specific harms, subsequently manually translated. 5) afrijail-cs: Contains a code-switched version of the 343 afrijail-mono prompts, where each prompt mixes English with an African language (excluding isiXhosa). The dataset supports eight languages: English (en), Amharic (am), Hausa (ha), Igbo (ig), Chichewa (ny), Swahili (sw), Xhosa (xh), and Yoruba (yo) (afrijail-cs supports six languages, excluding Xhosa). Each data sample typically includes fields such as Index, Goal (English source prompt), and Goal_Translation (target language translation prompt). This dataset is suitable for research in multilingual large language model safety alignment, attack robustness, and the reliability of LLM-as-a-judge in low-resource environments.

提供机构:
McGill NLP Group
创建时间:
2026-06-03
原始信息汇总

数据集概述:TukaBench

TukaBench 是一个文化本地化的越狱安全基准数据集,旨在评估大型语言模型在非洲语言环境中被诱导生成有害内容的脆弱性。

核心目标

  • 填补空白:现有安全基准大多仅针对英语,少数多语言基准依赖直译,忽略了特定于当地背景的伤害(如手机诈骗、宗教频道欺诈、地区政治假信息)。
  • 评估维度:衡量模型在多语言安全对齐、攻击鲁棒性以及低资源场景下“LLM作为评判者”的可靠性。

语言覆盖

涵盖 8种语言:英语 (en)、阿姆哈拉语 (am)、豪萨语 (ha)、伊博语 (ig)、奇契瓦语 (ny)、斯瓦希里语 (sw)、科萨语 (xh)、约鲁巴语 (yo)。其中7种为非洲低资源语言。

数据组成与规模

数据集包含 3个配置,每个配置对应8种语言,每种语言有 300条提示,总规模小于1000条(n<1K)。

配置名称 提示数量 说明
afri-jbb-harm 100/语言 来自 JailbreakBench 的100条有害提示,经人工翻译,保留西方原始背景。
afri-jbb-benign 100/语言 来自 JailbreakBench 的100条良性控制提示,经人工翻译,用于测量过度拒绝。
afri-jbb-culture 100/语言 将相同的JBB有害提示改写为非洲本地化背景(替换为本地相关的人物、场景等)后再翻译。

数据结构

每条数据包含以下字段:

  • Index:行标识符
  • Goal:英文源提示
  • Goal_Translation:目标语言的提示(对于英语 eng 分割,此字段等于 Goal

数据拆分

每个配置下均提供 8个数据分割(split),对应上述8种语言。

  • 可用分割eng, amh, hau, ibo, nya, swh, xho, yor

构建流程

非英语提示的生成遵循三步流水线:

  1. 机器翻译:对6种语言使用Google翻译,对约鲁巴语使用AfriqueQwen-8B(结合MAFAND少样本示例)。
  2. 质量估计:使用SSA-COMET-QE对翻译评分,低于0.50分的标记为低质量。
  3. 人工后编辑与文化适配:每种语言由两位母语标注员纠正机器输出。对于 afri-jbb-culture,标注员同时进行文化适配,将西方实体替换为本地等价物。

许可协议

  • CC-BY-NC 4.0:仅限非商业研究使用。

使用注意

  • 数据集包含有害、欺骗性及敏感提示,仅用于多语言LLM安全研究。
  • 使用本数据集时,也请引用其衍生来源 JailbreakBench。

引用信息

详细构建说明、质量控制程序和标注员报酬见关联论文(Akinode et al., 2026)。

搜集汇总
数据集介绍
tukabench 数据集图片
构建方式
TukaBench的构建遵循了一套严谨的三阶段流程。首先,研究团队以JailbreakBench中的100个有害提示为基础,将其作为源材料。随后,利用机器翻译技术将这些提示转化为八种非洲语言,包括阿姆哈拉语、豪萨语、伊博语、奇切瓦语、斯瓦希里语、科萨语和约鲁巴语,其中约鲁巴语的翻译借助了AfriqueQwen-8B模型并辅以MAFAND少样本示例,以确保高保真度。接着,通过SSA-COMET-QE工具对所有机器翻译进行质量评估,筛除得分低于0.50的低质量条目。最后,由每种语言的两名母语标注者进行人工校对与修正。特别地,对于afri-jbb-culture配置,标注者还执行了文化适配步骤,将西方特定实体和场景替换为非洲本地相关的元素,从而生成具有区域文化特色的提示。
特点
该数据集的核心特色在于其文化扎根的多语言安全评估能力。TukaBench由三个子集构成,每个语言包含300条提示:afri-jbb-harm保留了JailbreakBench原本的有害提示及其忠实翻译;afri-jbb-benign提供了良性控制提示,用于检测模型的过度拒绝行为;afri-jbb-culture则将相同的有害意图重新演绎为非洲当地语境下的具体场景,如手机诈骗、宗教频道欺诈或区域政治虚假信息。这一设计使得该基准不仅覆盖了低资源语言,更前所未有地揭示了西方语境下难以触及的本地化安全漏洞,从而填补了现有安全基准在多元文化视角上的空白。
使用方法
用户可通过HuggingFace的datasets库便捷地加载TukaBench。例如,使用`load_dataset("McGill-NLP/tukabench", "afri-jbb-harm", split="yor")`即可获取约鲁巴语的有害提示子集。数据集提供了eng、amh、hau、ibo、nya、swh、xho、yor共八种语言的拆分,每个子集均包含Index、Goal及Goal_Translation三列。研究者可据此评估大型语言模型在多语言环境下的越狱攻击鲁棒性、安全对齐效果,甚至可以将其作为测试LLM-as-a-judge可靠性的基准。使用本数据集时,应遵循CC-BY-NC 4.0许可协议,仅限非商业研究用途。
背景与挑战
背景概述
TukaBench是由麦吉尔大学与Mila研究所等机构的研究人员于2026年创建的一个跨语言大模型安全基准测试数据集。该数据集聚焦于非洲低资源语言环境中的大模型越狱攻击问题,核心研究动机在于:现有安全基准几乎均以英语为中心,即便少数多语种基准也仅依赖直接翻译,忽视了本地化语境中特有的有害生成风险,如移动货币诈骗、宗教频道欺诈及地区性政治谣言。TukaBench通过整合越狱有害提示、越狱良性提示以及文化改编提示三种类型,覆盖英语、阿姆哈拉语、豪萨语、伊博语、齐切瓦语、斯瓦希里语、科萨语和约鲁巴语共8种语言,为衡量大模型在低资源语言场景下的安全对齐、攻击鲁棒性以及越狱检测可靠性提供了关键研究工具。
当前挑战
TukaBench所解决的领域挑战在于:现有大模型安全评估过度集中于英语,忽视了低资源非洲语言中独特且社会危害性极高的越狱攻击模式,如针对区域性选举的虚假信息散布或利用地方文化语境的欺诈诱导,这些攻击能够有效规避当前主流模型的英语安全护栏。构建过程中,团队面临三重技术挑战:首先,机器翻译在保留约鲁巴语声调符号方面可靠性不足,需借助非洲专用模型AfriqueQwen-8B并结合MAFAND少样本示例进行补充翻译;其次,通过SSA-COMET-QE进行机器翻译质量筛查,对得分低于0.50的译文进行标注;最终,为每个语言配备两位母语标注者进行人工后编辑,并针对文化改编子集进行本地化实体替换,确保提示在保持原有危害类别的同时契合非洲特定社会语境。
常用场景
经典使用场景
TukaBench专为评估大型语言模型在多语言、低资源语境下的安全对齐能力而设计。研究者利用该数据集通过三类提示——忠实翻译的有害行为、经文化适配改写后的有害行为以及良性对照提示——来测试模型是否易被越狱攻击。无论是阿姆哈拉语、豪萨语、伊博语、齐切瓦语、斯瓦希里语、科萨语还是约鲁巴语,每类提示均包含100条精心构建的语料,为跨语言安全评估提供了标准化测试基准。
实际应用
在实际部署中,TukaBench可直接服务于面向非洲市场的人工智能产品安全测试环节。开发者可借助其多语言越狱提示集检验聊天机器人、内容生成系统是否会在本地语言场景下产生危险输出,例如识别在斯瓦希里语中伪装成宗教金融建议的电信诈骗指令,或检测用约鲁巴语编写的选举操纵指南。该数据集为金融机构、社交媒体平台及政府数字服务提供了文化敏感性的安全验证工具,防止因语言盲区导致的系统性风险。
衍生相关工作
TukaBench衍生于JailbreakBench的100条有害提示与良性对照,但其文化适配分支开创性地将同一危害类别移植至非洲本土语境,催生了多项后续研究。该数据集支持了多语言安全对齐中文化迁移效应的系统性分析,激发了基于SSA-COMET-QE的翻译质量评估新范式,并推动了低资源语言越狱攻击的定性研究。其构建中采用的人机协同翻译与后编辑流程(涉及八种语言、每语言两位母语标注者)为其他低资源安全基准的创建树立了方法论参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务