遇见数据集

MarkrAI/ko-jailbreak

收藏
Hugging Face2026-07-08 更新2026-07-22 收录
官方服务:

资源简介:

ko-jailbreak是一个韩国语jailbreak(越狱)评估基准数据集,它整合了多个公开的英语jailbreak基准,并将其翻译和精炼成韩语,同时去除了源之间的重复项,形成了一个统一的评估工具。该数据集旨在测量韩国语大型语言模型(LLM)和安全防护措施对实际jailbreak攻击的鲁棒性。它包含两个主要部分:behavior(模型应拒绝的有害请求本身,共10,303个)和template(用于包装有害请求以绕过安全防护的包装器,如DAN等,共1,138个),总规模为11,441个条目。数据集基于允许重新分发的许可证(如MIT/Apache-2.0)从多个来源(如SALAD-Bench、HarmBench等)收集,并经过翻译、质量过滤和去重处理。它主要用于红队测试和安全评估,以帮助提高LLM的安全性。

ko-jailbreak is a Korean jailbreak evaluation benchmark that integrates multiple public English jailbreak benchmarks, translating and refining them into Korean while removing duplicates across sources to form a unified evaluation tool. It is designed to measure the robustness of Korean large language models (LLMs) and safety guards against actual jailbreak attacks. The dataset consists of two axes: behavior (the harmful requests that models should reject, totaling 10,303 entries) and template (wrappers like DAN that bypass safety guards by enclosing harmful requests, totaling 1,138 entries), with an overall size of 11,441 entries. It is collected from sources with redistribution-permissive licenses (e.g., MIT/Apache-2.0), such as SALAD-Bench and HarmBench, and undergoes translation, quality filtering, and deduplication. It is intended for red-teaming and safety evaluation purposes to enhance LLM security.

提供机构:
MarkrAI
搜集汇总
数据集介绍
MarkrAI/ko-jailbreak 数据集图片
构建方式
该数据集的构建始于对已公开的英文越狱基准进行系统性筛选,仅纳入采用MIT或Apache-2.0许可、允许再分发的源数据。随后,利用nayohan/llama3-instrucTrans-enko-8b模型将筛选后的行为请求与模板翻译为韩语,并借助gpt-oss-120b模型对翻译质量进行多维度审核,确保语义忠实度、有害意图保留度、语法正确性与自然流畅性,未通过者则重新翻译。最后,在英文原文层面,分别对行为与模板两个子集进行精确匹配与基于multilingual-e5嵌入的语义去重,依据来源优先级确定主来源,并将合并的其他来源记录于also_in字段,使原始33,680条数据精简为11,441条高质量样本。
特点
该数据集的核心在于其双轴结构,同时涵盖模型应拒绝的有害请求(behavior,10,303条)与旨在绕过安全机制的越狱模板(template,1,138条),从而能够独立评估模型对有害内容的拒斥能力与对攻击性提示词的脆弱性。数据来源涵盖SALAD-Bench、HarmBench、StrongREJECT等七个知名英文基准,经翻译与去重后整合为统一的韩语评测集,填补了韩语大模型安全评估领域基准资源的空白。所有样本均附带唯一ID、韩语提示词、英文原文、类型标注、所属类别、来源及合并来源信息,便于溯源与可重复研究。
使用方法
用户可通过HuggingFace Datasets库直接加载该数据集,调用load_dataset('MarkrAI/ko-jailbreak', split='test')即可获取全部11,441条韩语测试样本。使用过程中,应当以模型的韩语回答为对象,采用预设的安全判别器(推荐使用配套的K-SafeGuard模型)对每条提示词的响应进行合规性判定,若模型遵从了有害请求,则视为越狱成功。攻击成功率越低,表明模型的安全对齐越稳健。数据集仅限红队测试与安全研究用途,严禁用于实际有害行为,且引用时需同时注明本数据集及其各原始来源的文献信息。
背景与挑战
背景概述
随着大型语言模型(LLM)在韩国语服务中的广泛应用,确保模型面对恶意攻击时的安全性已成为关键研究议题。由Marker Inc. Korea团队于2024年创建的ko-jailbreak数据集,旨在系统性评估韩国语LLM对越狱攻击的防御能力。该数据集将多个公开的英文越狱基准(如HarmBench、SALAD-Bench等)翻译、精炼并去重整合,最终构建涵盖11,441条样本的统一评测框架。其核心创新在于首次为韩国语LLM安全研究提供了标准化、可复现的评测工具,弥补了非英语环境下越狱评估资源的匮乏,对推动多语言AI安全对齐研究具有里程碑意义。
当前挑战
构建ko-jailbreak面临三重核心挑战。首先,越狱测评需解决模型对有害请求的拒斥能力与对抗性提示规避安全机制之间的矛盾,即需同时衡量“有害请求本身”与“包裹攻击模板的提示”两类场景。其次,数据构建过程中,需从多个许可协议中筛选可再发布源,并确保翻译后的韩国语提示在语义保真度与恶意意图一致性上达标,这要求精细的自动化质检与人工复核。最后,跨源去重需兼顾精确匹配与语义相似性,以避免评测偏差,同时保留原始源归属信息以支持溯源分析。
常用场景
经典使用场景
在大规模语言模型安全评估领域,ko-jailbreak作为一个专门为韩语环境设计的越狱攻击基准测试集,其经典使用场景在于量化评估韩语大模型及安全防护机制对恶意提示的抵御能力。该数据集巧妙融合了“行为”与“模板”两大核心维度:前者包含模型本应拒绝回应的直接有害请求,后者则涵盖用以绕过安全护栏的包裹式越狱策略(如DAN角色扮演等)。通过系统性地测量模型在面对这两类攻击时的顺从率(即攻击成功率),研究者得以精准刻画不同韩语模型的鲁棒性边界,为模型安全对齐工作提供关键的定量基准。
解决学术问题
ko-jailbreak的出现有效填补了韩语大语言模型安全评估领域缺乏标准化、公开可用越狱基准的空白。它解决了学术界面对的几个核心难题:一是现有英文越狱数据集无法直接应用于韩语环境,语言差异导致攻击效果失真;二是缺乏统一框架来分离评估模型对有害内容本身的抵御能力与对越狱包装的敏感度;三是不同开源数据集间存在的重复与许可限制问题。该基准通过系统性的翻译、质量筛选与语义去重,将三十余万个原始提示精炼为一万余个高质量韩语越狱样本,为韩语AI安全研究提供了可信赖的评估基石,显著推动了多语言模型安全对齐理论的发展。
衍生相关工作
该数据集的构建催生了一系列卓有成效的相关工作。其中最为瞩目的是K-SafeGuard——一个专为韩语环境训练的安全审核分类器,被直接用作该基准的默认评判模型,形成了从评估数据到评判模型的闭环生态系统。与之互补的K-OverRefusal基准则聚焦于韩语大模型的过度拒绝现象,即模型对无害请求的不当拒答,与ko-jailbreak共同构建了模型安全性评估的完整光谱。此外,该基准的翻译与去重方法论为其他语种(如日语、中文)安全基准的构建提供了可复现的技术范式,促进了多语言AI安全评估基础设施的协同发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务