遇见数据集

ko-jailbreak

收藏
github2026-07-08 更新2026-07-17 收录
官方服务:

资源简介:

ko-jailbreak是一个用于评估韩国大型语言模型(LLMs)越狱漏洞的基准数据集。它通过翻译和整合多个公开的英语越狱基准,并去除重复项,创建了一个统一的韩语越狱评估基准。数据集包含11,441个条目,分为behavior(有害请求本身)和template(用于绕过安全防护的包装器)两类,旨在测量韩语LLMs和安全防护在实际越狱攻击中的鲁棒性。

ko-jailbreak is a benchmark dataset for evaluating jailbreak vulnerabilities of Korean large language models (LLMs). It develops a unified Korean jailbreak evaluation benchmark by translating and integrating multiple publicly available English jailbreak benchmarks and removing duplicate entries. The dataset contains 11,441 entries, categorized into two groups: behavior (the harmful request itself) and template (the wrapper used to bypass security defenses), aiming to measure the robustness of Korean LLMs and security defenses against real-world jailbreak attacks.

创建时间:
2026-07-06
原始信息汇总

数据集概述:ko-jailbreak

基本信息

  • 数据集名称:ko-jailbreak
  • 任务类型:韩语大语言模型(LLM)越狱攻击鲁棒性评估
  • 语言:韩语
  • 样本总数:11,441 条
  • 许可证:各源数据集许可证均为 MIT 或 Apache-2.0,数据继承源许可证;代码为 MIT

数据集构成

数据集分为两种类型,分别衡量模型的“拒绝有害请求”能力和“被越狱包装绕过”的能力:

类型 (kind) 含义 数量
behavior 模型应拒绝的有害请求本身 10,303
template 包裹有害请求以绕过安全机制的包装(如 DAN 等) 1,138

数据来源与数量(去重后)

源数据集 类型 数量 许可证
SALAD-Bench behavior 9,538 Apache-2.0
HarmBench behavior 297 MIT
StrongREJECT behavior 182 MIT
UltraSafety behavior 134 MIT
JailbreakBench behavior 101 MIT
AdvBench behavior 51 MIT
In-The-Wild (DAN) template 1,000 MIT
LatentJailbreak template 137 MIT
GPTFuzzer template 1 MIT

数据格式(JSONL)

每条记录包含以下字段:

字段 说明
prompt_ko 韩语输入(评估时使用)
prompt_en 原始英文文本
kind behaviortemplate
category 源数据的原始类别(如有)
source 规范的原始来源
also_in 因去重而合并的其他来源
source_license 原始数据集的许可证

去重与整合方法

  1. 按行为(behavior)和模板(template)分池分别去重。
  2. 标准化拼写、空格、标点后进行精确匹配去重。
  3. 使用 multilingual-e5 嵌入的余弦相似度进行语义去重(behavior 阈值 0.92,template 阈值 0.97)。
  4. 保留来源优先级(HarmBench > JailbreakBench > AdvBench > StrongREJECT > SALAD > UltraSafety 等),合并来源记录在 also_in 字段。

去重结果:原始 33,680 条压缩至 11,441 条,其中 behavior 从 29,917 条减至 10,303 条,template 从 3,763 条减至 1,138 条。

评估方法

  • 使用目标韩语 LLM 对 prompts 进行推理,生成响应。
  • 使用评判模型(如 GPT-oss-safeguard 或 K-SafeGuard)将响应分类为:拒绝(refusal)、回避(deflection)、服从(compliance)。
  • 攻击成功率(ASR)即服从率,越低表示模型越安全。
  • 评估结果按类型(behavior/template)和来源分别报告。

使用注意事项

  • 本数据集仅用于红队测试和安全评估目的。
  • 包含有害内容,使用时应遵守相关规定。
  • 原始数据集中带有非商业(NC)或再分发限制的(如 SORRY-Bench、HEx-PHI、BeaverTails、ALERT、Do-Not-Answer 等)已被有意排除。

相关项目

  • K-SafeGuard:韩语安全审核模型,可用作 ko-jailbreak 的评判器。

许可证详情

  • 代码(流水线、评估):MIT
  • 数据:继承各自源数据集的许可证(全部为 MIT 或 Apache-2.0),并遵守署名条件。详细说明见 ATTRIBUTION.md
搜集汇总
数据集介绍
ko-jailbreak 数据集图片
构建方式
在当前大型语言模型(LLM)安全研究领域,大部分越狱(jailbreak)评测基准均以英文为主导,而针对韩语环境的标准化评估资源却极为匮乏。为了填补这一空白,ko-jailbreak数据集应运而生。该数据集并非提出新的攻击方法,而是严格筛选并整合了多个已公开、且明确允许再分发的英文越狱基准(如SALAD-Bench、HarmBench、StrongREJECT等)。其构建流程包括:将选定的英文数据翻译成韩语并精心质控,再基于原始英文文本进行源间去重处理。去重过程分为行为(behavior)和模板(template)两个独立池,先实施归一化后的精确匹配去重,再借助多语言嵌入模型进行语义相似度去重(行为阈值0.92,模板阈值0.97),最终将庞大的33,680条候选精简为11,441条高质量且无冗余的韩语越狱评测样本,并妥善保留了每条数据的源出处信息。
特点
ko-jailbreak数据集的核心特色体现在其结构化与双重评测能力上。它巧妙地将越狱攻击拆解为两大维度:一是模型应直接拒绝的有害请求(behavior,10,303条),二是包裹有害请求以绕过安全防护的模板指令(template,1,138条),从而能够分别测量韩语大语言模型对有害内容的拒答能力以及对越狱包装的鲁棒性。数据集源自7个享有盛誉的英文基准,所有来源均采用MIT或Apache-2.0等宽松许可证,确保了数据的合法再分发与使用。每条样本不仅包含韩语提示词和对应的英文原词,还提供了类别、源出处及合并来源等元信息,极大便利了细致分析。其严谨的去重机制不仅消除了数据冗余,更证明了少数经典样本在众多基准中的重复出现现象,提升了评测的纯净度与科学性。
使用方法
使用ko-jailbreak数据集进行评测的方法直观而高效。用户首先需针对目标韩语大语言模型,利用数据集中提供的韩语提示词(prompt_ko)进行推理,生成相应的响应。随后,采用专门的安全评估器(如GPT-Oss-Safeguard或K-SafeGuard)对这些响应进行自动化评判,将其分类为明确拒绝(refusal)、回避回答(deflection)或遵从有害请求(compliance)。最终的计算指标为攻击成功率(ASR),即模型被诱导遵从的比例,该值越低表示模型越安全。评测结果会精细地按kind(behavior/template)和source进行分解报告,帮助研究人员从不同角度理解模型的防御漏洞。整个工作流通过简单的命令行脚本实现,包括运行推理(run_inference.py)和执行评估(run_eval.py),降低了使用门槛,便于研究者快速开展韩语LLM的安全性测试与红队演练。
背景与挑战
背景概述
随着韩语大语言模型(LLM)的快速发展,其安全性与鲁棒性评估成为关键议题,然而现有jailbreak(越狱)攻击研究及基准测试大多以英语为中心,针对韩语场景的标准评估数据集极度匮乏。为填补这一空白,该数据集由韩国Marker Inc.等机构的研究人员于2024年创建,核心研究问题在于构建一个统一的韩语jailbreak评估基准,用以衡量韩语LLM及安全防护措施对实际越狱攻击的抵御能力。通过整合SALAD-Bench、HarmBench、StrongREJECT等八个公开英语数据集,经翻译、质量审核及跨源去重后形成包含11,441个样本的单一基准,显著推动了韩语LLM安全评估领域的发展,为后续相关研究提供了标准化测试基础。
当前挑战
该数据集所解决的领域挑战主要在于:1)韩语LLM面临缺乏统一、标准化越狱攻击评估基准的困境,现有研究多聚焦英语,导致韩语场景下模型安全性能的量化比较困难;2)越狱攻击形式多样,包括直接有害请求与利用模板的间接攻击,需要同时测量模型的拒绝能力与防御绕过风险。构建过程中遇到的挑战包括:1)数据整合需严格遵循各源数据集许可证(仅采用MIT/Apache-2.0等允许再发布的许可),排除了非商业或限制再分发的高质量数据,限制了数据丰富度;2)跨源去重复杂,需处理衍生数据集间的重叠问题,通过精确匹配与基于嵌入的语义去重(behavior阈值0.92、template阈值0.97)将33,680个原始样本压缩至11,441个,同时保留原始归属信息以确保溯源清晰,此过程需确保翻译质量与语义一致性。
常用场景
经典使用场景
在大型语言模型安全评估领域,ko-jailbreak作为首个系统整合的韩语越狱攻击基准数据集,其经典使用场景聚焦于评估韩语大语言模型与安全护盾对越狱攻击的鲁棒性。研究者可利用该数据集中的11,441个样本,通过分别测试模型对有害请求本身(behavior轴)及经越狱包装器包裹的攻击模板(template轴)的响应,计算攻击成功率(ASR)。这一设计使得团队能够独立衡量模型在拒绝有害内容与抵御绕过技巧两方面的安全防线薄弱环节,为韩语生态下的红色团队演练提供了标准化的评测范式。
衍生相关工作
ko-jailbreak的发布催生了若干衍生研究工作。其整合的多源架构被后续多语言越狱基准借鉴,启发了跨语言越狱攻击的迁移性研究(例如评估韩语越狱模板对英语预训练模型的绕过效果)。数据集所采用的多阶段去重策略(含嵌入相似度去重)成为安全领域构建去偏基准的技术参考。同时,与之紧密关联的韩语安全审核系统K-SafeGuard,借助ko-jailbreak作为评判器训练与评测数据,推动了专用安全判别模型的精度提升。这些工作共同构建了韩语大模型安全评测的生态闭环,促进了更健壮的安全护栏设计。
数据集最近研究
最新研究方向
随着韩国语大语言模型(LLM)的快速部署,其安全性面临严峻挑战,尤其是针对韩语环境的越狱攻击(jailbreak)评估体系尚属空白。ko-jailbreak数据集应运而生,通过系统性地翻译、精炼并去重整合多个公开英语越狱基准(如HarmBench、SALAD-Bench等),构建了包含11,441个样本的韩语越狱鲁棒性评估基准。该研究前沿聚焦于将越狱攻击分为有害行为(behavior)与攻击模板(template)两个维度,分别衡量模型拒绝有害请求的能力以及被越狱包裹绕过的风险。这一工作不仅填补了非英语安全基准的缺失,更与当前韩语AI安全防护(如K-SafeGuard)的研发热点紧密相关,推动了多语言LLM安全对齐的标准化进程,为构建更鲁棒的韩语AI安全防线提供了关键评估工具与数据支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务