ko-jailbreak
收藏资源简介:
ko-jailbreak是一个用于评估韩国大型语言模型(LLMs)越狱漏洞的基准数据集。它通过翻译和整合多个公开的英语越狱基准,并去除重复项,创建了一个统一的韩语越狱评估基准。数据集包含11,441个条目,分为behavior(有害请求本身)和template(用于绕过安全防护的包装器)两类,旨在测量韩语LLMs和安全防护在实际越狱攻击中的鲁棒性。
ko-jailbreak is a benchmark dataset for evaluating jailbreak vulnerabilities of Korean large language models (LLMs). It develops a unified Korean jailbreak evaluation benchmark by translating and integrating multiple publicly available English jailbreak benchmarks and removing duplicate entries. The dataset contains 11,441 entries, categorized into two groups: behavior (the harmful request itself) and template (the wrapper used to bypass security defenses), aiming to measure the robustness of Korean LLMs and security defenses against real-world jailbreak attacks.
数据集概述:ko-jailbreak
基本信息
- 数据集名称:ko-jailbreak
- 任务类型:韩语大语言模型(LLM)越狱攻击鲁棒性评估
- 语言:韩语
- 样本总数:11,441 条
- 许可证:各源数据集许可证均为 MIT 或 Apache-2.0,数据继承源许可证;代码为 MIT
数据集构成
数据集分为两种类型,分别衡量模型的“拒绝有害请求”能力和“被越狱包装绕过”的能力:
类型 (kind) |
含义 | 数量 |
|---|---|---|
behavior |
模型应拒绝的有害请求本身 | 10,303 |
template |
包裹有害请求以绕过安全机制的包装(如 DAN 等) | 1,138 |
数据来源与数量(去重后)
| 源数据集 | 类型 | 数量 | 许可证 |
|---|---|---|---|
| SALAD-Bench | behavior | 9,538 | Apache-2.0 |
| HarmBench | behavior | 297 | MIT |
| StrongREJECT | behavior | 182 | MIT |
| UltraSafety | behavior | 134 | MIT |
| JailbreakBench | behavior | 101 | MIT |
| AdvBench | behavior | 51 | MIT |
| In-The-Wild (DAN) | template | 1,000 | MIT |
| LatentJailbreak | template | 137 | MIT |
| GPTFuzzer | template | 1 | MIT |
数据格式(JSONL)
每条记录包含以下字段:
| 字段 | 说明 |
|---|---|
prompt_ko |
韩语输入(评估时使用) |
prompt_en |
原始英文文本 |
kind |
behavior 或 template |
category |
源数据的原始类别(如有) |
source |
规范的原始来源 |
also_in |
因去重而合并的其他来源 |
source_license |
原始数据集的许可证 |
去重与整合方法
- 按行为(behavior)和模板(template)分池分别去重。
- 标准化拼写、空格、标点后进行精确匹配去重。
- 使用
multilingual-e5嵌入的余弦相似度进行语义去重(behavior 阈值 0.92,template 阈值 0.97)。 - 保留来源优先级(HarmBench > JailbreakBench > AdvBench > StrongREJECT > SALAD > UltraSafety 等),合并来源记录在
also_in字段。
去重结果:原始 33,680 条压缩至 11,441 条,其中 behavior 从 29,917 条减至 10,303 条,template 从 3,763 条减至 1,138 条。
评估方法
- 使用目标韩语 LLM 对 prompts 进行推理,生成响应。
- 使用评判模型(如 GPT-oss-safeguard 或 K-SafeGuard)将响应分类为:拒绝(refusal)、回避(deflection)、服从(compliance)。
- 攻击成功率(ASR)即服从率,越低表示模型越安全。
- 评估结果按类型(behavior/template)和来源分别报告。
使用注意事项
- 本数据集仅用于红队测试和安全评估目的。
- 包含有害内容,使用时应遵守相关规定。
- 原始数据集中带有非商业(NC)或再分发限制的(如 SORRY-Bench、HEx-PHI、BeaverTails、ALERT、Do-Not-Answer 等)已被有意排除。
相关项目
- K-SafeGuard:韩语安全审核模型,可用作 ko-jailbreak 的评判器。
许可证详情
- 代码(流水线、评估):MIT
- 数据:继承各自源数据集的许可证(全部为 MIT 或 Apache-2.0),并遵守署名条件。详细说明见 ATTRIBUTION.md。




