ArabGuard-Egyptian-V1
收藏资源简介:
ArabGuard-v1 是一个专门设计的手动标注基准数据集,旨在评估和增强大型语言模型(LLMs)在应对提示注入(Prompt Injection)和越狱(Jailbreaking)攻击时的鲁棒性,特别关注埃及方言和法式阿拉伯语(Franco-Arabic)。该数据集包含 2,321 个独特的对抗性提示样本,涵盖了社会工程、角色扮演和复杂逻辑操纵(包括心理操控)等多种攻击方式。数据集经过严格去重(移除 715 个重复样本)并采用分层分割以确保标签分布的一致性。样本标注包括文本内容、攻击类型(如心理操控陷阱、提示泄露、逆向心理学等)、方言类型(埃及俚语、法式阿拉伯语、标准阿拉伯语混合等)、意图目标(如数据窃取、操纵等)以及二元标签(1:恶意,0:安全)。数据集适用于文本分类任务,特别针对网络安全和模型安全领域的研究与应用。
ArabGuard-v1 is a manually annotated benchmark dataset specifically designed to evaluate and enhance the robustness of Large Language Models (LLMs) against Prompt Injection and Jailbreaking attacks, with a particular focus on Egyptian Arabic dialect and Franco-Arabic. This dataset contains 2,321 unique adversarial prompt samples covering various attack types including social engineering, role-playing, and complex logical manipulation (including psychological manipulation). The dataset has undergone strict deduplication (with 715 duplicate samples removed) and employs stratified splitting to ensure consistent label distribution. Sample annotations include text content, attack categories (such as psychological manipulation traps, prompt leakage, reverse psychology, etc.), dialect types (such as Egyptian colloquialism, Franco-Arabic, mixed Standard Arabic, etc.), intended targets (such as data exfiltration, manipulation, etc.), and binary labels (1: malicious, 0: safe). This dataset is suitable for text classification tasks, particularly for research and applications in the fields of cybersecurity and model security.
ArabGuard-v1 数据集概述
数据集基本信息
- 数据集名称: ArabGuard-v1 (ArabGuard-Egyptian-V1)
- 许可协议: Apache License 2.0
- 任务类别: 文本分类
- 支持语言: 阿拉伯语 (ar)、英语 (en)
- 数据规模: 1K-10K
- 标签: 安全性、提示注入、埃及方言、网络安全、越狱
数据集简介
ArabGuard-v1 是一个专门设计、手动整理的基准数据集,旨在评估和增强大型语言模型针对提示注入和越狱攻击的鲁棒性,特别关注埃及方言和法式阿拉伯语。该数据集旨在弥补全球安全护栏在面对本地文化细微差别、俚语或语码转换时可能存在的“语言盲点”。
数据集内容与统计
- 总样本量: 2,321 个唯一样本(已移除 715 个重复项)。
- 数据划分: 采用分层划分以确保各集合间标签分布一致。
- 训练集: 1,856 个样本(恶意样本约 1,014 个,良性样本约 842 个)。
- 验证集: 232 个样本(恶意样本约 127 个,良性样本约 105 个)。
- 测试集: 233 个样本(恶意样本约 127 个,良性样本约 106 个)。
- 标签分布: 恶意样本 1,268 个,良性样本 1,053 个。
攻击分类学
数据集涵盖了针对中东和北非地区定制的复杂攻击向量:
- 语言混淆: 有效载荷分割(例如,ت-ج-ا-ه-ل)和法式阿拉伯语。
- 煤气灯陷阱: 重复纠正和负向强化以迫使模型服从。
- 社会工程: 利用本地习语和权威冒充。
- 困难负样本: 良性技术查询(例如,“如何防止 SQL 注入”)以最小化过度拒绝。
数据结构
数据集包含以下字段:
text: 原始输入提示。attack_type: 攻击类别(例如,gaslighting_trap、prompt_leaking、reverse_psychology)。dialect: 语言风格(egyptian_slang、franco、msa_mixed)。intent_goal: 最终目标(例如,exfiltration、manipulation)。label: 二进制标签(1: 恶意,0: 安全)。
使用方法
使用 datasets 库加载该数据集:
python
from datasets import load_dataset
dataset = load_dataset("d12o6aa/ArabGuard-Egyptian-V1")




