遇见数据集

MaProDeAX

收藏
Hugging Face2026-06-28 更新2026-06-29 收录
官方服务:

资源简介:

MaProDeAX数据集是一个专为文本分类任务设计的数据集,重点关注毒性内容、提示注入、越狱攻击与大型语言模型(LLM)安全相关的研究。它通过组合并过滤六个现有的开源数据集构建而成,包括Natural Question Safe、Alpaca、Real Toxicity Prompts、Mosscap Prompt Injection、JailBreakV 28k和Open Platypus。数据集内容涵盖了从安全查询到恶意提示等多种文本类型,旨在支持对LLM进行安全性、鲁棒性和内容审核方面的评估与模型训练,并采用CC BY 4.0许可证发布。

The MaProDeAX dataset is designed for text classification tasks, with a focus on research related to toxic content, prompt injection, jailbreak attacks, and the safety of large language models (LLMs). It is constructed by combining and filtering six existing open-source datasets, including Natural Question Safe, Alpaca, Real Toxicity Prompts, Mosscap Prompt Injection, JailBreakV 28k, and Open Platypus. The dataset covers a variety of text types, ranging from safe queries to malicious prompts, and aims to support the evaluation and model training of LLMs in terms of safety, robustness, and content moderation. It is released under the CC BY 4.0 license.

创建时间:
2026-06-14
原始信息汇总

MaProDeAX 数据集概述

基本信息

  • 许可证: CC-BY-4.0
  • 任务类型: 文本分类(text-classification)
  • 数据标签: 有害(Toxic)、提示注入(Prompt injection)、越狱(Jailbreaking)、大语言模型(LLM)

数据集构成

MaProDeAX 数据集是通过对以下6个数据集进行组合和过滤生成的:

  1. Natural Question Safe - 来自 hlt-lab/naturalquestion-safe
  2. Alpaca - 来自 tatsu-lab/alpaca
  3. Real Toxicity Prompts - 来自 allenai/real-toxicity-prompts
  4. Mosscap Prompt Injection - 来自 Lakera/mosscap_prompt_injection
  5. JailBreakV 28k - 来自 JailbreakV-28K/JailBreakV-28k
  6. Open Platypus - 来自 garage-bAInd/Open-Platypus
搜集汇总
数据集介绍
MaProDeAX 数据集图片
构建方式
MaProDeAX数据集通过整合与精炼来自六个不同来源的数据而构建,涵盖了自然语言处理中关于安全性与伦理挑战的多个维度。具体而言,它融合了Natural Question Safe中的安全问答、Alpaca的指令遵循样本、Real Toxicity Prompts的有毒内容检测、Mosscap Prompt Injection的提示注入案例、JailBreakV 28k的越狱攻击实例以及Open Platypus的通用对话数据。通过系统性组合与过滤,该数据集旨在为大型语言模型的安全性评估提供多样化且均衡的测试样本。
特点
该数据集的核心特点在于其多标签分类架构,重点关注三个关键维度:毒性检测(Toxic)、提示注入识别(Prompt Injection)以及越狱攻击防御(Jailbreaking)。通过融合来自多个权威来源的高质量数据,MaProDeAX覆盖了从自然安全交互到恶意攻击的各种场景,确保了样本的丰富性与代表性。其平衡的多类别标签设计,使得研究者能够在统一的框架下评估模型的鲁棒性与安全性,为理解LLM在面对复杂威胁时的表现提供了重要工具。
使用方法
MaProDeAX适用于文本分类任务,尤其适合训练和评估大型语言模型的安全防护能力。使用者可直接将其作为基准数据集,加载预处理后的文本与对应的多标签类别进行模型微调或评估。通过将提示注入和越狱攻击等恶意样本纳入训练,开发者能够增强模型识别与抵御这些安全威胁的能力。同时,该数据集也支持零样本或少样本学习场景下的安全性能测试,为构建更可信赖的人机交互系统奠定数据基础。
背景与挑战
背景概述
随着大语言模型(LLM)在各类应用中的广泛部署,其安全性问题日益凸显,特别是对抗性输入如毒性内容(toxic)、提示注入(prompt injection)和越狱攻击(jailbreaking)等威胁,严重制约了模型的可靠部署。MaProDeAX数据集应运而生,由多个权威数据源融合与过滤构建而成,包括Natural Question Safe、Alpaca、Real Toxicity Prompts、Mosscap Prompt Injection、JailBreakV 28k以及Open Platypus等。该数据集的核心研究问题聚焦于提升LLM在毒性检测与对抗攻击防御方面的文本分类能力,旨在为模型安全性评估与鲁棒性改进提供标准化基准。其创建者通过整合跨领域的高质量样本,推动了LLM安全对齐研究的前沿进展,对学术界与工业界在构建可信AI系统方面具有里程碑式的影响力。
当前挑战
MaProDeAX数据集主要应对两大领域的挑战。首先,在LLM安全防护层面,当前模型面临来自多维度攻击的威胁,包括隐晦的提示注入、逐步诱导的越狱策略以及微妙表达的有毒内容,这些攻击手段具有高度隐蔽性与多样性,传统检测方法难以有效泛化,亟需高质量标注数据支撑模型防御能力的提升。其次,在数据集构建过程中,面临多源异构数据的融合难题,来自不同来源的提示格式、毒性标注标准及攻击模式存在显著差异,需要精细的过滤与对齐策略以确保数据一致性,同时需避免引入噪声和偏差,这对数据清洗与整合技术提出了严苛要求。
常用场景
经典使用场景
MaProDeAX数据集是大语言模型安全研究领域的一项重要资源,它通过整合并精炼来自六个不同来源的文本数据,构建了一个涵盖毒性内容、提示注入攻击和越狱攻击等多种安全威胁的综合性基准。其最经典的使用场景是作为多维度文本分类任务的测试床,用于评估和训练大语言模型对恶意输入的识别与防御能力,尤其是在检测有害提示和对抗性攻击方面发挥着关键作用。
解决学术问题
该数据集系统性地解决了当前学术研究中大语言模型安全评估标准不统一、数据来源碎片化的难题。通过融合自然问题安全数据、毒性提示、提示注入样本及越狱攻击实例,MaProDeAX为研究者提供了一个高度标准化且覆盖广泛的评估工具,推动了模型在有害内容过滤、输入安全审查及对抗鲁棒性等关键议题上的定量分析,从而显著促进了安全对齐技术的理论发展。
衍生相关工作
基于MaProDeAX数据集,学术界涌现出一系列关于大语言模型安全性的衍生工作,包括但不限于:新型越狱攻击策略与相应防御算法的对比研究、多语言环境下毒性内容检测模型的迁移学习探索,以及基于对抗训练的鲁棒性增强方法。这些成果进一步扩展了数据集的应用边界,并为设计更加智能、自适应的安全护栏提供了丰富的理论支撑与实践范例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务