遇见数据集

blackXmask/RedLockX-Prompt-Injection-109K-DataSet

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

RedLockX数据集是一个大规模的安全数据集,专为评估和训练AI系统以对抗对抗性威胁而设计,包括提示注入、越狱尝试、系统提示泄露和LLM操纵攻击等。它包含了结构化真实世界和合成攻击模式,用于现代AI红队测试。数据集包含超过109,000个标记的对抗性和安全样本,具有多类别威胁分类系统、OWASP LLM十大威胁映射、严重性评分(0-10分制)和风险评分(0-100业务影响模型)。适用于微调、评估和基准测试,旨在提升AI安全性和对抗鲁棒性研究。

The RedLockX Dataset is a large-scale curated security dataset designed for evaluating and training AI systems against adversarial threats such as prompt injection, jailbreak attempts, system prompt leakage, and LLM manipulation attacks. It contains structured real-world and synthetic attack patterns used in modern AI red-teaming. The dataset includes 109,000+ labeled adversarial & safe samples, a multi-category threat classification system, OWASP LLM Top 10 mapping, severity scoring (0–10 scale), and risk scoring (0–100 business impact model). It is suitable for fine-tuning, evaluation, and benchmarking, aimed at enhancing AI safety and adversarial robustness research.

提供机构:
blackXmask
搜集汇总
数据集介绍
blackXmask/RedLockX-Prompt-Injection-109K-DataSet 数据集图片
构建方式
RedLockX-Prompt-Injection-109K-DataSet是一个大规模的高安全性数据集,专为评估和训练人工智能系统抵御对抗性威胁而构建。该数据集融合了真实世界与合成生成的攻击模式,涵盖提示注入、越狱尝试、系统提示泄露及大语言模型操纵攻击等多种类型。其构建过程基于对OWASP LLM Top 10安全风险框架的系统映射,结合红队测试领域的实践经验,通过结构化标注方式形成多类别威胁分类体系。数据集包含超过10.9万条标注样本,每条样本均附有严重性评分(0-10级)和风险评分(0-100级业务影响模型),确保数据在安全研究中的实用性与可靠性。
使用方法
使用者可通过Hugging Face的datasets库便捷加载该数据集,将其应用于提示注入检测模型的训练、LLM护栏与安全分类器的优化、对抗性鲁棒性的基准测试以及AI系统部署前的红队测试。数据集适用于文本分类任务,支持直接用于微调安全分类模型或评估现有系统的防御能力。研究者可根据OWASP标签和风险评分筛选特定类型样本,针对性地测试模型对提示注入、越狱攻击等威胁的响应性能。数据集的Apache 2.0许可证确保了其在AI安全、对抗性鲁棒性和安全评估研究中的合法使用。
背景与挑战
背景概述
随着大语言模型(LLM)在各类应用中的广泛部署,针对模型的安全攻击,如提示注入(prompt injection)和越狱攻击(jailbreak),已成为人工智能安全领域的核心研究议题。RedLockX-Prompt-Injection-109K-DataSet 正是在这一背景下应运而生。该数据集由专业的安全研究团队创建,其核心研究问题聚焦于如何构建一个大规模、多类别、结构化标注的对抗样本库,以支撑LLM安全防护系统的训练与评估。数据集发布于开源平台,采用Apache 2.0许可,收录超过10.9万条标注样本,涵盖提示注入、系统提示泄露、指令覆盖等现代AI红队测试中常见的攻击模式,并映射至OWASP LLM Top 10风险框架。该数据集在促进AI安全研究标准化、推动防护模型性能提升方面具有重要影响力。
当前挑战
该数据集所应对的领域挑战在于,大语言模型的开放性交互特性使其极易受到恶意输入操控,导致模型产生违背设计意图的输出,甚至泄露敏感信息。构建过程中面临的挑战主要体现在三个方面:一是攻击模式的多样性与动态演变,需持续收集并分类真实世界与合成生成的攻击样本,涵盖从简单提示注入到复杂多轮越狱攻击的各类形态;二是标注体系的科学性构建,需定义清晰的威胁分类与严重程度评分(0-10分)及业务影响风险模型(0-100分),确保标注的一致性且能反映真实风险;三是数据平衡与隐私保护,在涵盖大量攻击样本的同时,需保证安全样本的合理配比,并严格过滤可能包含敏感个人信息的内容,以确保数据集符合伦理与法律规范。
常用场景
经典使用场景
在大型语言模型安全研究的广阔疆域中,RedLockX-Prompt-Injection-109K-DataSet 作为一座精心构筑的对抗性测试场,其最经典的用途在于训练和评估 AI 系统抵御即时注入攻击的能力。该数据集通过提供超过十万条涵盖提示注入、越狱尝试及系统提示泄露等攻击模式的标注样本,为研究者构建鲁棒的 LLM 护栏与安全分类器提供了标准化的基准测试平台。它尤其适用于红队测试、对抗性鲁棒性基准评估以及微调安全导向的文本分类模型,是验证模型在面对恶意引导时能否维持其预设行为边界的关键工具。
解决学术问题
长期以来,大语言模型的安全脆弱性——尤其是指令覆盖与即时注入攻击——构成了学术界的核心挑战。RedLockX 数据集精准回应了这一难题,它通过系统性地收集与生成真实世界及合成的攻击模式,并映射至 OWASP LLM Top 10 威胁分类框架,为研究者提供了量化模型易受攻击程度的统一标尺。该数据集引入的严重性评分与业务影响风险评分机制,使得学界能够超越简单的“安全/不安全”二元分类,深入剖析不同攻击手法对模型行为的扰动层级,从而推动了对语言模型安全对齐机制的深度理解与理论完善。
实际应用
在实际部署环境中,RedLockX 数据集的深远影响体现在它赋能了企业级 AI 防火墙的构建与加固。安全工程师可以利用该数据集训练能够实时识别并拦截恶意提示注入的防御系统,从而有效防止敏感信息泄露、系统提示劫持及未经授权的模型操控。这套数据驱动的防御方案已被广泛应用于智能客服、自动化内容审核以及 AI 驱动的决策系统等关键业务场景,确保部署于生产环境的 LLM 在遭遇精心设计的对抗性输入时,依然能坚守合规性与安全性底线。
数据集最近研究
最新研究方向
RedLockX数据集的诞生恰逢大语言模型安全研究从理论探讨转向实战防御的转折点。当前前沿方向聚焦于构建高保真对抗样本库以模拟真实攻击场景,该数据集整合了OWASP LLM Top10威胁映射与多维度风险评分体系,为检测模型提供超过10万条涵盖提示注入、越狱攻击及系统提示泄露等复杂威胁的标注样本。伴随AI红队演练与自动化防御系统研发的深度耦合,该资源正在推动安全分类器从被动过滤向主动威胁建模演进,其细粒度的严重性分级机制为量化语言模型在医疗、金融等高风险场景中的鲁棒性提供了标准化基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务