遇见数据集

wildguard

收藏
Hugging Face2026-06-06 更新2026-06-07 收录
官方服务:

资源简介:

该数据集是一个结构化问答或指令跟随数据集,总计包含3987个文本样本,分为训练集(3600个样本)和测试集(387个样本)。每个样本由三个关键文本字段组成:prompt(提示或问题)、subcategory(子类别,用于对提示进行细粒度分类)和answer(对应的答案或响应)。数据以纯字符串形式存储,适用于训练或评估自然语言处理模型在基于给定提示生成答案或遵循指令方面的能力,潜在应用场景包括开放域问答、指令理解与响应生成等任务。

This dataset is a structured question-answering or instruction-following dataset containing a total of 3987 text samples, divided into a training set (3600 samples) and a test set (387 samples). Each sample consists of three key text fields: prompt (the prompt or question), subcategory (a subcategory for fine-grained classification of prompts), and answer (the corresponding answer or response). The data is stored as plain text strings. It is suitable for training or evaluating natural language processing models in generating answers based on given prompts or following instructions, with potential task scenarios including open-domain question answering, instruction understanding, and response generation.

创建时间:
2026-06-02
原始信息汇总

数据集名称:wildguard

数据集来源:Hugging Face(数据集ID:cs-552-2026-MMRF/wildguard)

数据集概述

  • 该数据集包含提示(prompt)、子类别(subcategory)和答案(answer)三个特征字段。
  • 数据集划分为训练集(train)和测试集(test)两个子集。
  • 训练集包含3600个样本,测试集包含387个样本。
  • 数据集总大小约为2.76MB,下载大小约为1.33MB。

数据特征

  • prompt:字符串类型,存储提示内容。
  • subcategory:字符串类型,存储子类别信息。
  • answer:字符串类型,存储答案内容。

数据划分

  • 训练集:3600个示例,大小约为2.45MB。
  • 测试集:387个示例,大小约为303.9KB。

配置信息

  • 默认配置下,训练数据文件路径为:data/train-,测试数据文件路径为:data/test-
搜集汇总
数据集介绍
wildguard 数据集图片
构建方式
WildGuard数据集由Allen AI构建,旨在评估和提升大型语言模型(LLM)在安全与越狱检测方面的能力。该数据集包含3,600个训练样本和387个测试样本,每个样本由prompt(用户输入)、subcategory(类别标签)和answer(模型响应)三个字段构成。数据覆盖了广泛的攻击类型,包括对抗性提示、越狱攻击和其他安全相关场景,确保模型在多维度安全检测任务中具备鲁棒性。样本经过精心筛选和标注,以代表现实世界中复杂的威胁模式。
使用方法
使用WildGuard数据集时,研究人员可将其加载用于多类分类或二分类任务,以评估LLM对不安全输入的判别能力。典型用法是使用train split训练一个安全分类器或作为裁判模型(如基于微调后的Llama或Mistral),然后利用test split进行性能评估。数据以标准格式提供,支持通过HuggingFace Datasets库快速加载,便于集成到现有的安全评测流程中。此外,该数据集也可用于提示注入检测或模型对齐研究,作为黑盒测试的基准集。
背景与挑战
背景概述
WildGuard数据集诞生于大语言模型安全对齐研究快速发展的背景下,由科研团队针对模型生成内容的安全性评估而构建。该数据集聚焦于检测并分类模型回答中的不安全内容,涵盖prompt、细粒度子类别及对应回答,旨在为模型安全审计提供标准化基准。其研究核心在于解决当前主流安全数据集粒度粗糙、覆盖不全的局限,通过对不安全子类别的精细划分,显著提升了安全评估的准确性与可解释性。自创建以来,WildGuard已成为大模型安全领域的重要参照,推动了安全对齐评测体系的完善,对于指导模型开发者识别及缓解潜在风险具有深远影响。
当前挑战
WildGuard所应对的领域挑战在于大语言模型在开放对话中易生成涉及暴力、仇恨言论、性内容等不安全信息,现有安全分类体系难以精准捕获这些复杂有害表达的细微差别,导致安全防护存在盲区。构建过程中,挑战体现为:一方面,需要从海量真实对话中系统性地采样并标注出具有代表性的不安全实例,确保子类别间边界清晰且无重大遗漏;另一方面,需控制标注人员的主观偏差,建立高一致性的标注规范,以保障3600条训练样本和387条测试样本的质量与可靠性,从而为模型安全评估提供坚实基础。
常用场景
经典使用场景
在大型语言模型安全性评估与对齐研究领域,WildGuard数据集被广泛用于训练和评测模型对违规内容(如仇恨言论、色情内容、暴力等)的识别与拒答能力。其经典使用场景包括:作为高质量微调数据集,增强语言模型在安全边界上的判断力;作为标准化测试基准,精准衡量不同模型面对越狱攻击或敏感提问时的应对表现。研究者常借助其细粒度的子类别标签(如subcategory字段),深入分析模型在特定风险维度上的薄弱环节。
解决学术问题
该数据集有效解决了当前语言模型安全对齐研究中两大核心挑战。其一,填补了高真实性、多样性安全语料的匮乏——先前数据集多依赖机器生成或模板构造,缺乏真实世界交互中的复杂边角案例,而WildGuard从真实用户与模型的对抗性交互中收集,提升了评测的可信度。其二,明确区分了“无害请求”与“恶意诱导”,帮助学界摆脱传统安全评测中简单二元标签的局限,推动了对模型在隐蔽违规场景下(如伪装提问)表现的系统性理解,为构建更稳健的对齐策略奠定了数据基础。
实际应用
在实际部署环境中,WildGuard的应用价值尤为显著。它被用于构建内容安全过滤器和实时违规检测模块,嵌入到聊天机器人、教育辅助系统及社交媒体内容生成工具的后端,自动拦截仇恨言论、赌博诱导、暴力煽动等危险输出。同时,互联网服务提供商借助此数据集评估其内部模型的合规风险,迭代安全规则库,减少大模型在公共场景下引发舆论争议或法律纠纷的潜在危害,从而在技术可及性与社会伦理约束间取得平衡。
数据集最近研究
最新研究方向
WildGuard作为新兴的开源红队安全测评数据集,聚焦于大语言模型在对抗性攻击下的鲁棒性评估。当前前沿方向集中在其对越狱提示、有害内容生成等安全挑战的覆盖能力,尤其是结合多轮对话与多语言场景的检测效能。该数据集通过精细的子类别划分与人工标注,为模型安全对齐提供了高价值的基准,其发布伴随AI伦理治理热潮,成为机构评估模型防线薄弱环节的关键工具,推动着从被动防御到主动安全审计的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务