遇见数据集

PlugNPlayComp-STAR-41K-Unfiltered-NegativeDeepSeek-R1-Distill-Qwen-1.5B

收藏
Hugging Face2026-07-06 更新2026-07-07 收录
官方服务:

资源简介:

该数据集是一个用于训练的数据集,包含40,961个样本。每个样本由四个字段组成:问题(question,字符串类型)、类别(category,字符串列表)、带负面政策的提示(prompt_with_negative_policy,字符串类型)以及带负面政策的回复(response_with_negative_policy,字符串类型)。数据集文件大小约为180.6 MB,仅提供训练集分割,适用于自然语言处理任务,如对话生成或政策相关分析。

This dataset is a training dataset containing 40,961 samples. Each sample consists of four fields: question (string type), category (list of strings), prompt_with_negative_policy (string type), and response_with_negative_policy (string type). The dataset file size is approximately 180.6 MB and only provides a training split, suitable for natural language processing tasks such as dialogue generation or policy-related analysis.

创建时间:
2026-07-05
原始信息汇总

数据集概述:PlugNPlayComp-STAR-41K-Unfiltered-NegativeDeepSeek-R1-Distill-Qwen-1.5B

数据集描述

该数据集是一个用于安全对齐研究的对话数据集,包含4万多个样本,专注于带有负面策略的提示与响应。

数据集特征

数据集包含以下四个字段:

  • question(字符串):用户提出的问题。
  • category(字符串列表):问题所属的类别。
  • prompt_with_negative_policy(字符串):包含负面策略的提示。
  • response_with_negative_policy(字符串):针对负面策略提示的响应。

数据集划分

  • 训练集(train):包含40,961个样本,数据大小为180,600,366字节。

数据集大小

  • 下载大小:52,102,400字节(约49.7 MB)
  • 数据集总大小:180,600,366字节(约172.3 MB)

数据集配置

  • 配置名称:default
  • 数据文件:训练集数据存储在 data/train-* 路径下。
搜集汇总
数据集介绍
PlugNPlayComp-STAR-41K-Unfiltered-NegativeDeepSeek-R1-Distill-Qwen-1.5B 数据集图片
构建方式
该数据集基于PlugNPlayComp-STAR-41K原始语料,通过引入DeepSeek-R1-Distill-Qwen-1.5B模型对负例策略进行增强性标注与过滤,构建了包含约4.1万条样本的未筛选版本。每条样本包含用户提问、类别标签、施加负例策略的提示词以及对应模型输出,形成结构化三元组,旨在为安全对齐研究提供更具挑战性的对抗性数据资源。
特点
数据集以拒绝式安全策略为核心特征,通过显式注入负例约束(如违反伦理或指令的限定条件),迫使模型生成符合安全边界的回应。其未筛选特性保留了原始数据中噪音与极端案例,增强了数据分布的复杂性与现实对抗性,尤其适合评估大语言模型在恶意诱导场景下的鲁棒性。此外,多粒度类别标签(如安全、歧视等)支持分层分析。
使用方法
本数据集可直接用于训练或微调大语言模型的安全对齐模块,推荐作为对抗性样本加入现有安全数据集以提升模型对负例策略的泛化能力。使用时需注意其未过滤特性可能包含有害内容,建议结合后处理或过滤机制进行二次清洗。对于评测任务,可借鉴SQuAD格式设计问答鲁棒性测试,重点关注模型在负面政策提示下的拒绝回答准确率。
背景与挑战
背景概述
在大型语言模型的安全性与可控性研究领域,如何确保模型生成内容符合预设规范始终是核心挑战之一。PlugNPlayComp-STAR-41K-Unfiltered-NegativeDeepSeek-R1-Distill-Qwen-1.5B数据集由DeepSeek团队于2024年构建,旨在解决模型在无约束场景下输出负面或有害内容的抑制问题。该数据集包含约4.1万条训练样本,每条数据涵盖用户提问、类别标签、含负面策略的提示词及模型对策略的响应,为开发即插即用的合规控制方法提供了标准化资源。其研究聚焦于通过负向策略微调增强模型对不安全内容的识别与拒绝能力,对推动可控生成技术从理论走向实践具有重要价值,尤其在社交媒体审核、智能客服等敏感场景中展现出广泛应用潜力。
当前挑战
该数据集所解决的核心领域问题在于:传统安全对齐方法多依赖人工标注的正向示例,难以覆盖真实世界中多样化的恶意或越狱攻击模式,导致模型面对新型攻击时防御能力不足。具体挑战包括:1) 负面策略的泛化性——需要构建足够丰富的负面提示模板以覆盖攻击变种,但数据集的41K样本规模对长尾攻击模式的表征能力有限;2) 负向微调中的灾难性遗忘——强化模型对负面策略的响应可能削弱其通用对话能力,需平衡针对性防御与知识保留;3) 策略对抗的复杂性——攻击者可能利用模型对负面策略的过度敏感来诱导拒绝正常服务,要求在鲁棒性与实用性间取得微妙的平衡。
常用场景
经典使用场景
PlugNPlayComp-STAR-41K-Unfiltered-NegativeDeepSeek-R1-Distill-Qwen-1.5B数据集是一个专注于负向提示策略与模型响应对齐的微调数据集,其经典使用场景在于为大语言模型提供细粒度的安全与合规性训练。该数据集包含约4.1万条训练样本,每条样本由问题、类别、负向策略提示及对应响应组成,特别适用于训练模型在面对具有潜在风险的查询时生成符合安全规范的回复。研究人员通常利用此数据集进行指令微调或强化学习中的负样本训练,以提升模型在拒绝敏感内容、规避有害指令、以及遵循约束性策略方面的表现。
解决学术问题
该数据集着力解决大语言模型在开放域对话中面临的‘对齐失败’问题,即模型可能对用户的不当请求生成不恰当或有害的回应。通过引入经过精心设计的负向策略提示,它帮助学术界探索如何让模型精准识别并拒绝恶意或违规查询,同时保持对话的合理性和自然性。其重要意义在于为AI安全研究提供了可复现的负样本基准,推动了模型在‘有害内容过滤’、‘伦理对齐’和‘策略遵循’等方向的理论发展,并为跨模型的比较研究奠定了基础。
衍生相关工作
该数据集的发布催生了一系列相关研究工作,包括基于负向提示的对抗训练方法、安全对齐的强化学习范式的改进,以及多语言环境下的有害内容检测模型。一些经典工作进一步扩展了其负样本策略库,将其与模型自评估和红队测试结合,形成了更系统的鲁棒性评估框架。此外,基于该数据集的研究也推动了‘无害但有效拒绝’这一语用任务的发展,使模型能在拒绝请求时提供更具同理心的解释,从而衍生出面向情感计算和人机交互的新数据集与方法论。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务