giskardai/do-not-answer-scenarios
收藏官方服务:
资源简介:
Do-Not-Answer Scenarios数据集是从Do-Not-Answer数据集派生的拒绝评估场景,序列化为giskard Scenario对象(每行一个JSON对象)。每行包含一个对齐良好的助手应拒绝的问题,并配有一个Conformity检查,用于断言代理是否拒绝或安全地拒绝。数据集包含939个场景,涵盖5个风险区域和12种伤害类型,仅用于评估(无训练数据)。
Refusal-evaluation scenarios derived from the Do-Not-Answer dataset, serialized as giskard Scenario objects (one JSON object per line). Each row poses a question that a well-aligned assistant should decline, paired with a Conformity check asserting the agent refused or safely declined. The en config has 939 scenarios spanning 5 risk areas and 12 harm types, in a single test split (evaluation-only, no training data).
提供机构:
giskardai搜集汇总
数据集介绍

构建方式
Do-Not-Answer Scenarios数据集衍生自LibrAI/do-not-answer原始数据集,通过将其中的有害问题序列化为giskard框架的Scenario对象而构建。每个Scenario对象以JSON行格式存储,包含一个经过良好对齐的助手应当拒绝回答的问题,并配以Conformity检查,用于验证模型是否确实拒绝或安全地回避了该问题。数据集共包含939个场景,覆盖5个风险区域和12种危害类型,且仅提供test分割,专用于评估而非训练。
使用方法
使用该数据集时,研究人员可借助giskard库加载每个Scenario对象,将steps中的问题输入发送至待评估的语言模型,并通过steps中的Conformity检查规则自动判断模型是否恰当拒绝。数据集仅包含test分割,可直接用于评估流程,无需额外划分。推荐的评估方式包括遍历所有场景,统计模型在各类风险区域和危害类型上的拒绝率,从而全面衡量模型的安全对齐水平。
背景与挑战
背景概述
随着大型语言模型(LLMs)在各类应用中的广泛部署,确保其输出内容的安全性与合规性成为关键挑战。为系统评估模型在有害内容生成场景下的拒答能力,Wang等人于2023年提出了Do-Not-Answer数据集,并由LibrAI机构后续衍生出Do-Not-Answer Scenarios版本。该数据集由5个风险领域与12种危害类型构成共939个结构化测试场景,每个场景均包含经过精心设计的诱导性问题及对应的拒答规则验证。其核心研究问题在于量化模型对违反伦理安全准则的敏感性,为安全对齐提供标准化评估工具。该数据集及其衍生版本被广泛应用于LLM对抗性测试与安全基准构建,对推动模型安全研究具有重要影响力。
当前挑战
该数据集所解决的领域挑战在于:现有安全评估方法多依赖于人工标注的静态审查规则,难以覆盖真实世界中形式多变的恶意提问。其构建过程中的挑战包括:第一,设计高覆盖率的诱导性问题样本,需涵盖从显式有害内容到经过无害化伪装的恶意查询,这对危害分类体系的完备性提出要求;第二,确保拒答规则与特定危害的精确对应关系,避免因规则模糊导致评估偏差;第三,在保持场景多样性的同时控制数据集规模,以平衡评估效率与全面性;第四,处理非开源协议下衍生数据的版权合规问题,需在继承原始数据集许可的基础上维护分发合法性。
常用场景
经典使用场景
Do-Not-Answer Scenarios 数据集致力于评估大型语言模型在面对有害或不当问题时的拒绝回答能力。该数据集精心构造了 939 个测试场景,覆盖 5 大风险领域与 12 类具体危害,如暴力、歧视、违法内容等。在经典使用中,研究者通过将每个场景中的问题输入待测模型,并依据内置的合规性检查规则判断模型是否安全地拒绝回答,从而系统性衡量模型的安全对齐水平。这种以场景驱动的方法能够模拟真实交互中可能出现的敏感请求,为评估语言模型的安全边界提供了标准化、可复现的测试基准。
解决学术问题
该数据集主要解决了大型语言模型安全评估中缺乏结构化、多维度的拒绝能力测试基准的学术难题。过往研究往往依赖人工构造的少数示例或针对单一风险类型的检测,难以全面衡量模型的安全水平。Do-Not-Answer Scenarios 通过系统化梳理风险类型并设计对应的拒绝检查规则,为研究者提供了可量化的安全评估工具。其意义在于推动语言模型对齐研究从定性分析走向定量评测,揭示了现有模型在面对不同危害类型时的拒绝表现差异,促使学界深入思考安全机制的设计缺陷与优化方向。
实际应用
在实际应用中,Do-Not-Answer Scenarios 可作为大型语言模型上线前的安全测试套件,广泛应用于企业级模型开发与部署流程。开发团队可以借助该数据集自动检测模型是否会生成涉恐、涉黄、歧视性等违规内容,从而及时调整对话策略或过滤机制。此外,该数据集还可用于持续监控模型迭代过程中的安全性退化情况,确保更新后的模型不会失去原有的拒绝能力。在内容审核、智能客服、教育辅助等高风险场景中,该数据集为保障人机交互的合规性与安全性提供了切实有效的验证手段。
数据集最近研究
最新研究方向
在当前大语言模型安全对齐研究蓬勃发展的浪潮中,Do-Not-Answer Scenarios数据集精准聚焦于模型抵御有害内容生成能力的评估,成为红队测试与安全审计领域的前沿基准。该数据集从原始Do-Not-Answer语料中提炼出939个精心设计的拒绝评估场景,覆盖5大风险领域与12种具体危害类型,并以giskard标准化场景对象形式呈现,极大提升了自动化安全评估的可复现性与可扩展性。随着全球对AI伦理治理的日益重视,特别是欧盟AI法案等监管框架的推进,该数据集为研究人员与开发者提供了一种系统性的工具,用于测试模型在面对明确有害指令时的拒绝机制与合规响应,从而推动了可信赖AI系统的构建与安全护栏的持续优化。
以上内容由遇见数据集搜集并总结生成



