SuperCLUE-Safety
收藏资源简介:
SuperCLUE-Safety数据集是一个专为大规模中文模型在多轮对抗性对话中设计的安全性基准测试。该数据集包含2456个测试实例,每个实例都包含一个安全问题及其后续的追问。通过融入对抗性技术,该数据集提升了问题的复杂性,并通过多轮对话有效地模拟了真实世界用户场景。这一基准测试用于评估三种关键能力:传统安全性、负责任的人工智能以及指令攻击防御能力。
The SuperCLUE-Safety dataset is a specialized benchmark for safety testing in multi-turn adversarial dialogues designed for large-scale Chinese language models. Comprising 2,456 test instances, each instance contains a security issue and subsequent follow-up questions. By integrating adversarial techniques, the dataset enhances the complexity of the issues and effectively simulates real-world user scenarios through multi-turn dialogues. This benchmark is used to evaluate three critical capabilities: traditional security, responsible AI, and instruction attack defense.
SuperCLUE-Safety 数据集概述
数据集简介
SuperCLUE-Safety是一个中文大模型多轮对抗安全基准,旨在评估生成式大模型在安全和负责任内容生成方面的能力。该基准通过对抗性技术、多轮交互测试和全面的安全维度覆盖,解决了当前安全类基准存在的挑战性低、限于单轮测试和衡量维度窄的问题。
数据集特点
- 融合对抗性技术:提升安全类问题的挑战性,识别模型在不良诱导、恶意输入下的安全防护能力。
- 多轮交互测试:支持多轮场景测试,更接近真实用户场景。
- 全面衡量安全防护能力:涵盖传统安全类问题、负责任人工智能和指令攻击三大领域。
能力评估与维度
三大能力
- 传统安全类:关注模型是否遵守基本的道德和法律标准,包括辱骂、违法犯罪、隐私和身心健康等。
- 负责任人工智能:关注模型是否能与人类价值观对齐,包括环境友好、弱势群体友好等社会责任。
- 指令攻击:关注模型是否能抵御通过特定提示词或输入绕过安全防护的攻击。
测评方法
- 通过开放式问题(主观题)进行测试。
- 使用专门的安全模型对回答进行安全打分(0-2分)。
题目数量和分布
- 总共4912个题目(2456对题目),每个题目都有问题及追问。
- 三大能力包含20+个子维度,每个子维度使用80-120对题目进行测评。
典型维度与示例
传统安全
- 财产隐私
- 违法犯罪
- 身体伤害
负责任人工智能
- 遵纪守法
- 社会和谐
- 心理学
指令攻击
- 反面诱导
- 目标劫持
- 不安全指令主题
模型与榜单
SC-Safety安全总榜
- 排名前列的模型包括BlueLM(vivo)、AndesGPT(OPPO)、Yi-34B-Chat(零一万物)等。
- 国内闭源模型在安全总榜上表现优于开源模型。
SC-Safety传统安全类榜
- 文心一言4.0(百度)排名第一。
- 国内模型在传统安全类榜上有明显优势。
SC-Safety负责任人工智能榜
- BlueLM(vivo)排名第一。
- 国内模型在负责任人工智能榜上表现优异。
SC-Safety指令攻击榜
- BlueLM(vivo)排名第一。
- 国内模型在指令攻击榜上表现较好。
局限性
- 维度覆盖:存在长尾效应,后续考虑添加更多维度。
- 模型覆盖:尚未纳入所有新模型(如豆包、混元)。
- 自动化评估误差:自动化评估的准确率有待进一步提高。
阅读材料




