C-SafeQA
收藏官方服务:
资源简介:
一个用于大语言模型及自动化安全裁判的响应级中文安全评估的、基于策略的基准数据集。
A policy-based benchmark dataset for response-level Chinese safety evaluation of large language models (LLMs) and automated safety referees.
创建时间:
2026-08-31
原始信息汇总
数据集概述
C-SafeQA 是一个针对中文安全评测的基准数据集,核心目标是评估七个自动安全审查模型(safety judges)在四个目标语言模型生成内容上的安全判定能力。该数据集以“谁来判断审查者”为核心理念,强调参照安全政策对模型响应级别进行安全评估。
数据集规模与结构
数据集共包含 37,660 条已评估的“查询—响应”记录,分为两个部分:
- Base 分区:2,152 条记录,由 538 个基础查询与四个目标语言模型的响应配对构成。
- Transformed 分区:35,508 条记录,覆盖对基础查询进行的 21 种受控变换后生成的对抗性响应用例。
构建方式
- 538 个基础提示词覆盖 269 个风险点,每个风险点通过两种形式表达:直接请求有害输出的显式提示词,以及旨在诱导有害内容的陈述性或暗示性提示词。
- 通过 9 种仅作用于单一形式的变换和 12 种同时作用于两种形式的变换,为每个目标模型生成 8,877 个对抗性提示词,四个模型共计产生 35,508 条变换记录。
- 所有提示词均有意设计为诱导有害内容,但参考标签仅基于模型的响应进行判定:模型拒绝或安全转导的响应可标记为“安全”,生成或实质促使伤害的响应标记为“不安全”,模糊情况标记为“存疑”。
评估对象
- 被评估的安全审查模型:Llama Guard 4、MD-Judge、NeMoGuard、PolyGuard、Qwen3Guard、WildGuard 和 XGuard。
- 被评估的目标语言模型:DeepSeek-V3.2、Kimi-K2.5、MiniMax-M2.5 和 Qwen3.5-397B-A17B。
参考标签与评估说明
- 参考标签空间为:安全(Safe)、不安全(Unsafe) 和 存疑(Disputed)。
- 二分类评估指标不包含标有“存疑”的参考记录。
- 审查模型输出标记为“非可归一化(non_normalizable)”的记录被排除在二分类指标之外,并作为覆盖率限制因素报告。
- 归一化状态仅表示输出是否可映射,本身不是安全判定结论。
使用与获取
- 数据集代码已在 GitHub 仓库(Apache License 2.0)中发布,包含七个审查模型的推理运行脚本。
- 数据集本身在 Hugging Face 平台单独发布,许可证为 CC BY-NC 4.0,需通过访问申请流程获取。
- 数据集以
base分区和每个目标模型对应的变换分区形式提供。 - 所有审查模型的推理运行均采用温度为零的确定性解码方式,可复现已发布的推理过程。
合理使用说明
该数据集仅用于安全分类器的评估与研究,不得用作生成有害内容的训练集,不得替代法律或政策审查,也不得作为模型可安全部署的证据。数据集以中文为焦点,反映出其文档化的分类体系和标注过程,可能包含标注错误、模型特定伪影、文化假设以及合成或对抗性模式。
搜集汇总
数据集介绍

构建方式
C-SafeQA数据集由某安全实验室精心构建,旨在为中文场景下的响应级安全评估提供基准。其构建核心基于538个基础查询,覆盖269个风险点,每个风险点均以直接请求与陈述诱导两种形式呈现,以充分探索模型的潜在有害输出。在此基础上,通过21种受控查询变换扩展出8,877个对抗性查询,并与四个目标语言模型(DeepSeek-V3.2、Kimi-K2.5、MiniMax-M2.5、Qwen3.5-397B-A17B)的响应配对,形成37,660条查询-响应对。所有提示均被设计为诱导有害内容,但参考标签仅依据模型响应进行标注,即拒绝或安全重定向可标记为安全,而实际生成或助长危害的输出则视为不安全,存疑情形标记为存疑。
使用方法
该数据集使用便捷且流程受控。用户首先需向Hugging Face提交访问申请,获批后通过`datasets`库加载数据,即可获取基础分割及各目标模型对应的变换分割。数据集提供了七个裁判模型的推理脚本,用户可输入JSON格式的提示与响应数据,复现安全评判结果。评判采用确定性解码(温度设为0),确保可复现性。基准的评估注释明确界定标签空间,并排除了存疑与无法规范化输出的影响。该数据集被严格限定于安全评估与分类器研究,禁止用于生成有害内容或作为模型部署安全的证明,使用时需遵循CC BY-NC 4.0许可协议。
背景与挑战
背景概述
随着大语言模型在中文语境中的广泛应用,其内容安全评估成为亟待解决的重大课题。C-SafeQA数据集由长三角安全人工智能安徽省实验室于2026年创建,旨在系统性地评估七个自动化安全评判器(如Llama Guard 4、Qwen3Guard等)在四个目标模型(如DeepSeek-V3.2)上的响应安全性。该数据集包含538个基础查询及超过3.7万个查询-响应对,覆盖269个风险点,并设计了多种对抗性转换,为中文安全评估提供了基准。它通过评判器输出的归一化状态与参考标签(安全、不安全、有争议)之间的比对,为模型合规性评测和风险识别提供了重要支撑,在学术界与工业界均展现出显著影响力。
当前挑战
C-SafeQA数据集的构建面临多重挑战。在领域层面,大语言模型可能生成多样且隐蔽的有害内容,传统基于提示的评估难以捕捉响应级风险,且不同安全评判器在标签定义、敏感度及覆盖范围上存在差异,导致评估结果不一致;此外,对抗性攻击手段的不断演进要求基准持续更新,同时需平衡安全性与模型实用性。在构建过程中,数据生成需精心设计以诱发安全风险,但存在误分类与标签噪声的问题;确保参考标签的客观性极为困难,尤其是在涉及模糊边界(如Disputed案例)时,需依赖人工审核,成本高昂且难以规模化;此外,多模型、多评判器的交叉评估带来了数据规模与算力的大幅需求,并与版权及合规性约束形成矛盾,这些都构成了实现可靠安全评估的显著挑战。
常用场景
经典使用场景
C-SafeQA作为面向中文场景的响应级安全评估基准,其经典使用场景聚焦于对七种自动化安全审核器(如Llama Guard 4、Qwen3Guard等)在四款目标大语言模型生成内容上的判别能力进行系统性检验。数据集包含538个基础查询及经21种受控变换衍生的8,877个对抗性提示,共计37,660条查询-响应记录,每条记录依据政策框架标注为安全、不安全或争议。学者可借此复现安全审核器的推理过程,评估其在面对精心设计的越狱攻击时的稳健性与准确性,从而推动安全评估方法论的发展。
解决学术问题
该数据集有效解决了当前大语言模型安全评估领域缺乏统一、精细化响应级基准的学术痛点。区别于仅关注提示危害性的传统数据集,C-SafeQA强调标签源自模型响应,允许在有害提示下出现安全应答,还原真实交互语境中的判断复杂性。其风险分类与国家标准的对齐、细粒度标签体系及多维度对抗变换设计,为量化安全审核器性能、比较不同审核算法优劣、挖掘误判与漏判模式提供了坚实数据基础,促进了安全评估从粗粒度分类向政策驱动、语义敏感的方向演进。
实际应用
在产业实践中,C-SafeQA深度嵌入安全评估平台,支撑模型备案、合规自测、监管评测、选型验收及研发验证等关键环节。平台依托该数据集的丰富风险知识与红队攻击方法,实现了自动化评估准确率超95%,高效召回模式可将人工评估效率提升逾85%。此基准正服务于办公、汽车等多行业的大模型安全治理,通过一键式评估、定向风险复测与报告分析,助力企业精准定位模型脆弱点,加速安全迭代,确保生成式AI产品在合规框架内可靠落地。
数据集最近研究
最新研究方向
在大语言模型安全评估领域,随着模型能力与部署场景的持续拓展,确保AI系统的响应安全已成为全球关注的焦点。C-SafeQA基准的发布恰逢其时,其核心贡献在于提出了一个策略导向(policy-grounded)的响应级安全评估框架,旨在审视并提升安全评判器的可靠性,即“谁评判评判者”的深刻命题。该数据集通过精心设计的538条基础提示(涵盖269个风险点)及经由21种受控变换衍生出的8,877条对抗性提示,系统检验了七个前沿安全评判器在应对四个目标模型生成内容时的性能。评判标准严格基于模型响应而非提示本身,为安全评估提供了更贴合实际应用的标尺。其附带的实验室安全评估平台,已积累超过十万条高质量测试用例,并实现自动化评估在平衡模式下达95%以上准确率,显著提升了人工复核效率,正为办公、汽车等行业的大模型合规与安全治理提供关键基础设施。这一工作凸显了建立可信、动态安全基准在预警和化解AI风险中的紧迫性与战略意义。
以上内容由遇见数据集搜集并总结生成



