遇见数据集

C-SafeQA

收藏
arXiv2026-09-01 更新2026-09-03 收录
官方服务:

资源简介:

C-SafeQA是一个面向中文安全评估的响应级基准数据集,由安徽火花盾智能科技、科大讯飞、北京大学、上海创新研究院和上海人工智能实验室联合创建,旨在严格区分查询风险与响应违规,为评估大语言模型输出安全性与自动化安全裁判的可靠性提供统一标尺。该数据集包含538条基础查询和8,877条对抗性查询,由四个全模型LLM分别回答生成总计37,660条查询-响应记录,每条记录经多模型共识投票与分层专家盲审获得安全、不安全或有争议的三类标签。数据集构建过程基于内部安全政策分解的269个风险点,人工撰写基础查询并应用21种中文对抗变换方法扩展,确保政策可追溯性与攻击多样性。C-SafeQA可用于评估目标LLM在多种风险类别和攻击条件下的安全表现,以及审计自动化安全裁判的召回率、误报率等指标,揭示安全评估中模型与裁判的双重局限性。

C-SafeQA is a response-level benchmark dataset for Chinese safety evaluation, jointly developed by Anhui SparkShield Intelligent Technology, iFLYTEK, Peking University, Shanghai Innovation Research Institute, and Shanghai AI Laboratory. It aims to strictly differentiate between query risks and response violations, providing a unified benchmark for evaluating the safety of large language model (LLM) outputs and the reliability of automated safety referees. This dataset includes 538 base queries and 8,877 adversarial queries. A total of 37,660 query-response pairs were generated by having four full-model LLMs independently answer each query. Each record is assigned one of three labels—safe, unsafe, or controversial—through multi-model consensus voting and hierarchical expert blind review. The dataset construction process is based on 269 risk points decomposed from internal safety policies. Base queries were manually authored and expanded using 21 Chinese adversarial transformation methods, ensuring policy traceability and attack diversity. C-SafeQA can be used to assess the safety performance of target LLMs across diverse risk categories and attack scenarios, as well as audit metrics of automated safety referees such as recall rate and false positive rate, uncovering the dual limitations of both models and referees in safety evaluation.

创建时间:
2026-09-01
搜集汇总
数据集介绍
C-SafeQA 数据集图片
构建方式
C-SafeQA数据集的构建以内部安全策略为基石,将策略精细分解为269个风险点,每个风险点均以疑问句与陈述句两种形式实例化,生成538条基础中文查询。为确保覆盖的广度与深度,研究团队进一步设计了21种对抗性转换方法,涵盖模板、LLM改写及程序化生成三大渠道,系统性地将基础查询扩充至8,877条对抗性查询。此过程严格遵循语义保持、机制明确与诊断可解释三重质量约束,并经过专家评审以确保查询的政策关联性与语言自然度。随后,四种全量LLM部署在统一配置下对全部查询生成响应,共计37,660条查询-响应对。参考标签的生成融合了共识感知的多模型裁决与分层盲审专家复核,最终为每项记录赋予安全、不安全或存疑的三类响应级标签。
特点
C-SafeQA的核心特色在于其政策锚定与响应级导向的设计哲学,明确区分了查询级风险与响应级违规,避免了仅凭查询表面特征推断安全性的局限。数据集包含538条基础查询与8,877条对抗性查询,规模可观且结构化的分层使得细粒度分析成为可能。每一项查询-响应记录均通过多模型共识与专家盲审双重保障,获得可靠的三类参考标签,其中存疑标签的保留体现了对标注不确定性的诚实呈现。21种对抗性转换方法均带有明确的机制标签,支持对模型鲁棒性进行溯源式诊断。此外,数据集支持双重评估目标,既可衡量目标LLM的安全行为,亦能审计自动化安全评判者的可靠性,为安全评测提供了独特的双重视角。
使用方法
C-SafeQA设计了两条互补的应用路径,其一聚焦于目标LLM的安全行为度量,研究者可利用基础查询与对抗性查询集,依据安全响应率等核心指标,对模型在各类风险情境下的表现进行系统评估,并深入分析不同攻击转换方式及风险类别对模型安全性的影响。其二则着眼于自动化安全评判者的审计,通过将七个评判模型的预测与政策锚定的参考标签相对照,可计算召回率、误报率等性能指标,从而揭示评判者在不同攻击条件下的能力边界与权衡特性。数据集提供了完整的原始记录、规范化输出及详细的元数据,搭配开源代码中的完整性验证工具与评判模型运行脚本,便于研究者在统一框架下复现实验、验证结果并开展拓展性研究。
背景与挑战
背景概述
随着大语言模型(LLM)在中文问答场景中的广泛应用,其安全性评估成为关键议题。然而,传统安全基准多聚焦于用户查询的风险程度,忽视了模型响应的实际合规性。C-SafeQA 数据集由科大讯飞旗下安徽星火智安科技的研究人员于2026年创建,旨在解决这一空白,构建了一个基于策略的中文响应级安全评估基准。该数据集包含538条基础查询和8,877条对抗性查询,由四个全量LLM生成37,660条查询-响应对,并经多模型裁决与专家审计标注。C-SafeQA 致力于区分查询风险与响应违规,同时审计七种自动安全评审模型的可靠性,已发表于arXiv,并公开了数据集和代码,对中文内容安全评估领域产生了重要影响。
当前挑战
C-SafeQA面临的挑战涵盖领域与构建两个层面。领域挑战在于,中文有害内容表达形式多样,常通过口语化措辞、谐音、字词替换、语义反转或结构化文本等手段遮掩风险意图,现有基准难以从响应级别准确评估安全性,且自动评审模型存在固有缺陷,其自身评判的可靠性尚待验证。构建挑战则需在保证查询覆盖多样风险场景的同时,建立从策略到数据的可追溯映射;需设计21种攻击转换方法生成对抗性查询,并区分查询风险与响应违规;还需在标注过程中平衡可扩展性与不确定性,采用一致感知的多模型裁决和分层专家盲审,确保标签质量,同时管控数据发布边界,防止有害内容被滥用。
常用场景
经典使用场景
C-SafeQA作为面向中文响应级安全评估的策略锚定基准,最经典的使用场景在于对大型语言模型(LLM)生成的问答对进行细粒度安全分级。该数据集精心构筑了涵盖269个风险点、538条基础查询及8,877条对抗性查询的多元语料,并汇集了四款全量模型产生的37,660条查询-响应对。研究者借助此基准,能够系统性地度量目标模型在直接恶意请求与各类对抗变换下的不安全响应率,进而剖析模型在特定风险类别与攻击机制下的脆弱性。此外,该数据集亦被广泛用于审计自动化安全评判模型的可靠性,通过对比七种不同评判系统在统一策略框架下的表现,揭示其在查全率与误报率之间的权衡,为中文语境下的模型安全对齐研究提供了坚实的实验平台。
衍生相关工作
C-SafeQA的前瞻性设计催生了一系列高水平后续研究。在攻击方法学上,其提示词隐藏机制启发了针对古典中文安全约束的对抗性提示优化研究,通过生物启发式搜索策略在难以察觉的语义压缩中探索安全隐患。在评测框架层面,研究者基于其策略锚定与多维评估思想,衍生出面向多语言环境的政策导向安全基准及防护栏系统,该工作将安全策略的跨语言映射融入评测核心,扩展了本数据集的覆盖广度。此外,受其将裁判可靠性视为核心评测对象的启发,后续工作系统剖析了决策配置复杂性对安全基准度量的潜在影响,揭示了评判模型对评判模板的敏感性,进一步确立了安全评测方法论的严谨性方向。
数据集最近研究
最新研究方向
在大型语言模型安全性评估领域,C-SafeQA基准的提出标志着从查询级风险分类向响应级违规判定的范式跃迁。该数据集聚焦于中文有害内容场景中,针对对抗性变换下模型响应安全性的细粒度度量,并创新性地将自动化安全评委的可靠性纳入审计范畴。其前沿研究方向体现在双轨评估机制:一方面,通过21种机制标签化的对抗变换,系统揭示靶模型在角色扮演、表示重构及跨语言等攻击维度下的脆弱性差异;另一方面,对七种主流安全评委实施统一基准审计,识别其在藏头诗、编码等隐蔽语义中的召回盲区与误报权衡。该工作还首创了策略指涉的构建流程,将269个风险点与538条基础查询严格映射,辅以协议感知的模型裁决与分层专家盲审,确保了标注的多义性透明。这种响应级、策略对齐的评测范式,不仅细化了安全意识测量的粒度,更推动了安全评估从静态风险识别向动态交互合规的深层演进,为多语言安全基准树立了方法学参照。
相关研究论文
  • 1
    Who Judges the Judges? A Chinese Safety QA Benchmark for Evaluating LLM Responses and Safety Judges安徽火花盾智能科技; 科大讯飞; 北京大学; 上海创新研究院; 上海人工智能实验室 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务