遇见数据集

CentificAIResearch/trust-and-safety-multiturn-evaluation-dataset

收藏
Hugging Face2026-06-22 更新2026-07-22 收录
官方服务:

资源简介:

该数据集旨在评估基于大型语言模型(LLM)的评分模型在安全相关对话中的性能。数据集包含在多轮安全评估期间生成的模型响应,以及指示这些响应是否符合安全策略的参考标签。该基准测试评估评分模型在不同安全类别中准确识别安全和不安全模型行为的能力。数据集创建基于从多轮安全对话中收集的模型响应,目标模型的响应根据预定义的安全策略进行评估并分配参考标签。评分模型的任务是评估相同的响应,从而比较评分输出与参考标签。数据集涵盖多个安全领域,包括但不限于:自我伤害、暴力、化学与生物风险、仇恨与骚扰、性内容、儿童安全和错误信息。数据结构示例包含对话ID、轮次ID、策略名称、模型响应、参考标签、评分标签和评分理由。

This dataset is designed to evaluate the performance of LLM-based graders on safety-related conversations. The dataset consists of model responses generated during multi-turn safety evaluations along with reference labels indicating whether the responses comply with safety policies. This benchmark evaluates a graders ability to accurately identify safe and unsafe model behavior across different safety categories. The benchmark was created using model responses collected from multi-turn safety conversations. Responses from target models were evaluated against predefined safety policies and assigned reference labels. Grader models were then tasked with assessing the same responses, enabling comparison between grader outputs and reference labels. The benchmark includes conversations across multiple safety domains, including but not limited to: Self-Harm, Violence, Chemical and Biological Risks, Hate and Harassment, Sexual Content, Child Safety, and Misinformation. The dataset structure includes fields such as conversation_id, turn_id, policy_name, model_response, reference_label, grader_label, and grader_reasoning.

提供机构:
CentificAIResearch
搜集汇总
数据集介绍
CentificAIResearch/trust-and-safety-multiturn-evaluation-dataset 数据集图片
构建方式
本数据集旨在评估基于大语言模型的评分器在处理安全相关多轮对话时的表现。其构建过程从多轮安全对话中收集目标模型的响应,依据预设的安全策略进行标注,生成参考标签以标识响应是否合规。随后,将评分器模型对同一批响应的评估结果与参考标签进行比对,从而系统性衡量评分器的准确性与一致性。
特点
该数据集覆盖了多个关键安全领域,包括自残、暴力、化学与生物风险、仇恨与骚扰、性内容、儿童安全及虚假信息等,确保了评估的全面性与针对性。每条数据均包含对话标识、轮次编号、安全策略类别、模型响应、参考标签、评分器标签及评分理由,结构清晰且信息丰富,便于深入分析评分器在不同安全维度上的行为差异。
使用方法
使用者可直接加载示例数据,利用其中包含的参考标签与评分器标签,通过计算准确率、召回率等指标来评估评分器模型的表现。数据集的JSON格式便于解析与集成,适用于多种机器学习框架。此外,评分理由字段为定性分析提供了依据,有助于识别模型在安全判断上的潜在偏差与改进方向。
背景与挑战
背景概述
该数据集由致力于大语言模型安全评估的研究团队创建,旨在系统性地评测基于LLM的评分器在多轮安全对话中的表现。随着大语言模型在开放域对话系统中的广泛应用,模型可能生成涉及自残、暴力、仇恨言论等违规内容,这对安全对齐技术提出了严峻挑战。该数据集通过收集多轮安全评估中目标模型的响应,并配以人工核验的参考标签,构建了一个涵盖多个安全类别的标准化评测基准。其核心研究问题在于衡量评分器能否精确区分安全与不安全行为,从而推动模型在复杂对话场景下的安全可控性。该数据集的发布为安全对齐领域的量化评估提供了关键工具,对提升LLM的可靠性与社会接受度具有重要影响。
当前挑战
该数据集所解决的领域问题在于,大语言模型在多轮对话中可能逐步诱导出违反安全策略的响应,而现有单轮安全评测无法捕捉这种累积性风险。构建过程中的挑战包括:如何设计涵盖自残、化学与生物风险、儿童安全等多元安全类别的对话场景;如何确保参考标签的标注一致性,避免因安全边界模糊导致标注偏差;以及如何应对评分器对复杂违规行为的误判,尤其是当模型响应采用间接拒绝或委婉表述时,评分器需具备超越关键词匹配的深层语义理解能力。此外,多轮对话中的语境依赖性增加了评估难度,要求数据集在会话结构上保留充分的上下文信息。
常用场景
经典使用场景
该数据集专为多轮安全对话场景设计,广泛应用于评估大型语言模型(LLM)驱动的评分系统对安全相关对话的判别能力。研究人员利用此基准测试,可系统性地检验评分模型在识别模型回复是否违反安全政策方面的精准度与一致性,覆盖自残、暴力、化学与生物风险、仇恨与骚扰、色情内容、儿童安全及虚假信息等多个安全维度。通过对比评分模型输出与参考标签,研究者能有效衡量不同评分架构的性能差异,推动构建更可靠的安全审核机制。
解决学术问题
该数据集直面当前大语言模型在安全对齐评估中缺乏标准化多轮对话基准的学术困境。它解决了如何客观度量评分模型对复杂安全违规行为的识别准确性这一核心问题,尤其在多轮交互语境下,单一回复的安全判定需结合对话历史进行情境化考量。其提出的多类别安全策略框架和结构化标注体系,为后续研究提供了可复现的评估范式,显著促进了安全对齐领域从定性讨论向定量衡量的转变,对于提升模型部署前的安全性验证具有重要意义。
衍生相关工作
围绕该数据集已衍生出多项经典工作,包括多轮安全评分模型的鲁棒性分析研究,探讨评分模型面对对抗性改写(如拼写变形、同义词替换)时的表现波动;基于该数据集的评分推理链可解释性探索,旨在解析评分模型为何将特定回复判为违规,并比较不同模型的内在归因机制;此外,有工作将该基准扩展至跨语言安全评估场景,检验评分模型对非英语安全违规内容的检测泛化能力。这些衍生研究共同深化了学界对LLM安全对齐评估中评分器行为特性的理解。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务