遇见数据集

TRACE

收藏
github2026-08-29 更新2026-08-30 收录
数据链接:
官方服务:

资源简介:

TRACE是一个用于大型推理模型安全评估的证据基础基准数据集,包含5000条JSONL记录,每条记录包括用户提示、模型推理轨迹、最终响应以及基于证据的安全标注。数据集涵盖英语和中文,用于支持对大型推理模型的安全性评估研究。

TRACE is an evidence-based benchmark dataset for safety evaluation of large reasoning models. It contains 5000 JSONL records, where each record consists of user prompts, model reasoning trajectories, final responses, and evidence-based safety annotations. The dataset covers both English and Chinese, and is intended to support safety evaluation research on large reasoning models.

创建时间:
2026-08-25
原始信息汇总

TRACE 数据集详情

TRACE(An Evidence-Grounded Benchmark for Safety Evaluation of Large Reasoning Models)是一个面向大型推理模型(LRMs)安全评估的、基于证据的基准数据集,由配套论文支持,用于研究推理模型在提示词、推理轨迹和最终响应三个层面的安全性。

数据集构成

数据集包含 5,000 条 JSONL 格式记录,按语言和模型家族分为三个文件:

文件 语言 模型家族 记录数
TRACE_EN_Gemma4.jsonl 英文 Gemma 4 2,000
TRACE_EN_Qwen3.jsonl 英文 Qwen 3 2,000
TRACE_ZH_Qwen3.jsonl 中文 Qwen 3 1,000

每条记录包含一个用户提示词、对应的推理轨迹和最终响应,以及对提示词、推理轨迹和最终响应三者的安全标签。数据以 JSON Lines 格式存储,每行一个 UTF-8 JSON 对象,可通过 HuggingFace datasets 库加载(load_dataset("zywu/TRACE", split="train"))。

数据记录结构

每条记录包含以下字段:

  • user_prompt:用户输入的提示词。
  • lrm_response:包含 reasoning_trace(模型推理过程)和 final_response(模型最终回答)两部分。
  • user_prompt_safety:提示词安全标注,含 evidence(支撑证据文本片段列表)、risk_category(风险类别)和 is_safe(是否安全)。
  • attack_method_detection:检测到的攻击方法(attack_method)。
  • reasoning_trace_safety:推理轨迹安全标注,含 evidenceis_safe
  • final_response_safety:最终响应安全标注,含 evidenceis_safe

其中,evidence 字段包含零个或多个用于支撑安全判断的文本片段;对于安全的用户提示词,evidence 始终为空数组,risk_categoryNone

提示词风险类别

不安全的提示词被标注为以下九类之一:

  • Crimes and Illegal Activities(犯罪与非法活动)
  • Hate Speech(仇恨言论)
  • Physical and Mental Health(身心健康)
  • Ethics and Morality(伦理与道德)
  • Data Privacy(数据隐私)
  • Cybersecurity(网络安全)
  • Extremism(极端主义)
  • Risks Involving Minors(涉及未成年人的风险)
  • Inappropriate Suggestions(不当建议)

预期用途

  • 评估提示词、推理轨迹和最终响应层面的安全分类器。
  • 研究基于证据的推理模型安全评估方法。
  • 研究越狱策略与有害性之间的关系。
  • 开发安全过滤器、审计流程和红队测试方法。

使用限制与注意事项

  • 禁止将数据用于生成、优化或实施有害指令。
  • 标签属于研究性标注,不构成法律、临床或政策性判断。
  • 数据集包含模型生成的推理轨迹和响应,可能不完整、具有误导性或存在不安全内容,不应视为事实性建议。
  • 该数据集故意包含与有害、非法、仇恨、隐私敏感、极端主义、网络犯罪等安全关键主题相关的提示词和模型输出,仅限在受控的研究、评估或安全开发环境中使用。

来源与许可

数据集与论文 "TRACE: An Evidence-Grounded Benchmark for Safety Evaluation of Large Reasoning Models"(arXiv: 2608.24232)相关。底层基准来源及适用的第三方条款在后续使用中仍然具有约束力,用户除遵守本仓库的 Apache-2.0 许可声明外,还需自行负责遵守相关规定。

搜集汇总
数据集介绍
TRACE 数据集图片
构建方式
TRACE数据集的构建旨在应对大型推理模型(LRMs)在安全评估领域面临的挑战,其设计以证据为核心,将用户提示、模型推理轨迹、最终响应与安全性标注相耦合。数据集包含5000条JSONL格式记录,覆盖英文与中文两种语言,分别源自Gemma 4与Qwen 3模型家族。每一条记录均详细标注了用户提示、推理轨迹及最终响应的安全性,其中安全性判定依托于零个或多个文本片段作为证据支撑,同时针对不安全提示细分出九大风险类别,诸如犯罪活动、仇恨言论、数据隐私等,构建方法严谨且具有层次性。
特点
该数据集的一大特色是强调证据锚定的安全评估机制,即每一项安全判断均以具体文本片段为依据,显著提升了标注的可解释性与可信度。此外,数据集实现了从用户提示到推理轨迹再到最终响应的全链路安全分析,能够精准捕捉模型在推理过程中潜藏的风险,填补了现有基准仅关注最终输出的空白。其多语言设计(英中双语)与多种攻击方法的检测标注,为研究越狱策略与危害性之间的关联提供了宝贵资源,适用于安全分类器训练、红队测试及安全过滤机制研发等场景。
使用方法
使用者可通过Hugging Face数据集加载接口(如load_dataset函数)便捷获取数据,并按照统一schema解析记录。数据集支持多种下游任务,包括评估提示级、推理轨迹级和响应级的安全分类器性能,以及探索证据基元的安全评估方法。使用时需特别注意其内容警告,仅限在受控研究环境中使用,严禁用于优化或生成有害指令。配合Apache-2.0许可,研究者可自由开展学术研究,但须遵守相关限制并妥善引用论文。
背景与挑战
背景概述
随着大型推理模型(LRMs)在复杂任务中的广泛应用,其安全评估成为亟待解决的关键议题。TRACE数据集由Zhenyu Wu等学者于2026年创建,旨在填补现有基准在证据支撑与推理过程安全标注方面的空白。该数据集包含5,000条中英文记录,涵盖Gemma 4与Qwen 3模型家族的推理轨迹、最终响应及基于证据的三级安全标注(提示、推理轨迹、响应),并引入九类风险分类体系,为安全分类器评估、越狱策略研究及红队审计提供了统一平台。其发布为推理模型的安全对齐研究奠定了实证基础,推动了可解释性安全评估方向的发展。
当前挑战
TRACE数据集面临的挑战多维而深刻。领域层面,大型推理模型的安全评测需兼顾推理轨迹的隐秘性、越狱攻击的动态演化及跨语言风险迁移,现有框架难以捕捉多步推理中的渐进越狱与上下文操控;构建过程中,挑战则集中于对抗性提示的生态拟真性与标注一致性,尤其是证据文本的细粒度对齐和风险类别的边界界定,同时需平衡敏感内容控制的伦理约束与数据开放性,加之多模型、多语言的标注差异,使得高质量安全证据链的构建尤为艰巨。
常用场景
经典使用场景
TRACE数据集是专为大型推理模型(LRMs)安全性评估而设计的基准,其典型应用在于对模型生成的推理轨迹与最终响应进行细粒度的安全性标注与验证。该数据集涵盖多语言(英语和中文)、多模型家族(Gemma 4与Qwen 3)的5000条记录,每一条均包含用户提示、推理轨迹、最终响应及其对应的证据锚定安全标签。研究者可依托此数据对提示、推理过程及输出结果进行三级安全性分类,亦可利用攻击方法检测字段剖析越狱策略与危害性的关联机制。其结构化设计支持从单一提示到整条响应链的全面评估,为构建鲁棒性安全评测协议提供了标准化数据基础。
衍生相关工作
该数据集的公开催生了一系列高影响力衍生研究,尤其在证据化安全评测方向上开辟了新范式。后续工作借鉴其三级标注结构,发展出多模态推理安全基准,将证据链思想延伸至视觉与语音输入场景。同时,研究者利用其攻击方法字段,构建了越狱策略分类体系及预测模型,实现对新型攻击模式的预判与防御。更近期的研究将证据锚定机制迁移至模型自我纠错与可解释对齐领域,通过让模型自身生成安全证据来优化推理过程。此外,TRACE的中英双语特性推动了跨语言安全评测研究,使安全对齐从单语环境拓展至全球化应用,相关成果已成为众多AI安全实验室的标准测试集。
数据集最近研究
最新研究方向
TRACE基准的提出标志着大型推理模型安全评估领域迈入证据驱动的新阶段。随着推理模型在复杂任务中展现卓越能力,其思维链可能隐含偏见、恶意诱导或越狱策略,传统仅评估最终输出的方法已显不足。TRACE通过配对用户提示、推理轨迹与最终响应,并引入细粒度的证据标注及多维风险分类,使研究者能够深入剖析不安全行为的源头与传播路径,推动安全分类器向可解释、可追溯的方向演进。这一方向与AI安全治理热点相呼应,为红队测试、内容审核及合规审计提供了关键基础设施,其双语跨模型设计亦促进了全球协同的鲁棒安全评估体系构建。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务