TRACE
收藏资源简介:
TRACE是一个用于大型推理模型安全评估的证据基础基准数据集,包含5000条JSONL记录,每条记录包括用户提示、模型推理轨迹、最终响应以及基于证据的安全标注。数据集涵盖英语和中文,用于支持对大型推理模型的安全性评估研究。
TRACE is an evidence-based benchmark dataset for safety evaluation of large reasoning models. It contains 5000 JSONL records, where each record consists of user prompts, model reasoning trajectories, final responses, and evidence-based safety annotations. The dataset covers both English and Chinese, and is intended to support safety evaluation research on large reasoning models.
TRACE 数据集详情
TRACE(An Evidence-Grounded Benchmark for Safety Evaluation of Large Reasoning Models)是一个面向大型推理模型(LRMs)安全评估的、基于证据的基准数据集,由配套论文支持,用于研究推理模型在提示词、推理轨迹和最终响应三个层面的安全性。
数据集构成
数据集包含 5,000 条 JSONL 格式记录,按语言和模型家族分为三个文件:
| 文件 | 语言 | 模型家族 | 记录数 |
|---|---|---|---|
TRACE_EN_Gemma4.jsonl |
英文 | Gemma 4 | 2,000 |
TRACE_EN_Qwen3.jsonl |
英文 | Qwen 3 | 2,000 |
TRACE_ZH_Qwen3.jsonl |
中文 | Qwen 3 | 1,000 |
每条记录包含一个用户提示词、对应的推理轨迹和最终响应,以及对提示词、推理轨迹和最终响应三者的安全标签。数据以 JSON Lines 格式存储,每行一个 UTF-8 JSON 对象,可通过 HuggingFace datasets 库加载(load_dataset("zywu/TRACE", split="train"))。
数据记录结构
每条记录包含以下字段:
- user_prompt:用户输入的提示词。
- lrm_response:包含
reasoning_trace(模型推理过程)和final_response(模型最终回答)两部分。 - user_prompt_safety:提示词安全标注,含
evidence(支撑证据文本片段列表)、risk_category(风险类别)和is_safe(是否安全)。 - attack_method_detection:检测到的攻击方法(
attack_method)。 - reasoning_trace_safety:推理轨迹安全标注,含
evidence和is_safe。 - final_response_safety:最终响应安全标注,含
evidence和is_safe。
其中,evidence 字段包含零个或多个用于支撑安全判断的文本片段;对于安全的用户提示词,evidence 始终为空数组,risk_category 为 None。
提示词风险类别
不安全的提示词被标注为以下九类之一:
Crimes and Illegal Activities(犯罪与非法活动)Hate Speech(仇恨言论)Physical and Mental Health(身心健康)Ethics and Morality(伦理与道德)Data Privacy(数据隐私)Cybersecurity(网络安全)Extremism(极端主义)Risks Involving Minors(涉及未成年人的风险)Inappropriate Suggestions(不当建议)
预期用途
- 评估提示词、推理轨迹和最终响应层面的安全分类器。
- 研究基于证据的推理模型安全评估方法。
- 研究越狱策略与有害性之间的关系。
- 开发安全过滤器、审计流程和红队测试方法。
使用限制与注意事项
- 禁止将数据用于生成、优化或实施有害指令。
- 标签属于研究性标注,不构成法律、临床或政策性判断。
- 数据集包含模型生成的推理轨迹和响应,可能不完整、具有误导性或存在不安全内容,不应视为事实性建议。
- 该数据集故意包含与有害、非法、仇恨、隐私敏感、极端主义、网络犯罪等安全关键主题相关的提示词和模型输出,仅限在受控的研究、评估或安全开发环境中使用。
来源与许可
数据集与论文 "TRACE: An Evidence-Grounded Benchmark for Safety Evaluation of Large Reasoning Models"(arXiv: 2608.24232)相关。底层基准来源及适用的第三方条款在后续使用中仍然具有约束力,用户除遵守本仓库的 Apache-2.0 许可声明外,还需自行负责遵守相关规定。





