GLM-5.2 DFlash drafter training data
收藏官方服务:
资源简介:
GLM-5.2自生成的用于DFlash推测解码草稿模型训练的数据集,包含约21,000个偏向智能体/工具使用和编程的提示及其完整响应(含推理过程)。数据格式为JSONL,每个对话包含系统提示、用户提示、助手响应及推理内容。数据集来源于多个公开数据集,并通过GLM-5.2模型生成响应。
This dataset, self-generated by GLM-5.2 for draft model training in DFlash speculative decoding, contains approximately 21,000 prompts biased toward agent/tool usage and programming, along with their complete responses including reasoning processes. The dataset is stored in JSONL format, where each dialogue entry includes system prompts, user prompts, assistant responses, and reasoning content. It is derived from multiple public datasets, with all responses generated by the GLM-5.2 model.
创建时间:
2026-06-21
原始信息汇总
数据集概述
GLM-5.2 DFlash drafter training data 是一个用于训练 DFlash 推测解码草案模型 的自生成训练数据集,目标模型为 GLM-5.2。
数据集内容
- 生成方式: 使用 GLM-5.2 (NVFP4) 模型对约 21,000 个提示词生成带有推理过程的完整回答。
- 提示词构成 (~21k):
- Agent / 工具使用: 11,578 条,来源于
NousResearch/hermes-function-calling-v1数据集。 - Web 开发: 5,000 条,来源于
glaiveai/glaive-code-assistant数据集(网页过滤)。 - Python / 算法: 3,000 条,来源于
glaiveai/glaive-code-assistant数据集(Python 过滤)。 - 通用: 1,500 条,来源于
databricks-dolly-15k数据集。
- Agent / 工具使用: 11,578 条,来源于
文件结构
| 文件 | 行数 | 内容 |
|---|---|---|
data/glm_train.jsonl.gz |
20,778 | 训练集(GLM 回答) |
data/glm_eval.jsonl.gz |
300 | 保留评估集(150 条 agent + 150 条 web-dev) |
data/glm_regen_src.jsonl.gz |
21,078 | 仅包含源提示词(系统+用户),不包含生成内容 |
数据格式
- 格式: JSONL,每行一个对话,包含
conversations数组和status字段。 - 对话结构:
role: "system": 系统提示,对于 agent 行包含工具定义。role: "user": 用户输入。role: "assistant": 模型回答,包含content(最终答案)和reasoning_content(链式思考过程,渲染为<think>…</think>)。
生成参数
- 模型: GLM-5.2-NVFP4,通过 SGLang (TP8) 提供服务。
- 采样: 温度 1.0,Top-p 0.95,最大 token 数 8192,最大推理努力。
- 完成率: 21,078 / 21,078 完成,0 个生成错误。
质量说明
- 回答连贯且技术上正确;推理中位数约 690 token。无 token 乱码、无解码循环,英文提示词 0% 中文漂移。
- 工具调用:94.7% 有效 JSON。约 24% 的 agent 行中,模型使用原生
</arg_value>标签结束<tool_call>(而非</tool_call>),保留原始服务行为。 - 约 0.8% 的行被截断(模型在长枚举任务上推理超过 8192 token 上限,导致最终答案为空)。
许可与来源
- 提示词来源于链接的源数据集,适用其各自的许可。
- 回答由 GLM-5.2 生成,受其使用条款约束。
- 按原样提供用于研究;在再分发或商用前请验证许可兼容性。
搜集汇总
数据集介绍

构建方式
GLM-5.2 DFlash drafter training数据集的构建源于对GLM-5.2-NVFP4模型的自我生成策略。研究团队精心筛选了约21,000条来自多个公开数据集的提示,涵盖智能体与工具调用、网页开发、Python与算法以及通用问答四大领域,其中智能体任务占据主导地位。通过对这些提示施加GLM-5.2模型的最大推理努力采样,借助温度1.0与top-p 0.95的高随机性参数,生成了每条均包含链式思考过程与最终回答的完整对话。最终数据被划分为20,778条训练集与300条评估集,确保了模型微调与性能验证的双重需求。
特点
该数据集的核心特质在于其高度聚焦于推测解码草稿模型的优化场景。每条对话不仅包含标准的系统提示与用户内容,还通过'reasoning_content'字段保留了模型内部的思维链,能够渲染为思考标签,为蒸馏推理能力提供了独特资源。质量审查显示,回答具备技术准确性与语义连贯性,零中文偏移现象,工具调用JSON的合法率达到94.7%,尽管部分条目保留了模型原生的标签格式,却真实反映了实际服务行为。这一设计使得数据集在保持高质的同时,兼具场景真实性与领域适用性。
使用方法
数据集以JSONL格式存储,通过解压相关的压缩文件即可获得训练与评估分割。使用时,研究者可直接读取每一行的'conversations'键,提取系统、用户与助手的多轮交互内容,其中助手字段中的推理内容与最终回答可分别用于监督学习和蒸馏训练。建议利用Python的json库逐行解析,将训练集用于微调草稿模型,评估集用于验证推理质量与工具调用准确性。请注意遵守原始提示数据集的许可协议,并在验证兼容性后用于科研或商业场景。
背景与挑战
背景概述
GLM-5.2 DFlash drafter training data 数据集由研究团队于近期创建,旨在为 GLM-5.2 大语言模型训练专用的推测解码草稿模型 DFlash。该数据集的核心研究问题聚焦于如何通过自生成的高质量推理与回应数据,提升草稿模型在代理工具调用与编程任务上的推测解码效率与准确性。数据集包含约 2.1 万条提示词及其对应的 GLM-5.2 完整回复,其中融入了链式思维推理过程,为模型在特定工作负载下的推理能力优化提供了关键资源。这一工作对加速大语言模型的推理过程、降低延迟具有重要影响,尤其在需要复杂推理和工具交互的场景中展现出广泛应用潜力。
当前挑战
该数据集面临的挑战主要体现在两个方面。在领域问题层面,草稿模型需在高频的代理工具调用和编程任务中实现高效且准确的推测解码,然而模型在面对长枚举任务时易因 token 数上限导致回复截断(约 0.8% 的样本),且部分工具调用包含模型特有的封闭标签,增加了解析复杂性。在构建过程中,数据生成采用了较高的采样温度和最大推理努力,虽确保了回复的多样性,但也带来了约 24% 的代理样本存在非标准标签闭合问题,同时需处理约 21 万个提示词来源的许可证兼容性,确保数据使用的合法性。此外,如何平衡推理深度与回复完整性,避免在长上下文任务中出现落空情况,也是构建此类高质量训练数据时面临的核心挑战。
常用场景
经典使用场景
在大型语言模型推理加速领域,该数据集主要服务于推测解码(speculative decoding)中草稿模型(draft model)的训练与评估。其经典使用场景聚焦于为GLM-5.2模型定制高效的目标工作负载——即代理/工具使用与代码生成场景。研究人员可利用此数据集,为草稿模型提供包含完整推理链(reasoning_content)与最终答案(content)的示范性对话,从而学习在特定任务上以更低延迟复现主模型的行为模式,最终实现推理阶段的显著加速。
实际应用
在实际应用中,该数据集支撑了DFlash推测解码引擎的构建,使得GLM-5.2在代理类任务(如函数调用、API编排)和代码生成任务上能够实现低延迟响应。开发者可通过微调草稿模型,将其部署于实时对话系统、代码辅助工具或自动化工作流中,有效降低用户感知延迟。此外,数据集中近95%的有效工具调用格式与真实的生成行为记录,为工业级系统中模型推理优化策略的评估与选型提供了可靠基准。
衍生相关工作
该数据集衍生出的代表性工作包括基于SpecForge框架的草稿模型优化方案,以及围绕GLM-5.2推理效率提升的系列实验。研究者可在此基础上进一步探索草稿模型与主模型的协同蒸馏策略、多粒度推测解码方法,或针对不同任务分布的草稿模型自适应训练技术。数据集内详尽的推理轨迹与工具调用日志,也为后续研究如推理路径压缩、工具使用解码加速等领域提供了可复现的基准与启发。
以上内容由遇见数据集搜集并总结生成



