遇见数据集

english-flow-drafter-prompts

收藏
Hugging Face2026-09-16 更新2026-09-17 收录
官方服务:

资源简介:

该数据集是用于 Chained-Flow 框架中 Flow-Drafter 训练的英语 prompts 集合,专门为 Qwen3.5-4B/9B/27B 模型设计。数据集仅包含 prompts,不包含模型输出,drafter 的训练基于目标模型在 prompts 上的 hidden states。数据集共包含 33,777 条 prompts,总计 4,737,781 个 token,分为两个版本(v1 和 v2)。v1 包含 19,672 条训练 prompts 和 500 条保留 prompts,来源包括 Databricks Dolly(通用指令)、GSM8K(小学数学)、Python 代码指令、Nemotron Math(数学推理)和 Nemotron STEM(科学)数据集。v2 新增 14,105 条训练 prompts 和 500 条保留 prompts,来源包括 CNN/DailyMail(摘要)、UltraChat 200K(多轮对话)、No Robots(人工指令)、WritingPrompts(创意写作)和 OPUS Books(翻译)。所有 prompts 均已使用 Qwen3.5 的聊天模板进行格式化(需直接使用,不可重新模板化),并以 JSON Lines 格式存储,每行一个 JSON 对象,包含 prompt 字段(字符串)和 prompt_tokens 字段(整数,由 Qwen3.5-27B tokenizer 计算)。注意,v2 的训练混合为 v1 加 v2 而非仅 v2,两个版本的 prompts 互不相交。数据集中 Nemotron STEM 部分经过内部去重,仅保留 569 条训练 prompts 和 100 条保留 prompts,以反映真实 prompt 多样性。该数据集适用于 speculative decoding 场景下的 drafter 训练任务。

This dataset is a collection of English prompts designed for training Flow-Drafter in the Chained-Flow framework, specifically for the Qwen3.5-4B/9B/27B models. It contains only prompts (no model outputs), and the drafter is trained based on the target models hidden states on these prompts. The dataset consists of 33,777 prompts totaling 4,737,781 tokens, divided into two versions (v1 and v2). v1 includes 19,672 training prompts and 500 held-out prompts from sources such as Databricks Dolly (general instruction), GSM8K (elementary math), Python code instructions, Nemotron Math (mathematical reasoning), and Nemotron STEM (science). v2 adds 14,105 training prompts and 500 held-out prompts from CNN/DailyMail (summarization), UltraChat 200K (multi-turn dialogue), No Robots (human instructions), WritingPrompts (creative writing), and OPUS Books (translation). All prompts are formatted using Qwen3.5s chat template (must be used directly, not re-templated) and stored in JSON Lines format, with each line containing a JSON object with a prompt field (string) and a prompt_tokens field (integer, computed by the Qwen3.5-27B tokenizer). Note that the v2 training mixture is v1 plus v2, not just v2, and the prompts in the two versions are disjoint. The Nemotron STEM subset has been internally deduplicated, retaining only 569 training prompts and 100 held-out prompts to reflect real prompt diversity. The dataset is suitable for drafter training tasks in speculative decoding scenarios.

创建时间:
2026-09-15
原始信息汇总

数据集概述

基本信息

  • 数据集地址:https://huggingface.co/datasets/ytu-ce-cosmos/english-flow-drafter-prompts
  • 许可证:apache-2.0
  • 语言:英语(en)
  • 任务类别:text-generation(文本生成)
  • 标签:speculative-decoding、english、prompts

数据集用途

用于训练英语 Flow-Drafter 检查点(针对 Qwen/Qwen3.5-4B / 9B / 27B)的对话模板化英语提示词(prompts)。

  • 仅包含提示词,不包含补全内容。Drafter 在目标模型自身的隐藏状态上进行训练,因此补全内容通过在这些提示词上运行目标模型在本地生成。数据集中没有任何模型输出。

数据划分

划分 行数 提示词 token 数 内容说明
v1/ 19,672 训练 + 500 留出 1,518,620 原始混合数据
v2/ 14,105 训练 + 500 留出 3,219,161 v2 中新增的来源
  • v2 训练混合数据为 v1 + v2,而非单独的 v2。v2 通过添加五个新领域来扩展混合数据,而不是在现有五个领域上增加行数,因此两个目录互不重叠,在此处保持分离,而非在 v2 内复制 v1。
  • 合并后:33,777 条提示词,4,737,781 个提示词 token。

数据来源

v1/ — 原始混合数据

上游数据集 领域 行数 平均 token 数
databricks/databricks-dolly-15k 通用指令遵循 4,858 110.2
openai/gsm8k 小学数学 4,900 71.5
iamtarun/python_code_instructions_18k_alpaca 代码 4,899 44.1
nvidia/Nemotron-Post-Training-Dataset-v1(math 数学推理 4,446 75.0
nvidia/Nemotron-Post-Training-Dataset-v1(stem STEM 569 147.1

v2/ — v2 新增领域

上游数据集 领域 行数 平均 token 数
abisee/cnn_dailymail 摘要 2,697 782.3
HuggingFaceH4/ultrachat_200k 多轮对话 2,900 190.6
HuggingFaceH4/no_robots 人工编写指令 2,900 99.0
euclaise/writingprompts 创意写作 2,764 49.5
Helsinki-NLP/opus_books(en-fr 翻译 2,844 46.6
  • 摘要占合并 token 总量的 44%,但仅占行数的 8%——这些来源的提示词长度从 44 到 782 个 token 不等,因此行数不能很好地反映某个来源的权重。

关于 nemotron_stem 的说明

  • 其行数较低有原因值得说明。收集过程消耗了 stem 划分的前 5,000 行,但该 5,000 行仅包含 669 条不同的提示词——87% 为重复项,且收集器不去重。
  • 本数据集文件进行了去重,因此 nemotron_stem 在此处表现为 569 训练 + 100 留出,而非 5,000。发布的行是该来源贡献的真实提示词多样性;收集运行只是多次看到了其中许多内容。

数据格式

  • 每行一个 JSON 对象:{"prompt": str, "prompt_tokens": int}
  • 提示词已为 Qwen3.5 进行对话模板化,采用 enable_thinking=False,因此 `<think>

</think>

` 助手前缀已内置于文本中——请逐字输入,不要重新套用模板。

  • prompt_tokens 是在 Qwen/Qwen3.5-27B 分词器下的长度。
  • 留出行取自每个来源范围的末尾,因此 train 文件恰好是按顺序收集过程所消耗的提示词。

复现方式

在 Chained-Flow(https://github.com/Cosmos-YTU/chained-flow)中运行:

bash python scripts/build_english_prompts.py --out bench_data_en

它会读取每个来源的数据集、划分、范围和格式化器的真实收集配置,因此更改格式化器会更改此输出。

搜集汇总
数据集介绍
english-flow-drafter-prompts 数据集图片
构建方式
在推测解码研究中,草稿模型的训练高度依赖目标模型隐藏状态的分布特性,因此构建面向英文场景的提示数据集需严格遵循目标模型的输入规范。该数据集以Qwen3.5系列模型为训练目标,从公开语料中选取多源数据,经由仓库内置的格式化器统一渲染为已套用聊天模板的英文提示文本。v1划分涵盖通用指令、数学、代码与STEM等五个领域,v2划分在此基础上新增摘要、多轮对话、人工指令、创意写作与翻译五个领域,两部分各自独立且互不重叠。全部提示均由目标模型本地生成续写,数据集本身仅保留输入提示,不包含任何模型输出。
特点
该数据集的核心特征在于其纯提示属性与双版本混合结构。全部文本均为面向英文聊天模板的提示,其中已内置禁用思考模式的助手前缀,可直接馈入模型而无需重新套用模板。v1与v2在领域构成上互补,合并后覆盖从44至782个词元不等的宽幅长度分布,且摘要类来源虽仅占行数的百分之八,却贡献了合并词元总量的四成以上,表明行数并非衡量来源权重的可靠指标。此外,数据集对上游语料中的重复项进行了去重处理,例如STEM来源仅保留569条真实多样的提示,从而确保所发布内容的实际多样性。
使用方法
在使用时,研究人员可直接以逐行JSON格式读取数据,每行包含提示文本及其在Qwen3.5-27B分词器下的词元长度。由于提示已预先完成聊天模板渲染,应原样传入目标模型,避免再次套用模板导致格式错位。训练草稿模型时,需将这批提示输入目标模型以获取其隐藏状态,进而在本地生成续写作为监督信号。v1与v2两个目录可分别用于复现原始混合或扩展混合的训练配置,若需完整覆盖全部领域,则应合并二者而非单独使用v2。留出集取自各来源范围的末尾,可用于评估草稿模型在分布边缘处的泛化表现。
背景与挑战
背景概述
在大语言模型推理效率优化的前沿探索中,推测解码(speculative decoding)已成为降低自回归生成延迟的关键技术路径之一,其核心思想是以轻量级草稿模型预先生成候选token序列,再由目标模型并行验证。english-flow-drafter-prompts数据集由Cosmos-YTU团队构建,服务于Chain-Flow项目中的Flow-Drafter草稿模型训练,旨在为Qwen3.5-4B/9B/27B系列目标模型提供高质量的英语提示语料。该数据集仅包含经过聊天模板渲染的提示文本而不含补全结果,因为草稿模型需基于目标模型自身的隐状态进行训练。数据集涵盖通用指令、数学推理、代码生成、文本摘要、多轮对话及翻译等十个领域,累计逾三万条提示、四百七十余万token,为推测解码草稿器的跨领域泛化能力研究提供了系统化的语料基础。
当前挑战
推测解码领域的核心挑战在于草稿模型需在保持高接受率的同时实现显著的推理加速,而训练语料的领域覆盖度与提示多样性直接决定草稿器在真实场景中的泛化表现。该数据集构建过程中面临多重困难:其一,各上游数据源的提示长度差异悬殊,从四十四token至七百八十二token不等,摘要类数据以百分之八的行数占比贡献了百分之四十四的token权重,行数与实际训练贡献严重失衡;其二,Nemotron STEM分片存在严重的重复问题,采集的前五千行中仅含六百六十九条去重提示,重复率高达百分之八十七,需经额外清洗方可保障语料质量;其三,v2版本以新增领域而非扩充行数的方式扩展混合语料,导致v1与v2目录相互独立,使用者须将二者合并方能复现完整训练配置。
常用场景
经典使用场景
在推测解码(speculative decoding)研究领域,草稿模型(drafter)的效能高度依赖训练语料的领域覆盖与提示分布,english-flow-drafter-prompts正是为此而生的高质量英语提示语料库。该数据集由约三万三千余条经过Qwen3.5聊天模板渲染的英语提示构成,涵盖通用指令、小学数学、代码生成、数学推理、STEM、摘要、多轮对话、人工撰写指令、创意写作与英法翻译等十大来源,仅提供提示而刻意不附带补全,以便研究者以目标模型自身的隐状态在本地生成续写,从而精准匹配草稿模型的训练需求。其最经典的使用场景即作为Flow-Drafter检查点的训练与验证语料,在v1与v2两代混合配置中分别服务于初版领域覆盖与跨域扩展,构成推测解码加速研究的标准化输入。
解决学术问题
推测解码的草稿模型训练长期面临语料域偏窄与提示重复冗余的双重困境,导致草稿质量在跨域迁移时显著退化。该数据集以严谨的来源划分与去重机制回应了这一难题:v2版本通过新增五个领域而非简单扩充既有领域,构建出与v1互补且不相交的提示集合,有效缓解了领域覆盖不均衡问题;针对Nemotron STEM子集87%的重复率,数据集实施去重,将五千行原始数据精炼为五百六十九条真实多样的提示,揭示了原始采集中被掩盖的多样性真相。这些举措为草稿模型训练中的语料偏差与冗余问题提供了可复现的解决方案,推动了推测解码研究在数据层面的规范化。
衍生相关工作
作为Chained-Flow项目的数据基础设施,english-flow-drafter-prompts直接催生了面向Qwen3.5-4B、9B与27B的系列Flow-Drafter检查点,形成模型集合层面的衍生工作。其v1与v2的迭代逻辑亦为后续研究提供了可借鉴的混合策略范式:通过领域增补而非行数堆叠来扩展语料,并以提示令牌数而非行数衡量来源权重,摘要领域以8%的行数贡献44%的令牌即为例证。此外,该数据集与Nemotron、UltraChat、Dolly等上游语料的联动,促进了跨数据集格式统一与模板复用方面的工程实践,为推测解码生态中的数据标准化与模型复现研究奠定了基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务