遇见数据集

qwen3.8-flash-next-expert-traces

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

该数据集记录了部署的 MoE 模型 Qwen3.8-Flash-Next(架构:qwen4_exp,48层,每层 512 个专家,top-10 路由,隐藏维度 2560,MoE 中间维度 640)在推理过程中的 token 级专家路由轨迹。数据由 FreeToken 引擎生成,采样参数为温度 0.2,top_p 1.0。每个运行实例包含二进制轨迹文件(trace.part-*.bin)、提示文本(prompts.jsonl,根据来源许可有全文或哈希)、运行配置(run.json)以及诊断数据(如所有层的隐藏状态、路由器权重矩阵)。轨迹格式支持 v2(5个状态探针,float16)和 v3(可配置探针列表,最多48层,bfloat16,包含层后归一化状态和 LM 头 top-8 候选)。数据可用于研究 MoE 路由行为、预测专家选择以支持推理引擎的专家预取,以及分析路由权重和隐藏状态之间的关系。

This dataset records the token-level expert routing traces of the deployed MoE model Qwen3.8-Flash-Next (architecture: qwen4_exp, 48 layers, 512 experts per layer, top-10 routing, hidden dimension 2560, MoE intermediate dimension 640) during inference. The data is generated by the FreeToken engine with sampling parameters temperature 0.2 and top_p 1.0. Each run instance includes binary trace files (trace.part-*.bin), prompt texts (prompts.jsonl, with full text or hash depending on source license), runtime configuration (run.json), and diagnostic data (e.g., hidden states of all layers, router weight matrices). The trace format supports v2 (5 state probes, float16) and v3 (configurable probe list, up to 48 layers, bfloat16, including post-layer normalization states and LM head top-8 candidates). The data can be used to study MoE routing behavior, predict expert selection to support expert prefetching for inference engines, and analyze the relationship between routing weights and hidden states.

创建时间:
2026-09-07
原始信息汇总

数据集概述

Qwen3.8-Flash-Next Expert Routing Traces 是一个用于研究 MoE(混合专家)模型路由行为的 token 级轨迹数据集。该数据集记录了部署中的 MoE 模型在推理过程中,每个 token 在每个 MoE 层上路由器的选择、前32个路由logits、路由器读取的精确隐藏状态等信息。其主要目标是回答“如何提前预测下一token的专家路由”这一研究问题,以便在无法将所有专家驻留于 VRAM 的推理引擎中实现专家预取(prefetch),同时也可用于 MoE 路由机制本身的研究。

许可协议: CC-BY-4.0

任务类别: 文本生成(text-generation)

数据集的模型详情

项目 描述
模型检查点 RadixArk/Qwen3.8-Flash-Next-NVFP4
架构 qwen4_exp,48层,每层512个专家,top-10,隐藏维度为2560,MoE中间维度为640
额外特性 4条超连接流(hc_count=4, hc_lowrank=320),PLE n-gram表(16头),未绑定嵌入,词汇表大小 248,320
量化 NVFP4(modelopt 0.46.0),组大小16,仅量化被路由的专家
路由器精度 路由器未量化*.mlp.gate* 在量化忽略列表中),所有gate保持 bf16,且无偏置。路由器精确等于 W_l @ x(权重矩阵左乘输入)
引擎 FreeToken 0.1.2,分支 expert-trace-study

采样参数: 每次运行默认使用 temperature 0.2、top_p 1.0、禁用 top_k(除非 run.json 另行指定)。模型生成自身的续写内容,因此轨迹处于分布内。

数据集文件结构

traces/<run_id>/trace.part-*.bin # 二进制轨迹(格式见下文) traces/<run_id>/prompts.jsonl # 提示文本,受下方政策约束 traces/<run_id>/run.json # 任务ID、类别、随机种子、采样参数、大小、引擎状态 traces/<run_id>/server.log diagnostic/<task>/ # 更丰富的全48层探测子集 diagnostic/router_weights.npz # 每一层的gate矩阵,fp32精度 manifest.jsonl # 每次运行一行 docs/trace_format.md # 权威格式描述 RECORDER_NOTES.md # 与v2的差异、v3解读方式、已知注意事项

数据格式

docs/trace_format.md 是权威格式说明。简要概述:

  • 小端序(little-endian)、仅追加(append-only)格式:32字节文件头、JSON运行头,随后是固定大小的token块。
  • v2 版本:原始五个状态探测点 {0,12,24,36,47},存储为float16。
  • v3 版本:可配置的探测点列表(最多所有48层)、可选的后最终归一化探测(层ID 255)、bfloat16存储、LM头候选、逐层设备时间戳。只有当文件使用上述任一特性时才为v3;v2读取器会拒绝v3文件,而非误读。

读取方式:可使用引擎仓库的 tools/expert_trace/read.py 工具读取,核心接口包括:

  • tr.steps: 每条记录对应一个token
  • tr.records: 形状为 [tokens, layers] 的路由及前32个logits
  • tr.state_float("block_input"): 形状为 [n, 2560] 的路由器输入(将bf16扩宽为float32)
  • tr.state_probe_layers: token内探测点顺序;255表示最终归一化状态
  • tr.candidates: 每个解码行的top-8下一token ID及对应概率
  • tr.layer_times: 每(token, layer, {attn, router, moe})的设备时钟纳秒数

提示词政策

  • token ID始终包含,因此所有运行均可进行teacher forcing,不受来源限制。
  • 提示文本 依来源许可协议而定:
来源 提示文本内容 原因
研究自有的agentic任务、MATH、GSM8K、OSS-Instruct/Magicoder 完整文本 许可允许
LMSYS-Chat-1M、WildChat 仅哈希 + 数据集ID + 行索引 受门控/禁止再分发
IETF RFC、Project Gutenberg文本(长文本真实文档任务) 完整文本(含Project Gutenberg页眉/页脚,遵守其许可限定的字面要求) RFC Editor条款允许逐字复制;Gutenberg文本在美国属于公有领域;来源、SHA-256及token计数见 workloads/docs/*/MANIFEST.md

每条manifest记录均包含 prompt_text_included: true|false 字段。

使用缓存字段前的两条重要说明

  1. hit_maskslots_in_use 不代表实际部署的缓存行为。 这些运行保持全部 24,576 个专家常驻内存,因此 LRU 从不发生驱逐。每次未命中均为冷启动未命中(即首次触碰某专家),随着覆盖率的增长,未命中率趋于零。真实卸载部署下的缓存和时序数据必须来自实际执行卸载的运行。
  2. globaltimer 不等于 step_wall_ns 逐层时间戳是 CUDA 设备纳秒,在同一运行内单调递增,且不可跨 GPU 比较。运行头携带一个 {globaltimer_ns, clock_realtime_ns} 配对,用于对齐两个时间轴。

许可与归属

  • 轨迹与清单文件: CC-BY-4.0
  • 模型: Qwen3.8-Flash-Next(Apache-2.0);NVFP4量化由 RadixArk 完成。
  • 引擎: FreeToken(Apache-2.0)
  • 提示词来源在 manifest.jsonl 中逐运行标注来源,各来源遵循其自身许可协议。
  • 生成的文本属于模型在温度 0.2 下的输出,未经准确性审核,使用时需注意常规警示。
搜集汇总
数据集介绍
qwen3.8-flash-next-expert-traces 数据集图片
构建方式
该数据集源于对已部署混合专家(MoE)模型在线推理过程的细粒度记录,旨在为专家路由的可预测性研究提供实证基础。构建时采用FreeToken引擎的专家追踪分支,在温度0.2、top_p为1.0的采样配置下,令模型自主生成续写文本,从而保证轨迹数据严格服从模型自身分布。记录覆盖48个MoE层中每一token的路由决策、前32位路由器logits以及路由器所读取的精确隐状态,v3版本进一步将探针层扩展至全部48层,并纳入最终归一化后的状态与语言模型头的前8个候选token。所有轨迹以二进制追加格式存储,辅以提示词、运行元数据与日志,形成结构化的可复现语料。
特点
该数据集的核心特征在于其token级路由追踪的完整性与精确性。路由器未被量化,以bf16精度原生保留,且不携带偏置,使得路由函数严格等同于权重矩阵与隐状态的乘积,为可解释性分析提供了无干扰的数值基础。数据集同时包含两套记录:通用轨迹覆盖五个固定状态探针,而诊断子集则对全部48层进行更密集的采样,并额外记录逐层设备时间戳与语言模型头候选分布。提示文本的收录策略遵循各来源许可,受限数据集仅保留哈希与行索引,兼顾了开放性与合规性。
使用方法
使用者可借助引擎仓库提供的read.py工具打开轨迹文件,通过open_trace接口加载状态后,访问tr.records获取逐token逐层的路由与logits,利用tr.state_float提取路由器输入,并借tr.candidates与tr.layer_times分别获取候选token分布与设备时钟信息。需注意hit_mask与slots_in_use字段并不反映真实部署中的缓存淘汰行为,因此相关缓存与延迟结论应来自实际卸载运行的场景;globaltimer为CUDA设备纳秒,仅在同一运行内单调,不可跨GPU直接比较。所有轨迹与清单文件以CC-BY-4.0许可发布,使用时应按manifest.jsonl中的来源逐项标注归属。
背景与挑战
背景概述
混合专家(MoE)架构凭借稀疏激活特性,在维持庞大参数规模的同时显著降低单次推理的计算开销,已成为大语言模型扩展的重要范式。然而,部署此类模型时,专家权重总量往往远超单卡显存容量,引擎不得不将专家驻留于外部存储并按需换入,由此引发的加载停滞成为推理延迟的主要瓶颈。该数据集由RadixArk团队构建,记录了Qwen3.8-Flash-Next这一部署态MoE模型在48个MoE层中逐token的专家路由轨迹,涵盖路由器选择的专家、决策背后的top-32路由logits以及路由器所读取的精确隐藏状态,旨在探究下一token专家路由的可预测性,从而支撑预取机制的设计,并为MoE路由机理的可解释性研究提供细粒度语料。
当前挑战
该数据集所应对的领域问题在于:当MoE模型的专家集合无法全部驻留显存时,推理引擎如何提前判定即将被激活的专家并予以预取,以规避按需加载带来的停顿。这一问题的核心难点在于路由决策的时序依赖性——路由器在每一层对每一token的选择均依赖其即时读取的隐藏状态,而这些状态本身又由前序token与层级的计算共同塑造,使得前瞻式预测面临显著的不确定性。构建过程中亦存在多重挑战:轨迹需在真实部署引擎中逐token、逐层精确采集,涉及隐藏状态、路由logits与设备时间戳的同步记录;v2与v3两种格式在探针层级、存储精度与候选信息上存在差异,需保证读取器的严格兼容;提示文本的收录还须遵循各来源的许可约束,对受限语料仅保留哈希与索引。
常用场景
经典使用场景
在稀疏专家混合模型的实际部署中,专家路由的可预测性直接决定了预取策略的成败。该数据集以逐词元、逐层的方式忠实记录了已部署MoE模型全部48层的路由决策、前32个门控对数几率以及路由器所读取的精确隐状态,从而为研究下一词元专家路由的提前预测提供了细粒度的第一手观测材料。其最经典的使用场景在于构建并评估路由预测器,使显存受限的推理引擎能够在计算当前词元时提前将后续词元所需专家载入显存,以隐藏专家加载延迟,亦可支撑对MoE路由机制本身的可解释性分析。
实际应用
在推理引擎的工程实践中,该数据集直接服务于显存受限场景下的专家预取调度。当单卡显存无法容纳全部专家时,引擎可依据路由轨迹训练轻量预测器,提前将下一词元可能激活的专家自主机内存迁入设备,从而避免逐层停顿。同时,逐层设备时钟数据可用于剖析注意力、路由与专家计算三段耗时,指导算子融合与流水线划分。诊断子集所附带的门控权重与全层探针,还可用于校准量化后路由器的行为偏差,保障NVFP4量化部署下的路由稳定性。
衍生相关工作
围绕该数据集,FreeToken引擎仓库中的专家轨迹读取工具与格式规范构成了最直接的衍生工作,为后续轨迹解析与可视化奠定了基础。基于其路由对数几率与隐状态,研究者可开展专家激活预测、路由聚类与负载均衡分析等延伸研究,并可与LMSYS-Chat-1M、WildChat等受限来源的运行记录相结合,在合规前提下拓展任务多样性。此外,该数据集所确立的v2与v3双版本格式约定,也为后续引入更细粒度探针与跨设备时序对齐的轨迹采集工作提供了可扩展的范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务