qwen3.8-flash-next-expert-traces
收藏资源简介:
该数据集记录了部署的 MoE 模型 Qwen3.8-Flash-Next(架构:qwen4_exp,48层,每层 512 个专家,top-10 路由,隐藏维度 2560,MoE 中间维度 640)在推理过程中的 token 级专家路由轨迹。数据由 FreeToken 引擎生成,采样参数为温度 0.2,top_p 1.0。每个运行实例包含二进制轨迹文件(trace.part-*.bin)、提示文本(prompts.jsonl,根据来源许可有全文或哈希)、运行配置(run.json)以及诊断数据(如所有层的隐藏状态、路由器权重矩阵)。轨迹格式支持 v2(5个状态探针,float16)和 v3(可配置探针列表,最多48层,bfloat16,包含层后归一化状态和 LM 头 top-8 候选)。数据可用于研究 MoE 路由行为、预测专家选择以支持推理引擎的专家预取,以及分析路由权重和隐藏状态之间的关系。
This dataset records the token-level expert routing traces of the deployed MoE model Qwen3.8-Flash-Next (architecture: qwen4_exp, 48 layers, 512 experts per layer, top-10 routing, hidden dimension 2560, MoE intermediate dimension 640) during inference. The data is generated by the FreeToken engine with sampling parameters temperature 0.2 and top_p 1.0. Each run instance includes binary trace files (trace.part-*.bin), prompt texts (prompts.jsonl, with full text or hash depending on source license), runtime configuration (run.json), and diagnostic data (e.g., hidden states of all layers, router weight matrices). The trace format supports v2 (5 state probes, float16) and v3 (configurable probe list, up to 48 layers, bfloat16, including post-layer normalization states and LM head top-8 candidates). The data can be used to study MoE routing behavior, predict expert selection to support expert prefetching for inference engines, and analyze the relationship between routing weights and hidden states.
数据集概述
Qwen3.8-Flash-Next Expert Routing Traces 是一个用于研究 MoE(混合专家)模型路由行为的 token 级轨迹数据集。该数据集记录了部署中的 MoE 模型在推理过程中,每个 token 在每个 MoE 层上路由器的选择、前32个路由logits、路由器读取的精确隐藏状态等信息。其主要目标是回答“如何提前预测下一token的专家路由”这一研究问题,以便在无法将所有专家驻留于 VRAM 的推理引擎中实现专家预取(prefetch),同时也可用于 MoE 路由机制本身的研究。
许可协议: CC-BY-4.0
任务类别: 文本生成(text-generation)
数据集的模型详情
| 项目 | 描述 |
|---|---|
| 模型检查点 | RadixArk/Qwen3.8-Flash-Next-NVFP4 |
| 架构 | qwen4_exp,48层,每层512个专家,top-10,隐藏维度为2560,MoE中间维度为640 |
| 额外特性 | 4条超连接流(hc_count=4, hc_lowrank=320),PLE n-gram表(16头),未绑定嵌入,词汇表大小 248,320 |
| 量化 | NVFP4(modelopt 0.46.0),组大小16,仅量化被路由的专家 |
| 路由器精度 | 路由器未量化(*.mlp.gate* 在量化忽略列表中),所有gate保持 bf16,且无偏置。路由器精确等于 W_l @ x(权重矩阵左乘输入) |
| 引擎 | FreeToken 0.1.2,分支 expert-trace-study |
采样参数: 每次运行默认使用 temperature 0.2、top_p 1.0、禁用 top_k(除非 run.json 另行指定)。模型生成自身的续写内容,因此轨迹处于分布内。
数据集文件结构
traces/<run_id>/trace.part-*.bin # 二进制轨迹(格式见下文) traces/<run_id>/prompts.jsonl # 提示文本,受下方政策约束 traces/<run_id>/run.json # 任务ID、类别、随机种子、采样参数、大小、引擎状态 traces/<run_id>/server.log diagnostic/<task>/ # 更丰富的全48层探测子集 diagnostic/router_weights.npz # 每一层的gate矩阵,fp32精度 manifest.jsonl # 每次运行一行 docs/trace_format.md # 权威格式描述 RECORDER_NOTES.md # 与v2的差异、v3解读方式、已知注意事项
数据格式
docs/trace_format.md 是权威格式说明。简要概述:
- 小端序(little-endian)、仅追加(append-only)格式:32字节文件头、JSON运行头,随后是固定大小的token块。
- v2 版本:原始五个状态探测点
{0,12,24,36,47},存储为float16。 - v3 版本:可配置的探测点列表(最多所有48层)、可选的后最终归一化探测(层ID 255)、bfloat16存储、LM头候选、逐层设备时间戳。只有当文件使用上述任一特性时才为v3;v2读取器会拒绝v3文件,而非误读。
读取方式:可使用引擎仓库的 tools/expert_trace/read.py 工具读取,核心接口包括:
tr.steps: 每条记录对应一个tokentr.records: 形状为 [tokens, layers] 的路由及前32个logitstr.state_float("block_input"): 形状为 [n, 2560] 的路由器输入(将bf16扩宽为float32)tr.state_probe_layers: token内探测点顺序;255表示最终归一化状态tr.candidates: 每个解码行的top-8下一token ID及对应概率tr.layer_times: 每(token, layer, {attn, router, moe})的设备时钟纳秒数
提示词政策
- token ID始终包含,因此所有运行均可进行teacher forcing,不受来源限制。
- 提示文本 依来源许可协议而定:
| 来源 | 提示文本内容 | 原因 |
|---|---|---|
| 研究自有的agentic任务、MATH、GSM8K、OSS-Instruct/Magicoder | 完整文本 | 许可允许 |
| LMSYS-Chat-1M、WildChat | 仅哈希 + 数据集ID + 行索引 | 受门控/禁止再分发 |
| IETF RFC、Project Gutenberg文本(长文本真实文档任务) | 完整文本(含Project Gutenberg页眉/页脚,遵守其许可限定的字面要求) | RFC Editor条款允许逐字复制;Gutenberg文本在美国属于公有领域;来源、SHA-256及token计数见 workloads/docs/*/MANIFEST.md |
每条manifest记录均包含 prompt_text_included: true|false 字段。
使用缓存字段前的两条重要说明
hit_mask与slots_in_use不代表实际部署的缓存行为。 这些运行保持全部 24,576 个专家常驻内存,因此 LRU 从不发生驱逐。每次未命中均为冷启动未命中(即首次触碰某专家),随着覆盖率的增长,未命中率趋于零。真实卸载部署下的缓存和时序数据必须来自实际执行卸载的运行。globaltimer不等于step_wall_ns。 逐层时间戳是 CUDA 设备纳秒,在同一运行内单调递增,且不可跨 GPU 比较。运行头携带一个{globaltimer_ns, clock_realtime_ns}配对,用于对齐两个时间轴。
许可与归属
- 轨迹与清单文件: CC-BY-4.0
- 模型: Qwen3.8-Flash-Next(Apache-2.0);NVFP4量化由 RadixArk 完成。
- 引擎: FreeToken(Apache-2.0)
- 提示词来源在
manifest.jsonl中逐运行标注来源,各来源遵循其自身许可协议。 - 生成的文本属于模型在温度 0.2 下的输出,未经准确性审核,使用时需注意常规警示。





