sjakek/qwen36-kquant-offload-mtp-swebench-lite100-results
收藏数据链接:
官方服务:
资源简介:
该数据集包含完整的5个模型×100个提示的运行时基准测试工件,以及详细的统计分析层。
This dataset encompasses complete runtime benchmark artifacts for 5 models × 100 prompts, along with a detailed layer of statistical analysis.
提供机构:
sjakek搜集汇总
数据集介绍
构建方式
该数据集源自对Qwen3.6-35B-A3B-GGUF-MTP模型在不同量化与卸载策略下的系统性运行时基准测试。研究者选取了五种模型配置,包括Unsloth提供的Q4_K_M与Q3_K_XL基线,以及基于Unsloth UD-Q4_K_XL布局衍生出的ATX/K3系列子量化变体(hot10、hot20、hot30/cold30),其中hot/cold标签表征了对路由专家张量的显著性排序精度分配,而非MoE层数。所有模型均在相同上下文长度(64000)、MTP规格及采样参数下,针对SWE-bench Lite中的100个提示进行了完整推理,最终生成了500条完整的运行时基准记录及丰富的分析文件。
特点
该数据集的一个显著特点是其高度结构化的多维度评估体系,不仅包含原始的生成文本与预测结果,还附带了全面的统计分析层。核心指标涵盖解码吞吐量、预填充时间、总壁钟时间及MTP接受率等,尤为突出的是,数据集中提供了配对显著性检验、Bootstrap置信区间及Holm校正结果,使得模型间的性能差异得到严格量化。此外,数据集详细记录了每个模型的显存占用、与基线的相对大小变化及ATX/K3的派生关系,为深入理解混合专家模型在量化与卸载策略下的运行时行为提供了极其丰富的参考素材。
使用方法
用户可通过HuggingFace数据集页面直接获取完整的基准测试工件,包括现成的CSV表格(如detailed、pairwise_significance、benchmark_decision_table)、可视化图表以及原始生成JSONL文件。对于需要复现或扩展研究的用户,可在llama-cpp框架下利用提供的配置参数(如上下文长度、MTP规格、采样设置等)进行自定义运行。数据集同时包含了可视化仪表板(analysis.html)与详细分析报告(report.md),便于研究者快速洞悉不同量化方案在解码效率与内存占用之间的权衡,从而在部署实际应用时做出更为明智的模型选择。
背景与挑战
背景概述
该数据集由服务于大规模语言模型(LLM)推理优化的研究团队创建,聚焦于Qwen3.6-35B-A3B混合专家(MoE)模型在软件工程基准测试SWE-bench Lite上的运行时性能。核心研究问题在于探索通过量化和层级卸载(Offload)策略提升解码吞吐量与减少总耗时,其中ATX/K3自适应张量秩(saliency-ranked routed expert tensor precision)技术被应用于Unsloth基线之上。数据集诞生于2024年,收录了五种配置在100条提示下的完整运行时指标,包含细粒度的解码速度、预填充延迟、内存占用及MTP接受率等,揭示了特定量化方案(如hot30/cold30)在配对解码吞吐上超越标准Q4_K_M,但后者在总耗时时仍占优的实证结果,对LLM在资源受限环境下的高效部署具有重要参考价值。
当前挑战
该数据集面临的挑战源于多层面。在领域问题层面,MoE模型的推理效率受制于路由专家的计算不均衡性,传统均匀量化难以在不同专家间分配最优精度,导致内存带宽利用率低下。具体地,如何在不牺牲生成质量的前提下,通过层级卸载和张量秩分配来平衡内存占用与解码速度,成为核心难题。在构建过程中,挑战包括对5种模型×100条提示(共500次完整运行)的严格可重复性控制,需确保上下文长度64K、MTP推测解码、KV缓存类型及采样参数的一致性。此外,从Unsloth的UD-Q4_K_XL模型派生ATX/K3子量化时,需精确界定hot/cold标签对应的120个路由专家张量的秩分配,而非简单按层数划分,这增加了配置的复杂性。最终仅评估运行时行为而非生成质量,意味着当前排名无法直接用于质量导向的模型选择,需后续注入质量评测以完善结论。
常用场景
经典使用场景
在大型语言模型高效推理的研究领域中,随着MoE架构模型的日益复杂,如何在有限硬件资源下平衡推理速度与模型精度成为关键挑战。该数据集记录了Qwen3.6-35B-A3B模型在SWE-bench Lite基准上的完整运行时性能,涵盖了五种量化配置的对比实验。其最经典的使用场景是评估不同量化策略与专家路由缓存调度方案对MoE模型解码吞吐量、显存占用及端到端延迟的影响,尤其聚焦于ATX/K3非均匀量化与MTP推测解码技术的协同效果。研究者可借此剖析热/冷专家张量精度分配对推理瓶颈的缓解作用。
实际应用
在实际部署场景中,该数据集为在消费级显卡或云服务实例上高效运行千亿级MoE模型提供了可复现的配置指南。例如,开发者可以依据total wall clock排名选择Q4_K_M作为时间敏感型应用的均衡方案,或采用ATX hot30/cold30以牺牲一定端到端时延换取更高解码带宽,适用于需要低延迟流式响应的对话系统。数据集中的predictions与generations.jsonl文件还允许后续对代码生成质量进行细粒度评估,从而指导DevOps场景中模型服务化的硬件选型与推理调度策略。
衍生相关工作
基于此数据集的研究成果已衍生出多项重要工作,包括对ATX/K3量化方法的进一步优化、针对MoE模型中专家使用模式的热力图分析,以及将MTP推测解码扩展至其他模型家族(如Llama、Mistral)的实证研究。此外,数据集中的配对显著性检验流程被复用为通用基准测试工具,促成了一系列关于offload粒度与缓存预取策略的对比研究,并催生了新一代内存感知型量化推理框架的设计与迭代。
以上内容由遇见数据集搜集并总结生成




