遇见数据集

qwen3.6-35b-a3b-distribution-fidelity-768x2048-v1

收藏
Hugging Face2026-09-03 更新2026-09-04 收录
官方服务:

资源简介:

本数据集是关于Qwen3.6-35B-A3B模型量化分析的结果集合。它包含了多种量化方案(如FP8、AWQ、GPTQ、AutoRound、NVFP4等)的候选模型,并提供了每个候选方案在磁盘上的大小(以GiB为单位)以及平均KL散度(KLD),用于评估量化后模型与原始模型之间的分布保真度。数据集还包含相应的图表数据(kld-vs-size.json)、详细报告(report.md)、合规收据、Law 14归因以及参考张量(用于第三方评分)和校验和文件。该数据集可用于研究不同量化技术对模型性能的影响,以及模型大小与分布保真度之间的权衡。

This dataset is a collection of quantization analysis results for the Qwen3.6-35B-A3B model. It includes candidate models from various quantization methods (such as FP8, AWQ, GPTQ, AutoRound, NVFP4, etc.), and provides the disk size (in GiB) and average KL divergence (KLD) for each candidate to evaluate the distribution fidelity between the quantized model and the original model. The dataset also contains corresponding chart data (kld-vs-size.json), a detailed report (report.md), compliance receipts, Law 14 attribution, reference tensors (for third-party scoring), and checksum files. This dataset can be used to study the impact of different quantization techniques on model performance and the trade-off between model size and distribution fidelity.

创建时间:
2026-08-31
原始信息汇总

数据集概述

Qwen3.6-35B-A3B量化分析是一个专注于评估Qwen3.6-35B-A3B模型不同量化方案性能的数据集。该数据集的核心内容是基于KL散度(Kullback-Leibler divergence)对多种量化候选方案进行分布保真度评估,并探讨其与模型磁盘占用大小之间的关系。

主要评估指标

  • 平均KL散度(Mean KLD):衡量量化后模型与参考模型输出分布之间的差异,数值越低表示保真度越高。
  • 磁盘大小(On-disk size):量化后模型文件在磁盘上所占用的空间。

评估方法

  • 评估遵循分布保真度法则第9版LAWS.md文件)。因此,所得数值仅在本数据集特定的token序列、几何结构和运行时环境内具有可比性,不宜与其他来源的数据直接比较。

数据内容与结构

数据集中每个候选模型目录均包含以下文件:

  • 单页报告report.md
  • 原始报告
  • 合规收据
  • Law 14归因信息(如适用)

此外,reference/目录存储了可复用的教师模型张量及头部信息,使得第三方在不加载完整参考检查点的情况下即可评估新的候选模型。checksums.txt文件覆盖了数据集中所有文件的校验和。

候选方案评估结果(按平均KL散度排序)

候选模型 量化方案 磁盘大小 平均KL散度
Qwen/Qwen3.6-35B-A3B-FP8 fp8_block 34.89 GiB 0.01838144
cyankiwi/Qwen3.6-35B-A3B-AWQ-4bit unquantized 23.25 GiB 0.02204024
QuantTrio/Qwen3.6-35B-A3B-AWQ unquantized 23.71 GiB 0.02819038
palmfuture/Qwen3.6-35B-A3B-GPTQ-Int4 unquantized 22.74 GiB 0.03865829
Intel/Qwen3.6-35B-A3B-int4-mixed-AutoRound unquantized 20.02 GiB 0.04282536
unsloth/Qwen3.6-35B-A3B-NVFP4 nvfp4 4.66 GiB 0.04508458
nvidia/Qwen3.6-35B-A3B-NVFP4 nvfp4 21.82 GiB 0.04660535
unsloth/Qwen3.6-35B-A3B-NVFP4-Fast nvfp4 22.02 GiB 0.05628447
RedHatAI/Qwen3.6-35B-A3B-NVFP4 nvfp4 23.32 GiB 0.06645510

关键发现

  • FP8量化方案在平均KL散度上表现最佳(0.01838144),但其磁盘占用也最大(34.89 GiB)。
  • 在四种NVFP4变体中,unsloth的版本磁盘占用最小(4.66 GiB),但散度并非最低;不同实现间的散度差异显著(0.045至0.066)。
  • 低比特方案(如GPTQ-Int4、AutoRound)在压缩比上具有优势,但KL散度相对较高。

图示与数据文件

数据集包含一张可视化图表(kld-vs-size.png)展示平均KL散度与磁盘大小的关系,底层数据存储在kld-vs-size.json文件中,以便进行进一步验证。数据集的作者强调,图片本身不足以作为证据,因此提供了底层数据文件支持结果的可复现性。

搜集汇总
数据集介绍
qwen3.6-35b-a3b-distribution-fidelity-768x2048-v1 数据集图片
构建方式
在深度学习模型压缩与量化评估领域,分布保真度作为衡量量化前后模型输出一致性的关键指标,日益受到研究者重视。本数据集围绕Qwen3.6-35B-A3B这一大规模语言模型,系统整合了多种主流量化方案(包括FP8块量化、AWQ、GPTQ等)的评估结果。构建过程遵循‘分布保真度法则’版本9,在统一的token套件、几何结构与运行环境内,对每个候选量化模型计算其与参考模型的平均KL散度,并记录对应的模型磁盘占用大小。每个候选模型目录包含详细的一页报告、原始数据、合规收据及Law 14归因,同时提供教师张量与头部作为可复用参考,确保第三方能在不加载参考检查点的情况下进行公平复现。
特点
该数据集以量化模型的分布保真度为核心,聚焦于KL散度与模型尺寸之间的权衡关系,打破了传统方法仅关注精度损失的局限。其显著特征在于数据可比性受限却被严格界定:所有评估数值仅在同一工件内的token套件、几何形状和运行身份下有效,不可与外部其他指标混用。数据集不仅提供了各候选方案的量化方案、磁盘占用和平均KLD的对比表格,还以可视化图表和原始JSON数据形式呈现‘保真度-尺寸’曲线,使数据一目了然。此外,每个候选目录均附有标准化的报告文件,增强了评估流程的透明度与可审计性。
使用方法
使用者可依据README指引,优先阅读LAWS.md以理解该数据集的适用范围与评估协议,确保数值引用的合理性。随后,可直接查阅主表格中的候选方案列表,根据具体需求(如磁盘占用限制或可容忍的分布偏移)选择最适宜的量化模型。若要深入分析,可访问各候选目录中的report.md获取详细评估,或利用kld-vs-size.json数据绘制自定义图表。对于需要评估新量化方案的第三方,可借助reference文件夹提供的教师张量,在无需加载完整参考模型的情况下,对新候选进行独立打分,从而在保证公平性的同时,极大简化了评估流程的部署成本。
背景与挑战
背景概述
本数据集由Qwen团队于2025年创建,名为qwen3.6-35b-a3b-distribution-fidelity-768x2048-v1,旨在系统评估大型语言模型在量化压缩后的分布保真度。该数据集聚焦于Qwen3.6-35B-A3B模型,该模型采用混合专家架构,参数规模达350亿,激活参数仅30亿,代表了高效推理的前沿设计。研究团队通过引入基于KL散度的分布保真度法则(版本9)构建了一套严格的评分标准,并提供了参考张量、合规收据和法律14归属等元数据,以确保评估过程的透明性和可复现性。该数据集的发布填补了量化模型在分布一致性评估方面的空白,为后续研究提供了统一基准,显著影响了模型压缩领域对输出分布质量的重视程度,推动了更可靠的轻量化模型部署实践。
当前挑战
该数据集面临的首要挑战是量化压缩引发的分布偏斜问题。相较于原始FP16模型,各类量化方案(如FP8、AWQ、GPTQ、NVFP4等)在减小模型体积的同时,不可避免地引入数值误差,导致输出分布与参考分布之间产生KL散度偏差。表中数据显示,部分紧凑方案(如unsloth NVFP4)在压缩至4.66 GiB时,其平均KL散度显著升高至0.045,而体积较大的FP8方案则保持较低偏差,凸显了尺寸与保真度间的冲突。此外,构建过程中面临技术性挑战,包括如何设计可比较的评分规则,确保结果仅适用于特定token套件、几何形态和运行时身份,而非跨场景通用;如何在不加载完整参考检查点的情况下使第三方能够复现评分,以及如何有效管理多候选目录下的复杂元数据,以确保所有报告、收据和归属信息的完整性与合规性。
常用场景
经典使用场景
该数据集围绕Qwen3.6-35B-A3B模型的不同量化方案,系统地记录了平均KL散度与磁盘占用大小的对应关系,成为评估模型压缩过程中信息保真度的重要基准。其核心使用场景聚焦于量化方案的横向对比,研究者可借助其中列出的FP8、AWQ、GPTQ、AutoRound及NVFP4等候选配置,在统一的分发保真度法则下,依据量化后模型输出分布与原始分布的差异进行严谨的择优。该数据集为量化技术研究提供了标准化的评估框架,尤其适用于那些关注模型轻量化与性能平衡的学术探索。
衍生相关工作
围绕这一数据集,衍生出了一系列跟进性的研究脉络:一方面,其中提供的‘可复用教师张量与头部’极大降低了第三方独立验证的成本,催生了将其作为基准测试环境,开发新型量化误差缓解算法的实践;另一方面,图、表与原始JSON数据的并行呈现,确立了‘以证据为中心’的模型评估惯例,影响了后续模型卡片的撰写标准与自动评估工具的开发。更为关键的是,该数据集中呈现的KLD-体积帕累托前沿,激发了对理论最优量化粒度与自适应比特分配的研究,相关成果在低比特量化,尤其是4位与4位以下方案的忠实度提升上展现出持续价值。
数据集最近研究
最新研究方向
在大语言模型压缩与部署的前沿探索中,量化技术始终是平衡模型体积与生成质量的核心杠杆。该数据集聚焦于Qwen3.6-35B-A3B这一混合专家架构模型,通过引入平均KL散度作为分布保真度的度量标准,系统评估了FP8、AWQ、GPTQ、AutoRound及NVFP4等多种量化方案在磁盘占用与输出分布偏离之间的微妙权衡。其独到之处在于构建了严格受控的评分环境,强调结果仅在特定令牌序列、几何配置与运行时身份下具有可比性,此举响应了当前领域对量化评估可复现性与标准化缺失的普遍关切。伴随参考张量与合规性记录的提供,数据集不仅为现有候选方案确立了性能坐标,更开辟了第三方独立验证新量化策略的通道,其意义在于推动社区从孤立追求压缩率转向对模型行为保真度的精细化考量,为大规模模型在资源受限场景下的可靠部署提供了前瞻性的方法论参照与实证基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务