Qwen3.8-27B-GGUF-metrics
收藏资源简介:
该数据集是AtomicChat/Qwen3.8-27B-GGUF量化模型的工作记录,旨在提供完全可复现的量化比较基准。数据集包含以下内容: - kld/目录:未量化模型的参考logits(分片存储,总大小超过50GB),用于计算KL散度; - logs/目录:包括参考运行日志、每个量化文件的测量日志、量化命令及逐张量结果、重要性矩阵分片日志、合并日志、统计信息以及环境配置; - imatrix/目录:合并后的重要性矩阵(GGUF格式)及其分片; - results.json:所有测量结果的汇总文件,便于绘图。 测量方法:以BF16权重的原始模型为参考,使用held-out文本(eval_neutral,来自AtomicChat/calib-corpora),上下文长度4096,每token计算KL散度和top-1一致性。重要性矩阵基于BF16权重,在4947044个token(3004个文档)上收集,上下文512,批次4096,使用7个worker分片计算。 数据集还包含14种不同量化布局的实验结果,详细记录了每种布局的文件大小和KL散度,以及与其他发布者(如unsloth)的量化文件的对比测量。 适用场景:用于量化模型的性能评估、量化方法研究、可复现的基准测试,以及对比不同量化配置的精度损失。
This dataset is a work record of the AtomicChat/Qwen3.8-27B-GGUF quantized model, aiming to provide a fully reproducible quantization comparison benchmark. It contains: - kld/ directory: reference logits of the unquantized model (sharded, total size >50GB) for KL divergence calculation; - logs/ directory: includes reference run logs, measurement logs for each quantized file, quantization commands and per-tensor results, importance matrix shard logs, merge logs, statistics, and environment configuration; - imatrix/ directory: merged importance matrix (GGUF format) and its shards; - results.json: summary of all measurements for easy plotting. Measurement method: the original model with BF16 weights is used as reference, with held-out text (eval_neutral from AtomicChat/calib-corpora), context length 4096, calculating KL divergence and top-1 consistency per token. The importance matrix is collected based on BF16 weights on 4,947,044 tokens (3,004 documents), context 512, batch 4096, computed with 7 workers in shards. The dataset also includes experimental results of 14 different quantization layouts, recording file size and KL divergence for each layout, as well as comparative measurements against quantized files from other publishers (e.g., unsloth). Applicable scenarios: performance evaluation of quantized models, quantization method research, reproducible benchmarks, and comparison of accuracy loss across different quantization configurations.
Qwen3.8-27B GGUF 量化指标数据集
数据集概述
这是 AtomicChat/Qwen3.8-27B-GGUF 模型卡片的完整工作记录数据集,旨在公开模型量化比较的全部细节,包括参考基准、测试文本、构建规则等,使量化比较可复现。
许可证与任务类型
- 许可证:Apache-2.0
- 任务类型:文本生成
- 标签:GGUF、llama.cpp、imatrix、量化、基准测试、指标、atomic-chat
数据集内容
核心文件结构
| 路径 | 内容 |
|---|---|
kld/ |
参考 logits,分片存储及重组说明 |
logs/base-neutral.log |
生成参考的日志 |
logs/kld-neutral--*.log |
每个文件的测量结果(含其他发布者的构建) |
logs/quantize-*.log |
每个构建的完整命令和逐张量结果 |
logs/imatrix-shard-*.log |
重要性矩阵分片日志 |
logs/imatrix-merge.log |
合并日志 |
logs/imatrix-stats.log |
按张量排序的激活能量 |
logs/env.txt、logs/llama-commit.txt |
工具链、驱动和 llama.cpp 提交信息 |
imatrix/imatrix.gguf |
合并的重要性矩阵及其分片 |
results.json |
所有测量结果汇总文件 |
测量方法
| 项目 | 详情 |
|---|---|
| 参考基准 | 原始 BF16 权重,转换为 GGUF,未量化运行 |
| 保留文本 | AtomicChat/calib-corpora 的 eval_neutral,从未用于校准 |
| 上下文长度 | 4096 |
| 分块数 | 87 |
| 参考困惑度 | 4.5219 ± 0.0238 |
| 指标 | 对参考的逐 token KL 散度,以及 top-1 一致性 |
| 硬件 | 4x RTX 5090 |
| CUDA 版本 | 13.0 |
| llama.cpp | 见 logs/llama-commit.txt |
重要说明:上下文长度是关键变量。在 512 和 4096 上下文下测量会产生不同的散度值。任何与本研究比较的数字必须使用相同的 4096 上下文、相同的保留文本和相同的参考基准。
参考数据使用
.kld 文件包含未量化模型对每个得分 token 的全词表预测,可通过 llama-perplexity 命令自行测量其他构建,与本研究结果直接对比。文件因超过 50GB 限制而分片存储,可通过 cat base-neutral.kld.*.part > base-neutral.kld 重组。
重要性矩阵
- 来源:BF16 权重
- 数据规模:4,967,044 tokens,涵盖 3,004 篇文档
- 上下文:512
- 批大小:4096
- 特殊 token:解析为特殊标记而非标点
- 工作节点:7 个,按块范围分布到 3 台机器
激活能量最高的张量集中在第 52 至 62 层的注意力门控,以及第 0 层的第二个峰值。
构建配置
所有构建共享相同的骨架结构:第 0-3 层和第 52-63 层在基础类型上提升一级,第 4-11 层使用基础类型,ffn_down 比 ffn_gate 和 ffn_up 高一级,注意力门控和状态输出也高一级,attn_k 和 attn_v 保持 q8_0,多 token 预测头固定不变。
量化级别表(部分)
| 文件 | ffn_down |
ffn_gate/ffn_up |
attn_gate |
ssm_out |
output |
token_embd |
|---|---|---|---|---|---|---|
AD-Q6_K |
q6_k | q6_k | q8_0 | q8_0 | q8_0 | q8_0 |
AD-Q5_K |
q5_k | q5_k | q6_k | q6_k | q6_k | q4_k |
AD-Q4_K |
q4_k | q4_k | q5_k | q5_k | q6_k | iq4_xs |
AD-IQ4_XS |
q4_k | iq4_xs | q5_k | q5_k | q6_k | iq4_xs |
AD-IQ2_XS |
iq2_xs | iq2_xs | q3_xxs | q3_xxs | q4_k | iq4_xs |
AD-IQ1_M |
iq2_xxs | iq1_m | iq2_s | iq2_s | iq4_xs | iq4_xs |
布局实验结果
比较了 10 种不同位分配方案,全部在相同测试条件下测量:
| 布局 | 大小 | KL 散度 |
|---|---|---|
| 所有层统一处理 | 16.8 GB | 0.01580 |
| 4 层提升 | 17.1 GB | 0.01449 |
更多位分配给 ffn_down |
17.8 GB | 0.01189 |
| 更多位分配给注意力 | 18.2 GB | 0.01010 |
| 16 层提升(首尾) | 17.8 GB | 0.00981 |
| 32 层提升 | 18.4 GB | 0.00826 |
| 16 层提升 + 注意力门控 | 18.4 GB | 0.00821 |
| 16 层提升 + 更丰富的输出头 | 18.8 GB | 0.00800 |
| 24 层提升 | 18.6 GB | 0.00743 |
| 24 层提升 + 注意力门控和状态输出 | 18.6 GB | 0.00730 |
关键发现
- 网络的末端比中间更有价值,尾部比头部更有价值,超过 24 层的提升收益停止增长
- 注意力门控和状态输出各占权重的 5.5%,在两者上各加一级仅增加 0.16 GB 却消除了 11% 的剩余散度,是最佳单一权衡
- 嵌入表的成本比其 4.7% 的权重占比更便宜,而输出头更昂贵,用嵌入表的预算支付输出头在所有尺寸下都更优
其他发布者文件
其他发布者的文件基于其自身的参考和测试框架测量,不能直接与本研究结果对比。因此下载这些文件并用相同的参考、文本和 llama.cpp 构建重新测量,日志以发布者名称开头命名。
重要技术说明
- Q8_0 并非无损:该模型上散度为 0.00064,top-1 准确率 98.92%
- 多 token 预测头:正常前向传播中不执行,重要性矩阵无法获取其信息,若量化过低会导致 llama.cpp 中途停止
- 张量行可除性:本模型的每个张量行都能被 256 整除,因此 K 和 I 量化范围完全可用;若行数不可整除,llama.cpp 会静默替换为更粗粒度类型




