遇见数据集

Qwen3.8-27B-GGUF-metrics

收藏
Hugging Face2026-08-16 更新2026-08-17 收录
官方服务:

资源简介:

该数据集是AtomicChat/Qwen3.8-27B-GGUF量化模型的工作记录,旨在提供完全可复现的量化比较基准。数据集包含以下内容: - kld/目录:未量化模型的参考logits(分片存储,总大小超过50GB),用于计算KL散度; - logs/目录:包括参考运行日志、每个量化文件的测量日志、量化命令及逐张量结果、重要性矩阵分片日志、合并日志、统计信息以及环境配置; - imatrix/目录:合并后的重要性矩阵(GGUF格式)及其分片; - results.json:所有测量结果的汇总文件,便于绘图。 测量方法:以BF16权重的原始模型为参考,使用held-out文本(eval_neutral,来自AtomicChat/calib-corpora),上下文长度4096,每token计算KL散度和top-1一致性。重要性矩阵基于BF16权重,在4947044个token(3004个文档)上收集,上下文512,批次4096,使用7个worker分片计算。 数据集还包含14种不同量化布局的实验结果,详细记录了每种布局的文件大小和KL散度,以及与其他发布者(如unsloth)的量化文件的对比测量。 适用场景:用于量化模型的性能评估、量化方法研究、可复现的基准测试,以及对比不同量化配置的精度损失。

This dataset is a work record of the AtomicChat/Qwen3.8-27B-GGUF quantized model, aiming to provide a fully reproducible quantization comparison benchmark. It contains: - kld/ directory: reference logits of the unquantized model (sharded, total size >50GB) for KL divergence calculation; - logs/ directory: includes reference run logs, measurement logs for each quantized file, quantization commands and per-tensor results, importance matrix shard logs, merge logs, statistics, and environment configuration; - imatrix/ directory: merged importance matrix (GGUF format) and its shards; - results.json: summary of all measurements for easy plotting. Measurement method: the original model with BF16 weights is used as reference, with held-out text (eval_neutral from AtomicChat/calib-corpora), context length 4096, calculating KL divergence and top-1 consistency per token. The importance matrix is collected based on BF16 weights on 4,947,044 tokens (3,004 documents), context 512, batch 4096, computed with 7 workers in shards. The dataset also includes experimental results of 14 different quantization layouts, recording file size and KL divergence for each layout, as well as comparative measurements against quantized files from other publishers (e.g., unsloth). Applicable scenarios: performance evaluation of quantized models, quantization method research, reproducible benchmarks, and comparison of accuracy loss across different quantization configurations.

创建时间:
2026-08-14
原始信息汇总

Qwen3.8-27B GGUF 量化指标数据集

数据集概述

这是 AtomicChat/Qwen3.8-27B-GGUF 模型卡片的完整工作记录数据集,旨在公开模型量化比较的全部细节,包括参考基准、测试文本、构建规则等,使量化比较可复现。

许可证与任务类型

  • 许可证:Apache-2.0
  • 任务类型:文本生成
  • 标签:GGUF、llama.cpp、imatrix、量化、基准测试、指标、atomic-chat

数据集内容

核心文件结构

路径 内容
kld/ 参考 logits,分片存储及重组说明
logs/base-neutral.log 生成参考的日志
logs/kld-neutral--*.log 每个文件的测量结果(含其他发布者的构建)
logs/quantize-*.log 每个构建的完整命令和逐张量结果
logs/imatrix-shard-*.log 重要性矩阵分片日志
logs/imatrix-merge.log 合并日志
logs/imatrix-stats.log 按张量排序的激活能量
logs/env.txtlogs/llama-commit.txt 工具链、驱动和 llama.cpp 提交信息
imatrix/imatrix.gguf 合并的重要性矩阵及其分片
results.json 所有测量结果汇总文件

测量方法

项目 详情
参考基准 原始 BF16 权重,转换为 GGUF,未量化运行
保留文本 AtomicChat/calib-corpora 的 eval_neutral,从未用于校准
上下文长度 4096
分块数 87
参考困惑度 4.5219 ± 0.0238
指标 对参考的逐 token KL 散度,以及 top-1 一致性
硬件 4x RTX 5090
CUDA 版本 13.0
llama.cpp logs/llama-commit.txt

重要说明:上下文长度是关键变量。在 512 和 4096 上下文下测量会产生不同的散度值。任何与本研究比较的数字必须使用相同的 4096 上下文、相同的保留文本和相同的参考基准。

参考数据使用

.kld 文件包含未量化模型对每个得分 token 的全词表预测,可通过 llama-perplexity 命令自行测量其他构建,与本研究结果直接对比。文件因超过 50GB 限制而分片存储,可通过 cat base-neutral.kld.*.part > base-neutral.kld 重组。

重要性矩阵

  • 来源:BF16 权重
  • 数据规模:4,967,044 tokens,涵盖 3,004 篇文档
  • 上下文:512
  • 批大小:4096
  • 特殊 token:解析为特殊标记而非标点
  • 工作节点:7 个,按块范围分布到 3 台机器

激活能量最高的张量集中在第 52 至 62 层的注意力门控,以及第 0 层的第二个峰值。

构建配置

所有构建共享相同的骨架结构:第 0-3 层和第 52-63 层在基础类型上提升一级,第 4-11 层使用基础类型,ffn_downffn_gateffn_up 高一级,注意力门控和状态输出也高一级,attn_kattn_v 保持 q8_0,多 token 预测头固定不变。

量化级别表(部分)

文件 ffn_down ffn_gate/ffn_up attn_gate ssm_out output token_embd
AD-Q6_K q6_k q6_k q8_0 q8_0 q8_0 q8_0
AD-Q5_K q5_k q5_k q6_k q6_k q6_k q4_k
AD-Q4_K q4_k q4_k q5_k q5_k q6_k iq4_xs
AD-IQ4_XS q4_k iq4_xs q5_k q5_k q6_k iq4_xs
AD-IQ2_XS iq2_xs iq2_xs q3_xxs q3_xxs q4_k iq4_xs
AD-IQ1_M iq2_xxs iq1_m iq2_s iq2_s iq4_xs iq4_xs

布局实验结果

比较了 10 种不同位分配方案,全部在相同测试条件下测量:

布局 大小 KL 散度
所有层统一处理 16.8 GB 0.01580
4 层提升 17.1 GB 0.01449
更多位分配给 ffn_down 17.8 GB 0.01189
更多位分配给注意力 18.2 GB 0.01010
16 层提升(首尾) 17.8 GB 0.00981
32 层提升 18.4 GB 0.00826
16 层提升 + 注意力门控 18.4 GB 0.00821
16 层提升 + 更丰富的输出头 18.8 GB 0.00800
24 层提升 18.6 GB 0.00743
24 层提升 + 注意力门控和状态输出 18.6 GB 0.00730

关键发现

  1. 网络的末端比中间更有价值,尾部比头部更有价值,超过 24 层的提升收益停止增长
  2. 注意力门控和状态输出各占权重的 5.5%,在两者上各加一级仅增加 0.16 GB 却消除了 11% 的剩余散度,是最佳单一权衡
  3. 嵌入表的成本比其 4.7% 的权重占比更便宜,而输出头更昂贵,用嵌入表的预算支付输出头在所有尺寸下都更优

其他发布者文件

其他发布者的文件基于其自身的参考和测试框架测量,不能直接与本研究结果对比。因此下载这些文件并用相同的参考、文本和 llama.cpp 构建重新测量,日志以发布者名称开头命名。

重要技术说明

  • Q8_0 并非无损:该模型上散度为 0.00064,top-1 准确率 98.92%
  • 多 token 预测头:正常前向传播中不执行,重要性矩阵无法获取其信息,若量化过低会导致 llama.cpp 中途停止
  • 张量行可除性:本模型的每个张量行都能被 256 整除,因此 K 和 I 量化范围完全可用;若行数不可整除,llama.cpp 会静默替换为更粗粒度类型
搜集汇总
数据集介绍
Qwen3.8-27B-GGUF-metrics 数据集图片
构建方式
该数据集是AtomicChat/Qwen3.8-27B-GGUF模型量化过程的完整工作记录,旨在提供可复现的量化比较基准。构建方式包括:首先,基于原始BF16权重转换的GGUF文件作为参考,在4096上下文长度下使用预留文本(AtomicChat/calib-corpora中的eval_neutral)计算参考困惑度(4.5219±0.0238)和逐令牌KL散度。其次,通过分布式重要性矩阵(imatrix)采集,使用7个工作节点在3台机器上分块处理约496万令牌,确保统计的准确性。最后,针对不同量化级别(从Q6_K到IQ1_M)制定了详细的张量级位分配策略,并记录了每一次量化的完整命令和日志。所有测量均在4x RTX 5090 GPU上,使用特定llama.cpp版本完成,确保环境一致性。
特点
该数据集的核心特点在于其透明性和可复现性。它提供了参考logits(以.kld文件形式存储,需拼接)、完整测量日志、量化配置和重要性矩阵,使用户能够独立验证和对比任何量化文件的性能。数据集中的所有指标均基于统一的测量协议,包括固定的上下文长度、相同的预留文本和相同的参考模型,从而消除了跨文件比较时的系统误差。此外,数据集中包含的量化布局实验(如'AD-Q4_K-L0'等)揭示了位分配对模型性能的影响,如提升首尾层位宽显著降低KL散度,而嵌入表位宽降低影响较小。这些发现为优化量化策略提供了实证依据。
使用方法
使用者可通过以下步骤重现或扩展测量:首先,下载并拼接.kld文件(使用cat命令),并查阅manifest文件确认字节数。然后,使用llama-perplexity工具,指定自己的量化模型、预留文本文件和参考logits,设置上下文长度为4096,即可计算KL散度。此外,可参考数据集中提供的量化命令日志(logs/quantize-*.log)来复现量化过程,或使用重要性矩阵(imatrix.gguf)进行自定义量化。所有日志和结果均以结构化格式存储,便于自动化分析。数据集还包含了其他发布者文件的重新测量日志,确保了跨发布者比较的公平性,使用者可以将自己的测量结果与已发布数据直接对比。
背景与挑战
背景概述
Qwen3.8-27B-GGUF-metrics数据集由AtomicChat团队于2025年创建,旨在为Qwen3.8-27B模型的GGUF量化版本提供详尽、可复现的基准测试记录。该数据集背景源于大语言模型量化部署中普遍存在的评估不一致问题——不同发布者使用各自参考模型、测试文本和构建规则,导致量化质量难以横向比较。核心研究问题是:如何在统一协议下衡量不同量化配置的优劣,并揭示量化位数分配对模型性能的影响规律。通过发布参考logits、重要性矩阵、完整构建日志和逐张量测量结果,该数据集为量化社区提供了首个可复现的‘黄金标准’,其关于网络两端层、注意力门控和输出头位分配优先级的发现,直接影响后续量化策略的设计,推动了量化评估从经验主义向科学实证的转变。
当前挑战
数据集所面临的挑战多维且严峻。领域层面,大语言模型量化评估长期受困于方法碎片化:不同研究采用各自参考模型、测试文本和上下文长度,导致结果不可比,甚至同一模型在不同驱动或GPU数量下存在位级不可复现性。构建过程中,团队需克服大规模数据处理难题,如生成51GB的BF16参考logits需拆分存储,重要性矩阵采集需跨3台机器7个工作进程协同,且必须精确处理特殊token解析;量化配置探索需在数十种布局间系统实验,平衡保持时间与性能裕度;同时,确保所有测量在4096上下文长度下进行,排除上下文长度对发散度指标的影响,并对多token预测头等无法收集校准数据的部分进行特殊处理,这些均构成严苛的技术挑战。
常用场景
经典使用场景
该数据集作为模型量化与性能评估的基准测试套件,广泛应用于对GGUF格式量化模型的比较研究。研究者通过其提供的参考logits、held-out文本及精确的构建规则,可在统一条件下量化不同量化策略的精度损失与性能权衡,从而客观评估各量化方案的优劣。该数据集为llama.cpp生态中的量化实验提供了标准化的可复现流程,是推动量化技术迭代的基石性资源。
解决学术问题
它解决了量化模型评估中普遍存在的不可复现与基准不一致问题。传统量化研究常因参考模型、测试文本或测量协议差异导致结果无法横向比较,该数据集通过发布完整的参照系、校准语料及详细的构建日志,确立了严格的评估规范,使不同发布者的量化文件能在同一标准下公平对比,为量化理论的发展提供了可靠的数据支撑。
衍生相关工作
该数据集已催生诸多衍生工作,包括但不限于:针对混合架构模型(如Qwen3.8融合注意力与状态空间)的层间比特分配策略优化研究、基于重要性矩阵的量化敏感度分析,以及跨量化格式的自动评估工具开发。其提供的可复现实验环境为基础,研究者们进一步探索了不同量化类型(如IQ系列)的极限压缩潜力,并推动了llama.cpp等推理框架中量化内核的改进,影响深远。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务