qwen38-27b-fidelity-suite-v5
收藏资源简介:
Qwen3.8-27B Fidelity Suite v5 是一个专门用于评估量化或压缩方法对 Qwen3.8-27B 模型影响的数据集。其核心目标是提供可复现的评估基准,通过 KL 散度 (KLD) 衡量量化候选模型与 BF16 参考模型之间的保真度。数据集包含评估输入、BF16参考隐藏状态、分片视图和报告、跨引擎报告、候选捕获数据、语料库文本和镜像构件等组成部分。
Qwen3.8-27B Fidelity Suite v5 is a dataset specifically designed for evaluating the impact of quantization or compression methods on the Qwen3.8-27B model. Its core goal is to provide reproducible evaluation benchmarks, measuring the fidelity between quantized candidate models and the BF16 reference model via KL divergence (KLD). The dataset includes evaluation inputs, BF16 reference hidden states, shard views and reports, cross-engine reports, candidate capture data, corpus text, and mirror artifacts.
数据集概述
Qwen3.8-27B Fidelity Suite v5 是一个用于评估量化模型保真度的数据集,专注于通过 KL 散度(KLD)度量候选模型与 BF16 参考模型之间的差异。该数据集提供可重放的评估输入、BF16 参考隐藏状态以及完整的逐分片报告,以便第三方无需原始硬件即可验证或复现实验结果。
- 许可证: Apache-2.0
- 任务: 文本生成(text-generation)
- 语言: 英语
- 规模: 1K 至 10K 条样本
- 标签: kl-divergence, quantization, fidelity, qwen3, evaluation
核心内容
1. 评估套件
- 包含 5,120 个上下文,每个上下文 2,048 个 token,共 10,480,640 个评分位置,来源于 842 个源聚类。
- token 文件为权威评估输入,重分词源文本无法复现该输入。
- 套件被划分为 10 个分片(每个 512 个上下文),并提供分片视图,确保逐分片报告可独立验证。
2. 参考数据
- BF16 参考隐藏状态: 512 个文件,每个形状为 [2047, 5120] 的 bf16 张量,覆盖分片 0 的上下文,是最可复用的工件,未来候选模型可据此重放而无需重新捕获 BF16。
- 共享 BF16 LM 头: 未包含在本数据集中,已在 v3 套件中发布(sha256 已验证相同)。
3. 报告
- 50 份逐分片报告: 覆盖 5 个候选模型(hyd, k5k6, ctx, fp8, k4)的完整十分片阶梯。
- 10 份尾部分片报告: 提供百分位数和精确超过计数。
- 15 份评分窗口控制报告: 检验评分位置对结果的影响。
- 4 份跨引擎报告: 包含 llama.cpp 和 vLLM 的对比结果。
4. 候选捕获
- 提供分片 0 的候选隐藏状态捕获,包括 NVFP4、错误驱动分配研究构建、已发布水印检查点及其兄弟版本(差异仅在于 399 个 .trellis 载荷)。
5. 语料库
- 包含 941 篇文档(69 MB)的全文,分五个地层目录,附有逐文档 sha256 和归属信息,用于支持污染排除的再推导。
关键实验数据
分片 0 的结果(512 上下文,1,048,064 评分位置)
| 候选模型 | 平均 KLD | 净跨引擎底层 |
|---|---|---|
| llama.cpp GGUF Q8_0 | 0.001087 | ~0.000579 |
| llama.cpp GGUF Q6_K | 0.002035 | ~0.001528 |
| EXL3 K5/K6 水印 | 0.002700 | — |
| EXL3 K5/K6 在线 | 0.003141 | — |
| EXL3 上下文 + int8 输入 | 0.003409 | — |
| llama.cpp GGUF UD-Q5_K_XL | 0.004444 | ~0.003936 |
| 官方 Qwen FP8 | 0.005197 | — |
| EXL3 K4 | 0.010345 | — |
完整十分片阶梯(10,480,640 评分位置,842 聚类)
| 候选模型 | 平均 KLD | 95% 区间 | top-1 |
|---|---|---|---|
| EXL3 K5/K6 水印 | 0.002760 | [0.002540, 0.003020] | 97.70% |
| EXL3 K5/K6 在线 | 0.003210 | [0.002982, 0.003480] | 97.52% |
| EXL3 上下文 + int8 输入 | 0.003509 | [0.003220, 0.003852] | 97.44% |
| 官方 Qwen FP8 | 0.005294 | [0.004927, 0.005728] | 96.79% |
| EXL3 K4 | 0.010604 | [0.009640, 0.011746] | 95.76% |
关键结论
- 跨引擎底层为 0.000507(llama.cpp 对 vLLM,使用相同未量化 BF16 权重)。
- 评分窗口控制实验表明,评分位置的选择对排名无实质影响(变化均匀低至 1.3-4.9%)。
- 转换器非确定性实验显示,同一配方的不同转换(兄弟版本)在保真度上差异可忽略(区间包含零),即配方是可重复的,而字节是工件。
配套资源
- 研究仓库: https://github.com/malaiwah/qwen38-27b-exl3(包含保真度工具和阶梯驱动脚本)
- 档案镜像: 两个模型仓库,分别用于恢复(NVFP4 版本被上游压扁)和预防性备份(GGUF 文件),确保已发布引用的持久可解析性。
使用方式
用户可通过 replay 命令将自有检查点与已发布的 BF16 参考对比评分,无需重新捕获 BF16 或重分词。该命令是失败关闭的,任何不匹配都会导致拒绝,从而保证报告的可比性。验证下载完整性的方法与命令在 README 中有详细说明。




