遇见数据集

qwen38-27b-fidelity-suite-v5

收藏
Hugging Face2026-08-16 更新2026-08-17 收录
官方服务:

资源简介:

Qwen3.8-27B Fidelity Suite v5 是一个专门用于评估量化或压缩方法对 Qwen3.8-27B 模型影响的数据集。其核心目标是提供可复现的评估基准,通过 KL 散度 (KLD) 衡量量化候选模型与 BF16 参考模型之间的保真度。数据集包含评估输入、BF16参考隐藏状态、分片视图和报告、跨引擎报告、候选捕获数据、语料库文本和镜像构件等组成部分。

Qwen3.8-27B Fidelity Suite v5 is a dataset specifically designed for evaluating the impact of quantization or compression methods on the Qwen3.8-27B model. Its core goal is to provide reproducible evaluation benchmarks, measuring the fidelity between quantized candidate models and the BF16 reference model via KL divergence (KLD). The dataset includes evaluation inputs, BF16 reference hidden states, shard views and reports, cross-engine reports, candidate capture data, corpus text, and mirror artifacts.

创建时间:
2026-08-16
原始信息汇总

数据集概述

Qwen3.8-27B Fidelity Suite v5 是一个用于评估量化模型保真度的数据集,专注于通过 KL 散度(KLD)度量候选模型与 BF16 参考模型之间的差异。该数据集提供可重放的评估输入、BF16 参考隐藏状态以及完整的逐分片报告,以便第三方无需原始硬件即可验证或复现实验结果。

  • 许可证: Apache-2.0
  • 任务: 文本生成(text-generation)
  • 语言: 英语
  • 规模: 1K 至 10K 条样本
  • 标签: kl-divergence, quantization, fidelity, qwen3, evaluation

核心内容

1. 评估套件

  • 包含 5,120 个上下文,每个上下文 2,048 个 token,共 10,480,640 个评分位置,来源于 842 个源聚类。
  • token 文件为权威评估输入,重分词源文本无法复现该输入。
  • 套件被划分为 10 个分片(每个 512 个上下文),并提供分片视图,确保逐分片报告可独立验证。

2. 参考数据

  • BF16 参考隐藏状态: 512 个文件,每个形状为 [2047, 5120] 的 bf16 张量,覆盖分片 0 的上下文,是最可复用的工件,未来候选模型可据此重放而无需重新捕获 BF16。
  • 共享 BF16 LM 头: 未包含在本数据集中,已在 v3 套件中发布(sha256 已验证相同)。

3. 报告

  • 50 份逐分片报告: 覆盖 5 个候选模型(hyd, k5k6, ctx, fp8, k4)的完整十分片阶梯。
  • 10 份尾部分片报告: 提供百分位数和精确超过计数。
  • 15 份评分窗口控制报告: 检验评分位置对结果的影响。
  • 4 份跨引擎报告: 包含 llama.cpp 和 vLLM 的对比结果。

4. 候选捕获

  • 提供分片 0 的候选隐藏状态捕获,包括 NVFP4、错误驱动分配研究构建、已发布水印检查点及其兄弟版本(差异仅在于 399 个 .trellis 载荷)。

5. 语料库

  • 包含 941 篇文档(69 MB)的全文,分五个地层目录,附有逐文档 sha256 和归属信息,用于支持污染排除的再推导。

关键实验数据

分片 0 的结果(512 上下文,1,048,064 评分位置)

候选模型 平均 KLD 净跨引擎底层
llama.cpp GGUF Q8_0 0.001087 ~0.000579
llama.cpp GGUF Q6_K 0.002035 ~0.001528
EXL3 K5/K6 水印 0.002700
EXL3 K5/K6 在线 0.003141
EXL3 上下文 + int8 输入 0.003409
llama.cpp GGUF UD-Q5_K_XL 0.004444 ~0.003936
官方 Qwen FP8 0.005197
EXL3 K4 0.010345

完整十分片阶梯(10,480,640 评分位置,842 聚类)

候选模型 平均 KLD 95% 区间 top-1
EXL3 K5/K6 水印 0.002760 [0.002540, 0.003020] 97.70%
EXL3 K5/K6 在线 0.003210 [0.002982, 0.003480] 97.52%
EXL3 上下文 + int8 输入 0.003509 [0.003220, 0.003852] 97.44%
官方 Qwen FP8 0.005294 [0.004927, 0.005728] 96.79%
EXL3 K4 0.010604 [0.009640, 0.011746] 95.76%

关键结论

  • 跨引擎底层为 0.000507(llama.cpp 对 vLLM,使用相同未量化 BF16 权重)。
  • 评分窗口控制实验表明,评分位置的选择对排名无实质影响(变化均匀低至 1.3-4.9%)。
  • 转换器非确定性实验显示,同一配方的不同转换(兄弟版本)在保真度上差异可忽略(区间包含零),即配方是可重复的,而字节是工件。

配套资源

  • 研究仓库: https://github.com/malaiwah/qwen38-27b-exl3(包含保真度工具和阶梯驱动脚本)
  • 档案镜像: 两个模型仓库,分别用于恢复(NVFP4 版本被上游压扁)和预防性备份(GGUF 文件),确保已发布引用的持久可解析性。

使用方式

用户可通过 replay 命令将自有检查点与已发布的 BF16 参考对比评分,无需重新捕获 BF16 或重分词。该命令是失败关闭的,任何不匹配都会导致拒绝,从而保证报告的可比性。验证下载完整性的方法与命令在 README 中有详细说明。

搜集汇总
数据集介绍
qwen38-27b-fidelity-suite-v5 数据集图片
构建方式
该数据集是针对Qwen3.8-27B模型保真度评估的精心构建的输入与参考集,旨在支撑KLD(KL散度)度量的可重复性研究。其构建过程严格遵循可追溯性原则,包含5,120个上下文,每个上下文2,048个token,生成超过千万个评分位置。数据集的权威输入以token-id文件形式存放,确保与原始文本的重分词无关,并配套完整的套件清单、分片视图及命令脚本。尤为关键的是,该数据集保留了BF16参考隐藏状态,作为未来候选模型的固定基准,从而免除了重复捕获昂贵硬件资源的需求。
特点
该数据集的核心特色在于其深度保真与可比性设计。所有KLD计算均通过共享的BF16语言模型头进行,排除了模型自身头部的干扰,确保评分公正。数据集不仅包含候选模型的隐藏状态捕获,还纳入了跨引擎(如llama.cpp与vLLM)的对照报告,提供了引擎差异的基准线。此外,针对转换器非确定性问题,数据集特别收录了兄弟模型捕获,并通过配对分析量化了转换过程的保真度变异范围,其差异区间包围零,证实了配方的可重复性而字节的非唯一性。
使用方法
使用该数据集时,研究者可依据详尽的文档执行验证与回放流程。首先,通过脚本校验下载文件的完整性。随后,利用提供的工具对自有候选模型进行隐藏状态捕获,并针对BF16参考执行回放评分,此过程不依赖GPU捕获或原始模型权重。回放操作采用失败封闭机制,确保评分报告的可靠性。最终结果可与已发布的候选模型报告进行配对比较,或通过聚合工具汇总多个分片报告,以获取综合性能评估。
背景与挑战
背景概述
Qwen3.8-27B Fidelity Suite v5由malaiwah研究团队于2026年创建,旨在解决大规模语言模型量化后保真度评估的可复现性与可比性问题。该数据集针对Qwen3.8-27B模型,通过收集5120个上下文(每个2048个token)的最终隐状态,并利用统一的BF16语言模型头计算KL散度(KLD),构建了一套完整的评估协议。其核心创新在于将评估输入、BF16参考输出及分片报告全部公开,使得任何研究者无需GPU即可重放候选模型的评估,从而大幅降低了验证成本。该数据集已被用于对比多种量化方案(如EXL3的K5/K6、官方FP8等)的保真度,并揭示了转换器非确定性对结果的影响,为量化研究提供了严谨的基准,对推动可复现的模型压缩研究具有重要意义。
当前挑战
该领域的主要挑战在于量化模型保真度的评估缺乏标准化和可复现性。传统方法依赖私有硬件重新生成参考输出,导致结果难以独立验证,且不同研究的评估协议不统一,使得跨模型比较失真。本数据集构建过程中,面临了多个具体挑战:一是部分语料源已失效,导致文本不可重构,需发布69MB原始文本以保障污染排除的可验证性;二是BF16参考的捕获成本高昂,仅对分片0进行完整保存,其余分片需重新计算;三是转换器的非确定性导致相同配方生成不同字节的量化模型,但保真度差异极小(置信区间包含零),需通过严格的对照实验(如兄弟模型)来界定协议的分辨率;此外,上传与存储的权衡也需审慎决策,如在保存候选隐状态与节省约190GB上传量之间进行取舍。
常用场景
经典使用场景
该数据集作为大语言模型量化保真度评估的基准套件,其核心用途在于为不同量化方案提供可复现的、基于KL散度的保真度度量。研究者可借助其精心设计的5,120段上下文(每段2,048令牌)与2,047个评分位置,对候选量化模型的最终隐藏状态进行标准化捕获与对比。通过其共享的BF16参考隐藏状态与统一语言模型头,该数据集支持对量化模型进行精确的、无需原始硬件的重放式评估,从而在统一的协议下评判如EXL3 K5/K6、FP8等各类量化策略的保真度表现。
衍生相关工作
围绕该数据集,已衍生出一系列深化量化理解的工作。其中,关于转换器非确定性的研究尤为引人注目:通过构建“孪生检查点”(sibling checkpoint),研究人员精确量化了因转换器重跑导致的细微字节差异对最终保底真度的影响,结果显示在95%置信区间内差异为零,从而证明了量化配方(recipe)的可重复性而不仅仅是字节的稳定性。另一项工作则通过“误差驱动分配”实验,探索了基于代理误差梯度的非均匀比特分配策略,尽管该候选方案在严格对比中落败,但其发布的详细阶梯数据与捕获记录为后续研究提供了宝贵的负面案例与方法论参考。这些工作共同推动了量化评估方法论向更严谨、更注重可复现性的方向发展。
数据集最近研究
最新研究方向
该数据集聚焦于大语言模型量化保真度的前沿评估,以Qwen3.8-27B为基准,通过KL散度(KLD)度量BF16参考与各类量化候选(如NVFP4、GGUF等)在共享LM头下的差异,并创新性地公开了可重放的输入、BF16参考隐藏状态及分片报告,以支持无需GPU的离线重演验证。研究亮点在于对转换器非确定性影响的量化分析(约97.6%的模块字节差异但保真度一致),以及跨引擎性能地板的测定,为未来量化方案提供了可复现的基准和对照,推动了模型压缩领域评估方法的透明化与标准化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务