遇见数据集

gemma-4-26b-a4b-it-distribution-fidelity-768x2048-v1

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

本数据集(或工件)是关于 gemma-4-26B-A4B-it 模型量化方案 fidelity 评估的集合。它基于 distribution-fidelity 法则(版本12)对多个候选量化方案进行评分,包括 FP8、AWQ 等多种量化方法。每个候选方案提供了其在磁盘上的大小、QxQ(量化输出与参考输出之间的)KL散度、BxQ(参考输出与量化输出之间的)KL散度、以及两者的差值、自然路由翻转率和精确重复认证状态。数据集中包含每个候选目录下的单页报告(report.md)、原始报告、合规收据以及 Law 14 归属信息(如有)。此外,reference/ 目录包含可复用的教师张量和头部,便于第三方在不加载参考检查点的情况下对新候选方案进行评分。checksums.txt 覆盖所有文件的校验和。数据集还提供了 QxQ 和 BxQ 的 fidelity 与磁盘大小的图表及对应的 JSON 数据文件(kld-vs-size.json)。特别地,某些已知有问题的检查点被明确排除并记录原因。该数据集适用于评估和比较不同量化技术对模型分布保真度的影响,以及量化模型大小与保真度之间的权衡。

This dataset (or artifact) is a collection of fidelity evaluations for quantization schemes of the gemma-4-26B-A4B-it model. It scores multiple candidate quantization schemes (including FP8, AWQ, etc.) based on the distribution-fidelity law (version 12). For each candidate, it provides disk size, QxQ (quantized output vs reference output) KL divergence, BxQ (reference output vs quantized output) KL divergence, their difference, natural route flip rate, and exact duplicate certification status. The dataset includes per-candidate single-page reports (report.md), raw reports, compliance receipts, and Law 14 attribution information (if any). The reference/ directory contains reusable teacher tensors and heads, enabling third parties to score new candidates without loading the reference checkpoint. checksums.txt covers checksums of all files. It also provides charts of QxQ and BxQ fidelity vs. disk size and corresponding JSON data files (kld-vs-size.json). Notably, certain known problematic checkpoints are explicitly excluded with reasons recorded. This dataset is suitable for evaluating and comparing the impact of different quantization techniques on model distribution fidelity, as well as the trade-off between quantized model size and fidelity.

创建时间:
2026-09-03
原始信息汇总

gemma-4-26B-A4B-it 量化分析数据集详情

这是一个针对 gemma-4-26B-A4B-it 模型的量化分析数据集,主要评估不同量化方案下模型的分发保真度(distribution fidelity),以平均KL散度(Mean KL divergence)作为核心指标,并将其与模型的磁盘占用大小进行对比分析。

核心评估方法

  • 使用的评估指标为 KL散度(Kullback-Leibler divergence),分别计算:
    • QxQ KLD:量化模型与量化模型之间的KL散度,衡量量化方案自身的稳定性
    • BxQ KLD:基准(fp8动态量化参考)模型与量化模型之间的KL散度,衡量相对于参考的失真程度
  • 分数在 分发保真度法则(distribution-fidelity laws)版本12 下评定,仅在同测试套件、几何配置和运行环境内具有可比性,不能与其他来源的数据直接比较
  • 每个候选模型目录均包含:单页报告(report.md)、原始报告、合规收据,以及第14法则归属报告(如适用)
  • 数据集中提供可复用的教师张量和头部(reference目录),第三方无需加载参考检查点即可对新候选模型进行评分

候选量化模型对比

数据集评估了9个主流量化模型版本,按QxQ KLD从低到高排列:

排名 候选模型 量化方案 磁盘大小 (GiB) QxQ KLD BxQ KLD
1 RedHatAI gemma-4-26B-A4B-it-FP8-dynamic fp8_per_channel 26.68 0.6942 0.4978
2 cyankiwi AWQ-4bit int4_g32_sym 16.01 1.0263 0.8409
3 dhruvil237 W4A16 int4_g64_sym 14.58 1.1593 1.0125
4 unsloth NVFP4 nvfp4 15.75 1.1630 1.0012
5 Intel int4-AutoRound int4_g128_sym 14.31 1.1782 0.9031
6 lcu0312 AWQ-4bit int4_g32_sym 16.01 1.2359 1.0801
7 RedHatAI NVFP4 nvfp4 15.30 1.7558 1.5313
8 Neural-ICE NVFP4 nvfp4 15.29 1.8188 1.5887
9 bg-digitalservices NVFP4 nvfp4 15.29 1.8255 1.5867

关键分析指标

  • 自然路由翻转率(Natural route flips):范围从50.68%到93.07%,Intel的int4-AutoRound表现出最高的自然路由翻转率
  • 精确重复(Exact repeat):所有候选模型均获得 certified 认证,表明其重复行为已通过验证
  • QxQ与BxQ之差:反映了模型内部路由对量化扰动的稳定程度,差异范围从0.147到0.275

数据资源

数据集提供了可视化图表(QxQ和BxQ KLD与磁盘大小的关系图)以及结构化数据文件 kld-vs-size.json,供深入分析使用。

排除的检查点

  • cklaus/gemma-4-26B-A4B-it-NVFP4(特定修订版本)被明确排除,原因是在不同的vLLM运行版本上测试,导致其报告绑定了不再公开的参考数据,无法与其他候选模型进行同组比较,故此结果被撤回而非重新评分
搜集汇总
数据集介绍
gemma-4-26b-a4b-it-distribution-fidelity-768x2048-v1 数据集图片
构建方式
本数据集源于对gemma-4-26B-A4B-it模型量化方案的系统评估,通过构建标准化的评测协议,对多种量化算法(如FP8、AWQ、NVFP4等)在模型路由层与块层的分布保真度进行对比分析。数据构建采用分阶段流程:首先选定参考模型并提取教师张量及头信息,确保可复现性;随后在统一运行时环境下,对每个量化候选模型计算其与参考模型间的KL散度(QxQ与BxQ),并附以自然路由翻转率及重复性校验。所有评测数据、报告及合规性摘要均以标准化目录结构存储,并生成校验和以保证完整性。通过显式排除已知问题修订版本,确保数据集的严谨与公正。
特点
数据集的核心特色在于其精细化的量化 fidelity 度量框架,将分布保真度细化为QxQ与BxQ两个维度,有效捕捉量化和路由对模型输出的影响。引入了分布保真度法则(版本12)作为评分依据,强调数据仅在特定token套件、几何构型及运行时身份下具有可比性,突显评测的严格边界。每个候选方案均附带详尽的一页报告、原始数据、合规收据及法律14归属,便于审计与追溯。数据与可视化图表并列,强调证据的客观性,且通过排除已知问题版本,避免误导性比较,提升数据的可信赖度。
使用方法
本数据集适用于量化模型开发者与研究者,用于比较不同量化策略在保持模型分布保真度上的优劣,并权衡模型体积与性能损失。用户可根据目录结构快速定位候选模型报告及原始量化数据,利用参考张量对新候选方案进行独立评分,无需加载完整参考检查点。通过解析kld-vs-size.json可复现尺寸-保真度图表,深入分析趋势。使用时需注意遵循LAWS.md中定义的兼容性规则,确保评测结果仅在规定条件下有效,且不可跨数据集或运行环境直接比较。典型应用包括筛选最优量化配置、验证新量化算法,以及作为模型压测的基准参考。
背景与挑战
背景概述
随着大规模语言模型在推理和部署中的广泛应用,模型量化技术成为平衡性能与资源消耗的关键手段。Gemma-4-26B-A4B-it作为一款具有26B参数和4B激活参数的混合专家模型,其量化后的分布保真度直接影响生成质量。该数据集于2025年创建,由多个研究机构(如RedHatAI、Intel、unsloth等)联合贡献,旨在系统评估不同量化方案(如FP8、INT4、NVFP4)对模型输出分布的影响。核心研究问题在于,如何在不牺牲模型行为忠实度的前提下,通过量化压缩模型体积。该数据集通过引入KL散度作为分布保真度的量化指标,并遵循特定的评估协议,为量化技术提供了统一的比较基准,推动了高效模型部署领域的研究进展。
当前挑战
该数据集面临的首要挑战是量化过程中固有的信息损失,尤其是在混合专家模型中,路由决策的微小偏差可能导致下游任务性能的显著波动。表中所列的KL散度值(如QxQ和BxQ)均大于0,反映了量化前后输出分布的系统性偏移,且不同量化方法(如AWQ、AutoRound、NVFP4)在保真度与压缩率之间呈现不同的权衡。其次,构建过程中需克服多源模型变体间的可比性问题,因各候选模型采用不同的量化方案、校准策略,甚至推理引擎版本,如某个被排除的检查点因使用不兼容的vLLM版本而被撤销,这要求制定严格的评估规则(如法律12条),以确保指标仅在特定上下文内有效。此外,数据集的评估依赖于固定的token集和几何配置,使得不同量化方案在跨硬件或跨运行时环境下的泛化能力成为持续性挑战。
常用场景
经典使用场景
本数据集为对大语言模型gemma-4-26B-A4B-it的量化变体进行分布保真度评估而构建,其在现代模型量化的实证研究中扮演核心基准角色。数据集囊括了若干主流量化方案(如FP8动态、INT4 AWQ、NVFP4等)在指定token套件与几何配置下的KL散度测量结果,同时附带详尽的一页报告、合规收据及归属信息,使研究者能够系统地评判不同压缩策略对模型原始概率分布的破坏程度。因此,它成为对比量化算法、验证压缩理论及标定超参数的经典工具,尤其适用于对路由混合专家模型分布行为敏感的研究场景。
实际应用
在实际工业部署中,该数据集可作为模型压缩与运维决策的指导性资源。它提供的KLD-体积权衡曲线,使得工程师能够在保持可接受的分布偏移前提下,挑选占用磁盘空间最小的量化检查点,从而显著降低推理时的显存与带宽需求。尤其对于部署路由混合专家模型的服务商,该数据集的‘自然路由翻转率’等指标有助于预估量化后端对路由决策的扰动,进而用于版本质量管理或候选模型筛选中。据此,团队可依据合规收据与checksum实现对大型模型资产的溯源与审计,优化模型上线流程。
衍生相关工作
本数据集的评估框架与其中蕴含的‘distribution-fidelity laws’理念,孕育了多个衍生研究方向。其一,它激发了针对量化模型的可复现评估协议设计,强调注释文件中的law-specific comparability约束,塑造了后续研究所遵循的标准范式。其二,其排除的‘孤群’候选(如特定版本的NVFP4模型)凸显了运行时与参考捕获一致性的重要,从而推动了模型托管与变动追踪工具的改进。更为深远的是,通过公开教师张量与评分中间文件,数据集为第三方构建类似的模型保真度基准提供了蓝图,促进了协同式模型认证网络的形成。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务