遇见数据集

GLM-5.3-Flash-fidelity-suite-v1

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

该数据集是 GLM-5.3-Flash Fidelity Suite v1,旨在为 GLM-5.3-Flash 模型(2026年8月26日发布)提供历史分布保真度证据。数据集包含 BF16 参考和 FP8 服务下的隐藏状态捕获、共享的 LM 头部,以及来自声明的捕获/重放路径的凭证。兼容的候选捕获可以在匹配的已发布位置上进行比较,无需持有 643 GB 的参考模型。数据集包含以下内容: - `suite/`:令牌和清单(分区为分析/验证/哨兵) - `reference-bf16-shard0/` 和 `as-served-fp8-shard0/`:各包含 512 个上下文,每个上下文有 [2047, 4096] 的 BF16 隐藏状态(完整运行有 5120 个上下文,但公开分片仅包含 512 个) - `head/`:共享的 BF16 lm_head(154,880 x 4,096)和最终归一化层及其提取凭证 - `reports/`:KLD 报告及所有凭证,包括 `SHA256SUMS` 覆盖所有文件 完整运行包含 5120 个上下文,每个上下文 2048 个令牌,共 10,480,640 个评分位置。主要指标:令牌平均 KLD 为 0.028104 nats,top-1 一致性为 0.9427。该数据集适用于量化保真度评估,允许用户通过提供的隐藏状态和头部,对自己的量化模型进行评分和比较。注意:公开分片不完整,且存在已知的运行间不一致性和校准污染问题,具体细节见 README 中的修正和说明。

This dataset is the GLM-5.3-Flash Fidelity Suite v1, designed to provide historical distribution fidelity evidence for the GLM-5.3-Flash model (released on August 26, 2026). It includes hidden state captures under BF16 reference and FP8 serving, a shared LM head, and credentials from the declared capture/replay path. Compatible candidate captures can be compared on matched published locations without holding the 643 GB reference model. The dataset contains suite/, reference-bf16-shard0/, as-served-fp8-shard0/, head/, and reports/ directories, including tokens, hidden states, head, and KLD reports. The full run has 5120 contexts, but the public shard contains only 512. Key metrics: token-average KLD is 0.028104 nats, top-1 agreement is 0.9427. It is suitable for quantization fidelity evaluation. Note: public shard is incomplete, and there are known run-to-run inconsistencies and calibration contamination issues.

创建时间:
2026-08-27
原始信息汇总

数据集概述

GLM-5.3-Flash Fidelity Suite v1 是一个用于记录和验证 GLM-5.3-Flash(发布于 2026-08-26)模型在 BF16 参考与 FP8 实际服务配置下隐状态分布的保真度证据集合。该数据集并非一个通用的模型服务质量评分数据集,而是为特定协议下的对比验证提供依据。

核心内容与结构

  • 历史全量运行测量:提供了 FP8 与 BF16 重放对比的统计指标(如 Token 平均 KLD 为 0.028104 nats,Top-1 一致性为 0.9427),并区分了不同文本类型(如代码、百科、文学等)的细分 KLD 结果。所有数据均为固定语料库的描述性统计,而非面向部署总体的推断。
  • 证据文件:包含密封的 KLD 报告 (reports/*.json)、引擎启动日志、堆栈来源追溯文件等,用于支持已发布的保真度数字的可验证性。
  • 公开数据子集:每个分片(reference-bf16-shard0/as-served-fp8-shard0/)包含 512 个上下文,少于历史全量运行的 5,120 个上下文。这些隐状态均为最终 RMSNorm 后的输出,使用时需直接应用共享的 lm_head
  • 共享组件:提供了共享的 BF16 lm_head(维度 154,880 x 4,096)和最终归一化层及相关提取收据。
  • 评估套件suite/ 目录包含分词后的 token 数据与清单,供使用者自行评分其他量化模型。

修复与范围说明

  • 2026-09-08 修正:此数据卡片已明确区分历史全量运行与当前公开的子集,并撤回了早前关于跨通道比率、重放等效性和噪声界限的不恰当声明。原始报告文件内容与字节数未改动。
  • 校准污染范围:检测到原 25 窗口评估面板中,一个领域与校准材料共享 37-39% 的 13-gram,尽管在文档哈希层面无重复。基于社区建议,数据发布者基于更严格的 17 窗口校准干净范围重新计算了部分指标,并提供了完整报告。

已知问题与确定性干预

  • 运行间的非确定性:初始的 vLLM 测量显示了跨启动的字节差异。尽管进行了多种干预(如固定 NCCL 配置),但未完全消除差异,且未能唯一确定原因。
  • 干预实验记录:文档中列出了不同配置下哨兵上下文对字节完全一致的比例,最高记录为配置固定后达到 31/32。

技术参数与固定值

  • 模型版本固定:BF16 参考模型版本为 zai-org/GLM-5.3-Flash-BF16 @ 特定提交哈希,FP8 服务版本为 zai-org/GLM-5.3-Flash @ 特定提交哈希。
  • 硬件与引擎环境:明确记录了使用 vLLM 引擎、TP8 H200 GPU、eager 模式、TF32 关闭等配置细节。

相关资源与后续工作

  • 数据集页面提供了指向其他相关数据集页面的链接,例如校准激活数据集(malaiwah/GLM-5.3-Flash-calibration-activations-v1)以及后续的 K6/K8 量化工件页面。
  • 详细的方法论文档(如 WHAT-WE-MEASURE.md)和数据规范可以在相关的 GitHub 仓库中找到,用于深入理解测量协议。
搜集汇总
数据集介绍
GLM-5.3-Flash-fidelity-suite-v1 数据集图片
构建方式
该数据集是GLM-5.3-Flash模型分布保真度评估的配套证据集,由历史全量运行与公开抓取子集构成。其核心构建路径为:通过统一的BF16参考模型与FP8服务模型,在同一共享LM头下执行两遍全词表KL散度计算,捕获各自隐藏状态并生成密封收据。数据组织上,`reference-bf16-shard0/`与`as-served-fp8-shard0/`分别包含512个上下文的隐藏状态,而`suite/`目录存放tokens与清单,`reports/`收纳各类测量报告与运行日志。构建过程严格遵循fidelity-provenance/v1规范,确保每个数值都有可溯源的堆栈声明与重放路径。
使用方法
使用该数据集时,用户需首先从`suite/tokens/`获取测试tokens,对自有量化模型进行教师强制的前向传播,捕获最终RMSNorm后的隐藏状态。随后,通过共享的BF16 `lm_head`与`final norm`,利用保真度评估工具链对隐藏状态进行重放,并计算与`reference-bf16-shard0`中参考状态之间的精确两遍全词表KL散度。数据集提供了完整的协议文档与代码库,用户可参照`WHAT-WE-MEASURE.md`确保评估条件一致。对于对比自身量化结果,只需按清单调用相应脚本,即可生成可比对的KLD值,并参照清洁范围报告进行可信度评估。
背景与挑战
背景概述
GLM-5.3-Flash-fidelity-suite-v1数据集由独立研究者malaiwah于2026年8月创建,旨在为GLM-5.3-Flash模型(2026年8月26日发布)提供量化的分布保真度证据。该数据集记录了BF16参考与FP8服务版本在隐藏状态层面的对比,通过共享的LM头进行精确的两遍全词汇KL散度计算,覆盖5120个上下文共1048万个评分位置。其核心研究问题在于建立可复现的量化模型保真度评估协议,以应对大语言模型量化部署中日益突出的可靠性挑战。该数据集在发布后迅速引发社区关注,尤其在模型量化评估领域产生了方法论影响,后续的K6/K8相关研究亦基于其框架展开,显示出其在推动量化保真度标准化测量方面的重要价值。
当前挑战
该数据集所面临的挑战多维且深刻。首先,在领域层面,它直面大语言模型量化部署中分布偏移难以精确量化的问题,传统指标如困惑度不足以捕捉细粒度的概率分布变化,而KLD等指标又对计算资源要求极高,需要处理643GB的参考模型权重。其次,在构建过程中,研究遭遇了显著的跨运行非确定性:同一配置下多次独立引擎加载产生不同输出,初步归因于Triton自动调优但未被证据唯一支持,后续通过调整NCCL与CUBLAS参数虽将字节一致率从20/32提升至31/32,却仍无法彻底消除差异。此外,校准数据集污染问题浮出水面,文档哈希级去重不足以排除13-gram重叠,需引入更严格的校准-洁净范围重新计算,导致早期部分比率声明被撤回,凸显了浮点运算、通信协议与数据纯净性等多重因素对可靠性评估的复杂干扰。
常用场景
经典使用场景
该数据集作为GLM-5.3-Flash模型在BF16参考精度与FP8量化服务精度之间的分布保真度证据集,其经典使用场景在于对量化模型进行隐蔽状态(hidden states)层面的保真度评估。研究者借助其记录的KLD、JSD及top-1一致性指标,复现层间分发的一致性检测协议,以验证量化过程中信息损失的下界。其提供的缩放头(lm_head)与归一化参数,使得无需加载完整的643GB参数即可进行候选模型的对比分析,从而支撑大规模语言模型量化效果的精确审计。
解决学术问题
该数据集直面量化模型研究中分布偏移难以度量与复现的核心学术困境。通过引入固定语料库下的两遍全词表KL散度(KLD)测量方法,它提供了对FP8相对BF16表示差异的量化基线,解决了以往依据困惑度或任务精度难以精准定位量化误差分布的问题。其明确区分全量运行与公开子集,并记录运行间非确定性的证据,促进了关于推理引擎确定性对保真度测量影响的科学探讨,推动了量化保真度评估从黑盒走向可验证的白盒范式。
实际应用
在实际应用中,该数据集为模型部署前的量化选型与风险控制提供了实证依据。其校准清洁范围的重新计算揭示了文档哈希级去重的不足,强调了基于n-gram重叠分析在避免数据污染中的关键作用。该数据集为推理引擎配置(如vLLM的环境变量与内核选择)对输出复现性的影响提供了可操作的测试平台,帮助工程团队在成本敏感的FP8部署与质量优先的BF16部署间做出权衡,并通过对比不同量化位数(K6/K8)的保真度数据,指导混合精度策略的制定。
数据集最近研究
最新研究方向
GLM-5.3-Flash-fidelity-suite-v1数据集聚焦于大语言模型量化保真度评估的前沿探索,其研究重心在于建立严谨的分布保真度量框架,以验证不同精度部署(如FP8)与BF16参考基准之间的统计一致性。近期研究热点包括通过共享语言模型头的隐状态重放协议,实现低成本、可复现的KLD度量,并针对量化过程中出现的跨运行不确定性,探索栈级固定(如调整通信库与内核配置)以提升字节级确定性。该数据集的价值在于推动了量化模型评估方法论的科学化,强调了文档哈希去重不足以规避校准污染,倡导细粒度的n-gram重叠检测,从而为社区树立了更高标准的可验证性范例,其影响延伸至模型部署的可靠性保障与量化技术的可信度认证。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务