GLM-5.3-Flash-fidelity-suite-v1
收藏资源简介:
该数据集是 GLM-5.3-Flash Fidelity Suite v1,旨在为 GLM-5.3-Flash 模型(2026年8月26日发布)提供历史分布保真度证据。数据集包含 BF16 参考和 FP8 服务下的隐藏状态捕获、共享的 LM 头部,以及来自声明的捕获/重放路径的凭证。兼容的候选捕获可以在匹配的已发布位置上进行比较,无需持有 643 GB 的参考模型。数据集包含以下内容: - `suite/`:令牌和清单(分区为分析/验证/哨兵) - `reference-bf16-shard0/` 和 `as-served-fp8-shard0/`:各包含 512 个上下文,每个上下文有 [2047, 4096] 的 BF16 隐藏状态(完整运行有 5120 个上下文,但公开分片仅包含 512 个) - `head/`:共享的 BF16 lm_head(154,880 x 4,096)和最终归一化层及其提取凭证 - `reports/`:KLD 报告及所有凭证,包括 `SHA256SUMS` 覆盖所有文件 完整运行包含 5120 个上下文,每个上下文 2048 个令牌,共 10,480,640 个评分位置。主要指标:令牌平均 KLD 为 0.028104 nats,top-1 一致性为 0.9427。该数据集适用于量化保真度评估,允许用户通过提供的隐藏状态和头部,对自己的量化模型进行评分和比较。注意:公开分片不完整,且存在已知的运行间不一致性和校准污染问题,具体细节见 README 中的修正和说明。
This dataset is the GLM-5.3-Flash Fidelity Suite v1, designed to provide historical distribution fidelity evidence for the GLM-5.3-Flash model (released on August 26, 2026). It includes hidden state captures under BF16 reference and FP8 serving, a shared LM head, and credentials from the declared capture/replay path. Compatible candidate captures can be compared on matched published locations without holding the 643 GB reference model. The dataset contains suite/, reference-bf16-shard0/, as-served-fp8-shard0/, head/, and reports/ directories, including tokens, hidden states, head, and KLD reports. The full run has 5120 contexts, but the public shard contains only 512. Key metrics: token-average KLD is 0.028104 nats, top-1 agreement is 0.9427. It is suitable for quantization fidelity evaluation. Note: public shard is incomplete, and there are known run-to-run inconsistencies and calibration contamination issues.
数据集概述
GLM-5.3-Flash Fidelity Suite v1 是一个用于记录和验证 GLM-5.3-Flash(发布于 2026-08-26)模型在 BF16 参考与 FP8 实际服务配置下隐状态分布的保真度证据集合。该数据集并非一个通用的模型服务质量评分数据集,而是为特定协议下的对比验证提供依据。
核心内容与结构
- 历史全量运行测量:提供了 FP8 与 BF16 重放对比的统计指标(如 Token 平均 KLD 为 0.028104 nats,Top-1 一致性为 0.9427),并区分了不同文本类型(如代码、百科、文学等)的细分 KLD 结果。所有数据均为固定语料库的描述性统计,而非面向部署总体的推断。
- 证据文件:包含密封的 KLD 报告 (
reports/*.json)、引擎启动日志、堆栈来源追溯文件等,用于支持已发布的保真度数字的可验证性。 - 公开数据子集:每个分片(
reference-bf16-shard0/与as-served-fp8-shard0/)包含 512 个上下文,少于历史全量运行的 5,120 个上下文。这些隐状态均为最终 RMSNorm 后的输出,使用时需直接应用共享的lm_head。 - 共享组件:提供了共享的 BF16
lm_head(维度 154,880 x 4,096)和最终归一化层及相关提取收据。 - 评估套件:
suite/目录包含分词后的 token 数据与清单,供使用者自行评分其他量化模型。
修复与范围说明
- 2026-09-08 修正:此数据卡片已明确区分历史全量运行与当前公开的子集,并撤回了早前关于跨通道比率、重放等效性和噪声界限的不恰当声明。原始报告文件内容与字节数未改动。
- 校准污染范围:检测到原 25 窗口评估面板中,一个领域与校准材料共享 37-39% 的 13-gram,尽管在文档哈希层面无重复。基于社区建议,数据发布者基于更严格的 17 窗口校准干净范围重新计算了部分指标,并提供了完整报告。
已知问题与确定性干预
- 运行间的非确定性:初始的 vLLM 测量显示了跨启动的字节差异。尽管进行了多种干预(如固定 NCCL 配置),但未完全消除差异,且未能唯一确定原因。
- 干预实验记录:文档中列出了不同配置下哨兵上下文对字节完全一致的比例,最高记录为配置固定后达到 31/32。
技术参数与固定值
- 模型版本固定:BF16 参考模型版本为
zai-org/GLM-5.3-Flash-BF16@ 特定提交哈希,FP8 服务版本为zai-org/GLM-5.3-Flash@ 特定提交哈希。 - 硬件与引擎环境:明确记录了使用 vLLM 引擎、TP8 H200 GPU、eager 模式、TF32 关闭等配置细节。
相关资源与后续工作
- 数据集页面提供了指向其他相关数据集页面的链接,例如校准激活数据集(
malaiwah/GLM-5.3-Flash-calibration-activations-v1)以及后续的 K6/K8 量化工件页面。 - 详细的方法论文档(如
WHAT-WE-MEASURE.md)和数据规范可以在相关的 GitHub 仓库中找到,用于深入理解测量协议。





