遇见数据集

eagle-grpo-iter19-q4k-uniform-noimatrix-enc

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

该数据集是 Oaica V4-Flash iter19 检查点的 I-Quality 量化打包版本(eagle-grpo-iter19),由 SFT+GRPO 最终训练产生,模型规模为 284B 参数,包含 43 层和每层 256 个路由专家。由于缺失专家激活 imatrix,本打包退化为统一 Q4_K 量化(无混合精度),总大小约 162 GB(输入原生 fp8 safetensors 为 268 GB,压缩比 3.50×)。各组件与源检查点的 RMS 误差为:专家 0.0023,注意力 0.00061,共享 0.00009,路由器 0.0002,通过了 RMS 单调性检查。文件格式为 .iqpt,需通过转换脚本生成 .iqbin 文件以供 prism 服务器(需使用 prism-perf-deploy 分支)加载推理。该打包适用于对 Oaica V4-Flash 系列模型进行高效推理部署。

This dataset is the I-Quality quantized packaged variant (eagle-grpo-iter19) of the Oaica V4-Flash iter19 checkpoint, which was finalized via SFT+GRPO training. The model comprises 284B parameters, consisting of 43 layers and 256 routed experts per layer. Due to the unavailability of expert activation imatrix, this package degenerates to unified Q4_K quantization with no mixed precision, with a total size of approximately 162 GB. The input native fp8 safetensors files amount to 268 GB, resulting in a compression ratio of 3.50×. The RMS errors between each component and the original checkpoint are as follows: experts: 0.0023, attention: 0.00061, shared components: 0.00009, router: 0.0002. It has passed the RMS monotonicity check. The file format is .iqpt, and a conversion script is required to generate .iqbin files for loading and inference on the Prism server, where the prism-perf-deploy branch must be used. This packaged variant is suitable for efficient inference deployment of the Oaica V4-Flash series models.

创建时间:
2026-08-03
原始信息汇总

数据集概述

该数据集是 eagle-grpo-iter19 的 I-Quality 格式量化打包版本,基于 Oaica V4-Flash iter19 检查点(SFT + GRPO 最终版本,DeepSeek-V4-Flash 284B,43 层,每层 256 个路由专家)。

核心特征

  • 量化格式:I-Quality .iqpt 打包格式,采用均匀 Q4_K 量化,无 imatrix(激活矩阵)。
  • 文件加密:所有文件使用 AES-256-CTR 加密(每个文件一个随机 IV),解密所需的 manifest 映射(original_path -> encrypted_name -> IV不在此仓库中,单独保管,无该映射则文件不可解密。
  • 打包工具:由 pipeline/iquality/pack_cbalanced_proposed.py --preset c-balanced-proposed 生成。

关键说明

与已验证的 c-balanced-proposed 配方(iter_267)的区别

对比项 已验证 c-balanced-proposed (iter_267) 本数据集 (iter19)
专家分级 Q6_K / Q5_K / Q4_K / IQ3 / IQ2_S 仅 Q4_K
imatrix 有(20/30/50 热/中/冷分布) (平坦 0.5 分数)
大小 约 117 GB 约 162 GB

由于原始 imatrix 在 bitdeer 机器销毁时丢失且无备份,所有 11,008 个路由专家均获得默认平坦分数 0.5,导致所有专家落入中带(Q4_K),无法进入 IQ 冷分级。

注意:不建议将此数据集与 117 GB 的 iter_267 数据直接对比并得出性能回退的结论,差异源于缺失 imatrix,而非打包器、分级或模型本身的变化。

均匀 Q4_K 的选择原因

IQ3/IQ2_S 属于 I-quant,其质量依赖 imatrix 加权的码本选择;无 imatrix 时退化程度远大于 K-quant。因此选择均匀 Q4_K 是更优权衡——更小的体积与不成比例的质量损失并非好的交易,K-quant 对缺失灵敏度数据的容忍度更高。

实测数据(真实测量,非估算)

  • 输入:268 GB HF 原生 fp8 safetensors(1479 个分片,block-128 e4m3 + fp32 weight_scale_inv
  • 每层压缩:13.16 GB 输入 → 3.76 GB 输出,压缩比 3.50×
  • 总量:约 162 GB(43 层 + 全局参数)
  • RMS 误差(vs 源模型):专家 0.0023,注意力 0.00061,共享 0.00009,路由器 0.0002
  • RMS 单调保护:通过

服务与转换

  • .iqpt 是打包器的容器格式;prism 服务需要 .iqbin 格式,需通过 pipeline/iquality/iqpt_to_iqbin.py 转换(torch 端 pickle → 小端二进制,反量化数学在 Rust 中实现)。.iqbin.iqpt 大小相同。
  • prism-server 二进制必须从 prism-perf-deploy 分支构建(该分支包含 V4FlashModel / v4flash.rsdeepseek_v4 iqbin 路径)。旧版 prism 构建(如 a100b 上的 7 月 23 日版本)不支持 iqbin,无法加载此数据集。

来源信息

  • 源检查点perahu_backup/eagle_grpo_hf_iter19_fp4/(明文,USB 存储)
  • 打包器pipeline/iquality/pack_cbalanced_proposed.py,使用 SafetensorsSource(O_DIRECT 读取器)
  • 验证工具pipeline/iquality/verify_iqpt.py
  • 许可证:专有(Proprietary — All Rights Reserved)
搜集汇总
数据集介绍
eagle-grpo-iter19-q4k-uniform-noimatrix-enc 数据集图片
构建方式
该数据集源自Oaica V4-Flash iter19检查点(经SFT与GRPO最终训练,采用DeepSeek-V4-Flash 284B架构,包含43层及每层256个路由专家),通过`pipeline/iquality/pack_cbalanced_proposed.py`脚本以`c-balanced-proposed`预设进行I-Quality量化打包。原本该预设需依据每专家激活imatrix将路由专家分配至热、中、冷不同精度层级,但因计算imatrix的机器损毁且无备份,实际打包时专家评分被统一置为默认值0.5,导致全部11008个专家均落入中间频段,最终所有专家均采用Q4_K量化,形成均匀Q4_K格式的`.iqpt`文件。
特点
该数据集的核心特点在于其量化策略的妥协性:由于缺失激活imatrix,所有路由专家被统一量化为Q4_K,而非原设计中的Q6_K/Q5_K/Q4_K/IQ3/IQ2_S混合精度,导致包体积约为162GB,显著大于完整混合精度版本的117GB。量化后各组件相对源模型的RMS误差极低(专家0.0023,注意力0.00061,共享层0.00009,路由0.0002),且通过RMS单调性守卫检验。文件采用AES-256-CTR加密,每个文件独立随机IV,解密所需的映射清单未包含在仓库中。
使用方法
使用该数据集需先将其从`.iqpt`容器转换为`.iqbin`格式,转换工具为`pipeline/iquality/iqpt_to_iqbin.py`,该过程涉及torch端pickle到小端二进制的转换,反量化数学运算由Rust实现。转换后的`.iqbin`文件大小与`.iqpt`相同。服务端需使用从`prism-perf-deploy`分支构建的`prism-server`二进制文件,该版本包含`V4FlashModel`及`v4flash.rs`中的`deepseek_v4` iqbin路径支持。旧版prism构建(如a100b上的版本)不支持iqbin格式,无法加载此数据集。
背景与挑战
背景概述
随着大语言模型参数规模呈指数级增长,高效压缩与部署成为制约其实际落地的核心瓶颈。eagle-grpo-iter19-q4k-uniform-noimatrix-enc数据集应运而生,由Oaica团队于DeepSeek-V4-Flash 284B基座之上,经监督微调与GRPO强化学习迭代至第19步后,采用I-Quality量化流水线构建而成。该数据集聚焦于在缺乏专家激活重要性矩阵的约束下,探索混合专家架构的量化可行性,其核心贡献在于揭示了imatrix缺失对量化策略的实质性影响,为后续量化感知训练与打包工具链的鲁棒性设计提供了关键实证。
当前挑战
本数据集所涉领域面临双重挑战。在问题层面,混合专家模型的量化需在极低比特宽度下保持路由专家与注意力模块的数值保真度,而传统方法依赖专家激活统计量进行非均匀比特分配;本数据集因imatrix意外丢失,被迫退化为均匀Q4_K量化,体积增至162 GB,凸显了量化方案对辅助数据的强依赖。在构建层面,加密文件与解密清单分离导致数据不可直接复现,且量化容器.iqpt与推理引擎所需的.iqbin格式存在转换壁垒,加之专用服务分支的版本约束,共同构成了从打包到部署的全链路工程挑战。
常用场景
经典使用场景
在大规模稀疏专家模型(MoE)的量化压缩与高效部署领域,该数据集作为Oaica V4-Flash iter19检查点的I-Quality量化包,典型用途在于为DeepSeek-V4-Flash架构(284B参数、43层、每层256个路由专家)提供经过GRPO强化学习微调后的低比特权重表示。由于采用统一的Q4_K量化策略且未使用激活感知的重要性矩阵(imatrix),该数据集常用于评估在缺乏专家敏感度信息时K-quant量化的保真度与压缩效率,并作为prism推理引擎的输入载体,支撑大规模专家模型的端侧或服务端推理实验。
实际应用
在实际部署场景中,该数据集以AES-256-CTR加密的.iqpt容器形式分发,需借助独立持有的清单文件解密,并经iqpt_to_iqbin.py转换为.iqbin格式后,由prism-perf-deploy分支构建的prism-server加载。该流程服务于对162GB量化权重进行安全传输与推理验证的工程需求,适用于需要在无imatrix条件下快速获得可用MoE量化权重的场合,同时因其加密与专有许可属性,也适用于受控环境下的模型资产保护与分发管理。
衍生相关工作
围绕该数据集衍生了若干经典工作:其一是iter_267版本中经验证的c-balanced-proposed混合精度包,采用Q6_K/Q5_K/Q4_K/IQ3/IQ2_S分层并依赖20/30/50热中冷imatrix,体积约117GB;其二是prism-perf-deploy分支中的V4FlashModel与v4flash.rs实现,构建了deepseek_v4的iqbin加载路径;其三是pack_cbalanced_proposed.py与verify_iqpt.py构成的打包与验证工具链。后续若iter19激活imatrix得以重建,重打包至真实混合配方将成为该系列最直接的衍生方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务