遇见数据集

bite-baseline

收藏
Hugging Face2026-07-27 更新2026-07-28 收录
官方服务:

资源简介:

bite-baseline数据集是用于极端量化(三元权重)Qwen3.6-35B-A3B混合专家大语言模型的开源压缩管道ihavespoons/bite的配套产物集。该数据集旨在通过PTQ(后训练量化)初始化和量化感知蒸馏技术,将包含256位专家的MoE(混合专家)模型(总参数量35B,激活参数量约3B)压缩至三元权重(-1, 0, +1)表示,达到1.71比特每权重的压缩率。数据集包含多个关键组件:FP16参考评估文件(如baseline.json),其中MMLU得分0.8393作为项目退化基准指标;专家路由器覆盖率分析(coverage.json),显示在256个校准序列上无死专家且基尼系数为0.51;教师蒸馏目标数据(teacher_topk/),包含基于512个序列×2048个token的c4-en数据提取的top-64 logits和输入ID;量化学生模型检查点(qad_student/和e2e_student/),分别代表块级修复和端到端QAD(量化感知蒸馏)修复的三元学生模型,后者经过500微步训练使交叉熵从8.3降至1.26;以及配套的训练评估指标文件。数据集派生自Apache-2.0许可的Qwen/Qwen3.6-35B-A3B模型,教师logits基于allenai/c4英文数据集计算,主要用于大模型压缩、量化感知蒸馏、混合专家模型优化等研究任务。

The bite-baseline dataset is a companion product set for the open-source compression pipeline ihavespoons/bite used for extreme quantization (ternary weights) of the Qwen3.6-35B-A3B mixture-of-experts large language model. This dataset aims to compress a MoE model with 256 experts (total parameters 35B, activation parameters approximately 3B) into ternary weight representation (-1, 0, +1) through PTQ initialization and quantization-aware distillation techniques, achieving a compression rate of 1.71 bits per weight. The dataset includes multiple key components: FP16 reference evaluation files (e.g., baseline.json) with an MMLU score of 0.8393 as the project degradation baseline metric; expert router coverage analysis (coverage.json), showing no dead experts on 256 calibration sequences and a Gini coefficient of 0.51; teacher distillation target data (teacher_topk/), containing top-64 logits and input IDs extracted from c4-en data with 512 sequences × 2048 tokens; quantized student model checkpoints (qad_student/ and e2e_student/), representing ternary student models for block-level repair and end-to-end QAD repair, respectively, with the latter trained over 500 micro-steps to reduce cross-entropy from 8.3 to 1.26; and accompanying training evaluation metric files. Derived from the Apache-2.0 licensed Qwen/Qwen3.6-35B-A3B model, with teacher logits computed based on the allenai/c4 English dataset, the dataset is primarily used for research tasks such as large model compression, quantization-aware distillation, and mixture-of-experts model optimization.

创建时间:
2026-07-21
原始信息汇总

数据集概述:bite-baseline

数据集来源:本数据集是 ihavespoons/bite 项目的配套数据集,该项目旨在对混合专家(MoE)大语言模型进行极端三元量化(ternary quantization),将权重压缩至 {-1,0,+1}(1.71 bpw)。

基础模型:量化目标模型为 Qwen/Qwen3.6-35B-A3B(Apache-2.0 许可),参数量为 35B 总参 / 约 3B 激活参数,包含 256 个专家。教师logits基于 allenai/c4 (en) 计算。

许可协议:Apache-2.0

数据集内容与结构

路径 说明
baseline.jsonbaseline_chat.json FP16 参考评估结果(基于 lm-eval 0.4.12)。MMLU 得分为 0.8393,作为项目性能退化的衡量基准。
coverage.json 在 256 条校准序列上,每个专家的路由器覆盖情况。结果:0 个专家死亡(死专家数为 0),基尼系数为 0.51。
teacher_topk/ 教师蒸馏目标:每个 token 对应的 top-64 logits + input_ids;包含 64 个自包含的 safetensors 分片(约 407 MB);数据为 512 条序列 × 2048 个 token 的 c4-en 内容。可使用 bite.train.teacher.load_teacher_shard 加载。
qad_student/ 经分块修复(block-wise healing)的三元学生模型(分片 safetensors,包含伪量化潜在密钥 parametrizations.*.original)。MMLU 得分为 0.245,表明局部修复效果不足。
e2e_student/model.safetensors 经端到端量化感知蒸馏(QAD)修复的三元学生模型(合并的 bf16 潜在权重)。经过约 1M token 上的 500 个微步训练,训练交叉熵从 8.3 降至 1.26。
qad_metrics.jsone2e_metrics.jsone2e_eval.json 各次运行的评估指标文件。

重要说明

  • 检查点存储的是 bf16 格式的伪量化潜在权重(约 70 GB),量化操作在通过仓库的参数化机制访问时应用。
  • 重建学生模型的方法:调用 build_student(...),然后使用 load_state_dict(st.load_file(...), strict=False, assign=True) 加载权重(参见 scripts/eval_quant.py --load-weights)。
搜集汇总
数据集介绍
bite-baseline 数据集图片
构建方式
bite-baseline数据集是专为极端三元量化(ternary quantization)任务而构建的配套数据集,旨在将Qwen3.6-35B-A3B这一混合专家大语言模型(35B总参数量、约3B活跃参数、256个专家)压缩至三元权重{-1,0,+1}(1.71 bpw)。构建过程包含两阶段:首先通过PTQ初始化获得量化初值,随后结合量化感知蒸馏(quantization-aware distillation)进行优化。数据集提供了丰富的中间产物,包括FP16参考评估结果、专家路由覆盖统计数据、教师蒸馏目标(包含top-64 logits与input_ids,源自c4-en语料的512条序列,每条2048个token,存储为64个自包含的safetensors分片),以及经逐块修复(block-wise healing)和端到端QAD修复后的三元学生模型权重。
特点
该数据集的核心特色在于其系统性地记录了从原始浮点模型到极端量化学生的完整压缩轨迹。包含基线评估数据(MMLU 0.8393作为退化度量指标)、专家路由覆盖率统计(展示256个校准序列中无一专家死亡,基尼系数0.51)、以及两种修复策略的学生模型权重——逐块修复学生(MMLU仅0.245,证实局部修复的不足)与端到端QAD修复学生(经约1M token的500个微步训练,训练交叉熵从8.3降至1.26)。权重以伪造量化潜变量(fake-quant latent)的bf16格式存储,约70GB,量化在实际访问时通过参数化层施加。
使用方法
使用者可通过本数据集复现或拓展极端三元量化的研究流程。加载学生模型时,需调用`build_student(...)`构建模型架构,然后使用`load_state_dict(st.load_file(...), strict=False, assign=True)`加载权重(详见`scripts/eval_quant.py --load-weights`)。教师蒸馏目标可通过`bite.train.teacher.load_teacher_shard`函数加载分片数据。数据集还提供了`lm-eval`评估框架下的FP16基线结果,便于直接对比量化前后的性能差异。所有工件均基于Apache-2.0许可协议发布,教师logits源自allenai/c4语料库。
背景与挑战
背景概述
在大型语言模型(LLM)部署于资源受限设备时,模型压缩技术成为关键研究领域。针对MoE架构中高达35B总参数量的Qwen3.6-35B-A3B模型,bite-baseline数据集由ihavespoons团队于近年发布,旨在探索极端三元量化(1.71 bpw)对MoE LLM的影响。该数据集聚焦于通过后训练初始化与量化感知蒸馏实现从全精度到三元权重的压缩,核心研究问题包括如何在保持模型性能的同时大幅降低存储与计算开销。数据集提供了FP16基线评估(MMLU达0.8393)、教师蒸馏目标及系列量化学生模型,为后续量化压缩研究建立了重要评估基准,对边缘设备部署LLM具有推动意义。
当前挑战
该数据集应对的核心挑战包括领域问题与构建过程两大层面。在领域问题方面,极端量化(如三元权值)会导致模型性能严重衰退,如局部修复后学生模型MMLU仅0.245,远低于FP16基线,揭示出局部优化不足与全局压缩的平衡难题。在构建过程中,挑战包括:生成高质量教师蒸馏目标需对512序列、每序列2048token的计算开销与存储成本进行权衡;处理256个专家的路由覆盖均衡问题,以避免专家熵减少;以及协调伪造量化潜在权重与真实量化之间的精度差异,确保学生模型加载与评估的可复现性。这些挑战对压缩算法的泛化性与效率提出了严苛要求。
常用场景
经典使用场景
在大型语言模型(LLM)压缩与高效推理的研究浪潮中,bite-baseline数据集作为极低比特量化(特别是三值量化)的配套基准,扮演着不可或缺的角色。该数据集的核心使用场景在于评估和验证针对混合专家(MoE)架构语言模型(如Qwen3.6-35B-A3B)的极端量化方案,即权重被约束至{-1,0,+1}的三值空间(1.71 bpw)。研究者可借助其中提供的FP16参考评估结果、教师蒸馏目标以及量化学生模型检查点,系统性地对比量化前后模型在MMLU等主流基准上的性能衰减,从而度量量化算法的有效性。这一场景为探索极低精度下MoE模型的保真度提供了标准化的实验平台。
实际应用
在实际工业与边缘计算场景中,bite-baseline数据集所承载的量化方案具有显著的落地价值。一方面,它使得在显存受限的硬件(如消费级GPU、手机SoC或IoT设备)上部署高达35B参数的MoE模型成为可能,三值权重极大减少了存储与带宽需求,同时保持约3B激活参数的推理速度。另一方面,该数据集提供的完整量化管线(包括PTQ初始化、蒸馏目标生成及检查点加载方法)可直接复用于其他MoE模型的压缩任务,降低了开发者从零构建量化系统的门槛。无论是追求低延迟的在线服务,还是强调隐私保护的端侧推理,bite-baseline都为将前沿MoE架构应用于实际产品铺平了道路。
衍生相关工作
bite-baseline数据集的发布激发了一系列衍生研究工作,尤其是在MoE模型的极端量化领域。首先,其对逐块修复与端到端训练效果的对比为后续研究提供了明确的基线,催生了更先进的量化感知训练策略(如自适应蒸馏权重分配和混合精度专家路由)。其次,数据集中教师logits的公开促进了知识蒸馏与量化联合优化方向的探索,衍生出针对MoE架构的专用蒸馏损失函数设计。此外,“死专家”(dead experts)覆盖率与基尼系数的分析指标(如coverage.json中的Gini 0.51)被后续工作广泛采纳,用以评估量化对专家负载均衡的影响。这些衍生研究共同构建了一个从量化算法创新到评估方法论完善的良性循环生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务