遇见数据集

garden-quant-bench

收藏
Hugging Face2026-08-19 更新2026-08-20 收录
官方服务:

资源简介:

Garden Quant Bench 是一个用于记录量化模型包发布前门控测试结果的基准数据集。该数据集由 majentik 组织维护,旨在为每个量化包在独立发布通道中经过确定性一致性烟雾测试(包括贪婪短生成、空输出、循环、脚本漂移和特殊标记泄露检测)提供证据。测试通过的包会被上传,未通过的则被拒绝并记录在数据集中。数据集包含 53 条记录(51 条已上传,2 条被拒绝),每条记录以 JSON 对象形式存储在 data/records.jsonl 文件中。每条记录包含以下字段:lane(模型谱系)和 format(量化格式,如 mlx 或 gguf)、tier(量化级别,如 4bit、MXFP4、Q2_K)、repo_id(上传后的目标仓库,仅当上传时存在)、source_repo 和 source_revision(上游检查点)、pack_size_gb(量化包大小)、gate_ok 和 gate_reason(一致性测试结果及原因)、word_count 和 special_token_spans(门控信号指标)、gate_output(原始烟雾生成文本,失败时可能为空)、uploaded(是否已上传)、started_at、finished_at 和 wall_s(时间记录)。数据集覆盖的模型谱系包括:BigBang-v1(mlx)、DeepSeek-V4-Flash-0731(gguf)、KAT-Coder-V2.5-Dev(mlx)、LFM2.5-2.6B(mlx)、Mistral-Medium-3.5-128B(mlx)、Muse-Glimmer-30B(mlx)、Nemotron-3.5-Lightning-30B-A3B(mlx)、Qwen3.8-27B(mlx)、Shieldstral-1.0-3B(mlx)和 nomic-embed-text-v2-moe(gguf)。数据集的生成脚本和门控逻辑位于 GitHub 仓库 ajentik/majek 的 pipelines 目录下。

Garden Quant Bench is a benchmark dataset for recording the gating test results of quantized model packages before release. It is maintained by the majentik organization and aims to provide evidence for each quantized package that has undergone deterministic consistency smoke tests (including greedy short generation, empty output, looping, script drift, and special token leakage detection) in an independent release channel. Packages that pass the tests are uploaded, while those that fail are rejected and recorded in the dataset. The dataset contains 53 records (51 uploaded, 2 rejected), each stored as a JSON object in the data/records.jsonl file. Each record includes the following fields: lane (model lineage) and format (quantization format, e.g., mlx or gguf); tier (quantization level, e.g., 4bit, MXFP4, Q2_K); repo_id (target repository after upload, present only if uploaded); source_repo and source_revision (upstream checkpoints); pack_size_gb (package size); gate_ok and gate_reason (consistency test result and reason); word_count and special_token_spans (gating signal metrics); gate_output (original smoke generation text, may be empty on failure); uploaded (whether uploaded); started_at, finished_at, and wall_s (time records). The model lineages covered include: BigBang-v1 (mlx), DeepSeek-V4-Flash-0731 (gguf), KAT-Coder-V2.5-Dev (mlx), LFM2.5-2.6B (mlx), Mistral-Medium-3.5-128B (mlx), Muse-Glimmer-30B (mlx), Nemotron-3.5-Lightning-30B-A3B (mlx), Qwen3.8-27B (mlx), Shieldstral-1.0-3B (mlx), and nomic-embed-text-v2-moe (gguf). The generation scripts and gating logic are located in the pipelines directory of the GitHub repository ajentik/majek.

创建时间:
2026-08-09
原始信息汇总

Garden Quant Bench 数据集详情

数据集概览

Garden Quant Bench 是一个用于记录量化模型发布门禁(release-gate)验证结果的数据集,包含 53 条记录(51 个已发布,2 个被暂扣),采用 Apache-2.0 许可证。该数据集为 majentik 组织下发布的量化模型包提供分层发布门禁的证据记录。

数据内容与格式

  • 数据文件: data/records.jsonl,每行一个 JSON 对象
  • 验证机制: 所有量化模型在发布前需通过确定性一致性冒烟测试(greedy short generation),检验内容包括空输出、循环、脚本漂移和特殊标记泄漏;未通过的层级会被暂扣,暂扣记录也包含在数据集中

数据字段说明

字段类别 具体字段 说明
身份信息 lane / format 源模型通道及打包格式(mlx/gguf)
量化信息 tier 量化层级(如 4bit、MXFP4、Q2_K)
仓库信息 repo_id / source_repo / source_revision 目标仓库(仅在已上传时存在)及上游固定版本
文件信息 pack_size_gb 量化包大小
门禁结果 gate_ok / gate_reason 一致性门禁判定及其原因
信号数据 word_countspecial_token_spans 门禁信号
输出数据 gate_output 原始冒烟生成结果(失败时可能为空)
发布状态 uploaded 该层级是否已发布
时间信息 started_at / finished_at / wall_s 层级运行耗时

覆盖的模型通道

数据集涵盖 10 个模型的量化记录:

  • BigBang-v1 (mlx)
  • DeepSeek-V4-Flash-0731 (gguf)
  • KAT-Coder-V2.5-Dev (mlx)
  • LFM2.5-2.6B (mlx)
  • Mistral-Medium-3.5-128B (mlx)
  • Muse-Glimmer-30B (mlx)
  • Nemotron-3.5-Lightning-30B-A3B (mlx)
  • Qwen3.8-27B (mlx)
  • Shieldstral-1.0-3B (mlx)
  • nomic-embed-text-v2-moe (gguf)

生成工具

该数据集由 pipelines/garden_quant_bench.py 脚本生成,门禁逻辑位于 pipelines/coherence_gate.py,代码仓库为 ajentik/majek

搜集汇总
数据集介绍
garden-quant-bench 数据集图片
构建方式
在模型量化部署的实践中,量化包发布前缺乏统一的可复现质量核验依据,garden-quant-bench 由此构建为面向量化包发布门禁的证据数据集。其构建流程由 pipelines/garden_quant_bench.py 与 pipelines/coherence_gate.py 驱动,对 majentik 发布的各量化档位执行确定性一致性冒烟闸门,涵盖贪心短文本生成并判定空输出、循环、脚本漂移与特殊标记泄漏等信号;通过者准予上传,未通过者予以保留,且拒绝结果同样记录。数据以 JSONL 逐行存于 data/records.jsonl,共 71 条记录,其中 68 条已发布、3 条被保留。
特点
数据集以逐档位发布门禁证据为核心特征,覆盖 mlx 与 gguf 两类打包格式,涉及 BigBang-v1、DeepSeek-V4-Flash-0731、KAT-Coder-V2.5-Dev、LFM2.5 系列、Mistral-Medium-3.5-128B、Muse-Glimmer-30B、Nemotron-3.5-Lightning-30B-A3B、Ornith-1.5-35B-A3B、Qwen3.8-27B、Shieldstral-1.0-3B、UI-Mate-27B 及 nomic-embed-text-v2-moe 等多条模型赛道。每条记录包含来源仓库与修订版本、量化档位、打包体积、门禁结论与原因、词数及特殊标记跨度等信号、原始冒烟生成文本、是否上传以及耗时等字段,兼具可追溯性与可复核性;被保留档位的记录亦被纳入,从而同时呈现通过与否决两类发布状态,构成完整的发布决策证据链。
使用方法
使用时可依据 data/records.jsonl 的逐行 JSON 结构加载数据,按 lane 与 format 字段筛分不同模型赛道及打包格式,按 tier 字段定位具体量化档位,并以 gate_ok 与 gate_reason 字段判定一致性闸门的通过状态。借助 uploaded 字段可区分已发布与被保留的档位,结合 source_repo 与 source_revision 回溯上游检查点,利用 gate_output 及 word_count、special_token_spans 等信号复现并审查冒烟生成的判定依据。pack_size_gb 与 wall_s 等字段可用于体积与时延的对比分析,进而支撑量化发布的发布门禁评估、跨档位比较以及发布拒绝案例研究。
背景与挑战
背景概述
随着大语言模型规模持续膨胀,量化已成为降低推理成本与显存占用的关键路径,然而不同量化层级在实际部署中的生成质量却缺乏系统性、可复现的证据支撑。garden-quant-bench 正是在这一背景下由个人研究者 majentik 构建并发布于 HuggingFace 平台,聚焦于量化模型包的发布把关。该数据集记录了 mlx 与 gguf 两类格式下多个模型通道的量化层级发布结果,核心研究问题在于如何以确定性一致性冒烟门控判定量化包是否具备上线资格。其通过记录 71 条量化层级证据,为量化评估领域提供了一份透明、可追溯的发布门控参考,对量化工作流的规范化具有实践影响力。
当前挑战
量化模型的评估长期面临生成退化难以稳定捕捉的困境,传统指标如困惑度难以直接映射到部署场景中的可用性。garden-quant-bench 所应对的领域问题在于量化层级发布前的质量判定,其通过空输出、循环生成、脚本漂移与特殊词元泄漏等信号构建确定性门控,试图在不依赖昂贵人工评估的前提下识别失效量化。构建过程中的挑战则包括门控逻辑对短贪婪生成的敏感性、失败样本原始输出可能为空导致的信号缺失,以及在多模型通道、多量化层级间保持判定标准一致的困难,同时需对未通过层级予以明确扣留并如实记录,以保证证据链的完整性。
常用场景
经典使用场景
在大规模语言模型压缩与部署的研究脉络中,量化模型的发布质量参差不齐长期困扰着下游使用者,garden-quant-bench 正是为弥合这一裂隙而设计。其最经典的运用场景在于为量化模型构建起一套发布前的确定性一致性冒烟门禁:针对 mlx 与 gguf 两种主流格式、覆盖从 4bit 到 MXFP4、Q2_K 等多个量化层级,以贪婪式短文本生成作为探针,检测输出是否存在空泛、循环、脚本漂移或特殊词元泄漏等退化现象。凡未通过门禁的层级一律暂缓上传,并将拒绝理由与原始生成信号一并归档。由此,研究者与工程师得以在同一基准上纵向比较不同量化层级的可用性,使量化评估从主观抽查转向可复现的证据链。
衍生相关工作
围绕该数据集,已衍生出一系列相互衔接的工作。其底层门禁逻辑由 coherence_gate.py 实现,配套的 garden_quant_bench.py 流水线负责在 ajentik/majek 仓库中驱动评测与归档,形成从量化打包、门禁判据到发布治理的完整工具链。公开数据亦催生了面向不同模型家族的扩展评测,覆盖 BigBang-v1、DeepSeek-V4-Flash、KAT-Coder、LFM2.5、Mistral-Medium-3.5、Nemotron-3.5-Lightning、Qwen3.8、UI-Mate 以及 nomic-embed-text-v2-moe 等多条车道,使量化层级与格式之间的横向比较成为可能。这些工作共同强化了以确定性信号驱动的质量评估范式,为量化生态的规范化发布提供了可复用的方法论基础。
数据集最近研究
最新研究方向
在大模型量化部署日益普及的背景下,量化包发布前的质量守门机制正成为模型压缩与推理加速交叉领域的关键议题。garden-quant-bench以确定性连贯性冒烟测试为核心,针对mlx与gguf两种主流格式、覆盖4bit、MXFP4、Q2_K等多层级量化方案,系统记录了71条发布门控证据,其中3条因空输出、循环退化、脚本漂移或特殊token泄漏而被拦截。该数据集推动量化评估从单一困惑度指标向生成行为健康度监测延伸,为构建可复现、可审计的量化发布流水线提供了实证基础,对边缘部署与开源模型分发的可靠性保障具有直接参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务