遇见数据集

distribution-fidelity-index

收藏
Hugging Face2026-08-31 更新2026-09-01 收录
官方服务:

资源简介:

该数据集集合是“Local Inference Lab: distribution-fidelity index”的一部分,旨在为模型量化或压缩后的分布保真度提供评估基准。每个子数据集包含一个特定模型的 token 套件和可重复使用的参考张量,使得第三方无需加载原始参考检查点即可对新候选模型进行评分。数据集通过 Kullback-Leibler 散度(KLD)等指标衡量分布差异。当前示例包括 Qwen3.6-27B 和 Qwen3.6-35B-A3B 两个模型,分别给出了其 FP8 量化版本的平均 KLD 值(0.01601047 和 0.01838144)。数据集适用于模型量化、压缩或蒸馏后的分布保真度评估任务。

This dataset collection is part of "Local Inference Lab: distribution-fidelity index", designed to provide an evaluation benchmark for distribution fidelity after model quantization or compression. Each sub-dataset contains a token suite of a specific model and reusable reference tensors, allowing third parties to score new candidate models without loading the original reference checkpoints. The dataset measures distribution differences using metrics such as Kullback-Leibler divergence (KLD). Current examples include two models, Qwen3.6-27B and Qwen3.6-35B-A3B, with their FP8 quantized versions average KLD values (0.01601047 and 0.01838144). The dataset is suitable for distribution fidelity evaluation tasks after model quantization, compression, or distillation.

创建时间:
2026-08-30
原始信息汇总

数据集详情:distribution-fidelity index

数据集概述

该数据集是Local Inference Lab项目的一部分,用于记录和发布分布保真度指数。它包含每个已发布的一页式报告,并提供指向支撑完整工件的指针。每个工件仓库携带令牌套件和可复用的参考张量,使第三方无需加载参考检查点即可对新候选进行评分。

重要使用说明

  • 在比较任何数据之前,需要先阅读LAWS.md文件。
  • 数值仅可在单个工件的套件、几何形态和运行时身份内进行比较,跨工件比较不具备有效性。

包含的模型评估

1. Qwen3.6-27B

2. Qwen3.6-35B-A3B

搜集汇总
数据集介绍
distribution-fidelity-index 数据集图片
构建方式
该数据集以分布保真度为核心指标,系统性地构建了一套评估大型语言模型量化后性能的基准体系。其构建方式依托于一套严谨的流程:每个量化模型均配有专属的令牌套件与可复用的参考张量,第三方无需加载原始检查点即可对候选模型进行评分。数据集覆盖了Qwen3.6-27B、Qwen3.6-35B-A3B及Qwen3.8-27B等多个模型家族,并纳入了FP8、INT4、AWQ、NVFP4等多种量化方案,每个条目均记录了平均KL散度(mean KLD)值,以此量化模型输出分布与参考分布之间的偏离程度,从而构建出层次分明、可比性强的评估矩阵。
使用方法
使用者需首先仔细阅读LAWS.md文件,以理解数据集的比较准则与限制。随后,可针对特定模型家族或量化方案,筛选对应的工件数据集,利用提供的令牌套件和参考张量,复现或评估新的候选模型。通过计算平均KL散度并参照数据集内的基准值,即可定位候选模型的性能水准。该数据集特别适用于模型压缩研究、量化算法优化及推理引擎的验证场景,支持跨版本、跨硬件的分布保真度分析,为研究者提供了标准化的评估工具。
背景与挑战
背景概述
随着大规模语言模型在各类自然语言处理任务中的广泛部署,其推理效率与输出质量之间的平衡成为关键议题。量化技术作为压缩模型、加速推理的重要手段,却可能引入分布偏移,影响模型输出的保真度。在此背景下,distribution-fidelity-index数据集应运而生,由研究者phaedawg主导构建,旨在为不同量化策略下模型输出的分布保真度提供统一、可复用的评估基准。该数据集通过提供标准化的测试套件和参考张量,使第三方能够在无需加载原始模型权重的情况下,独立计算候选模型的分布相似性指标(如KL散度),从而促进了量化模型评测的透明性与可比较性。这一工作填补了当前模型压缩领域缺乏标准化分布保真度评估工具的空白,为模型量化技术的选择与优化提供了科学依据。
当前挑战
该数据集所应对的挑战源于量化模型评估中的核心难题:如何在多样化的硬件与量化配置下,准确衡量模型输出分布的细微变化。具体而言,不同量化方法(如FP8、INT4、NVFP4等)在相同模型上可能产生显著不同的分布偏移,而传统的评估指标往往难以捕捉这些细微差异。此外,构建过程中面临的主要挑战包括:确保不同模型版本和量化配置下的测试条件一致性,设计能够敏感反映分布变化的统计指标,以及提供无需加载参考模型即可进行公平比较的机制。该数据集通过建立统一的测试协议和参考张量,有效解决了跨配置比较的难题,但仍需持续扩展以覆盖更多模型架构与量化方案,以满足快速演进的AI领域的评估需求。
常用场景
经典使用场景
该数据集聚焦于大语言模型在不同量化与推理配置下的分布保真度评估,其经典使用场景是对比各种压缩技术(如FP8、INT4、AWQ等)对模型输出分布的影响。研究者可利用其中提供的参考张量与令牌套件,在不加载完整基准模型的前提下,高效计算待测模型的KLD值,从而量化其与原始分布的偏离程度。这一范式为模型量化领域的公平比较奠定了坚实基础。
解决学术问题
该数据集直面模型压缩过程中分布漂移难以精确测量与横向比较的学术痛点。通过提供统一的参考张量和标准化评估协议,它解决了因运行时环境、几何配置差异导致的不可复现问题,使得不同量化方案间的保真度对比具备可解释性与一致性。此举显著推动了量化模型可靠性研究,为探索精度与效率平衡提供了客观度量工具。
实际应用
在工业界,该数据集可用于模型部署前的质量筛选,例如在边缘设备或云端环境中选择最优量化版本。工程师能够依据KLD值快速定位分布偏离显著的压缩方案,从而在推理性能与生成质量间做出明智权衡,降低上线后出现语义偏差或低质输出的风险。其应用贯穿模型优化、硬件适配及服务运维等关键环节。
数据集最近研究
最新研究方向
该数据集聚焦于大语言模型量化与推理部署中分布保真度的精细化度量,通过标准化参考张量与令牌套件,为不同量化方案(如FP8、INT4、NVFP4、AWQ等)提供可复现的KLD评分,推动了模型压缩领域对输出分布偏移的量化评估。前沿研究方向包括异构硬件(如RTX5090)与混合精度策略(如NVFP4-BF16 LM Head)对分布保真度的影响,以及低比特量化下模型忠实度的权衡分析。该工作为模型部署中的精度选择提供了实证基准,促进了高效推理与分布可靠性之间的平衡,对边缘计算与实时应用具有重要意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务