遇见数据集

Limour/perplexity

收藏
Hugging Face2024-04-18 更新2024-06-11 收录
官方服务:

资源简介:

--- license: cc-by-nc-sa-4.0 language: - zh tags: - not-for-all-audiences --- https://www.kaggle.com/code/reginliu/perplexity | Model | Size | PPL | n_vocab | PPL_adjust | |-------|---------|---------|---------|---------| | [qwen1_5-14b-chat-IQ3_XS.gguf](https://huggingface.co/Limour/Qwen1.5-14B-Chat-GGUF/blob/main/qwen1_5-14b-chat-IQ3_XS.gguf) | 6.48 | 11.8084 +/- 0.121615 | 152064 | 11.8084 | | [causallm_14b.IQ3_XS.gguf](https://huggingface.co/Limour/CausalLM-14B-GGUF/blob/main/causallm_14b.IQ3_XS.gguf) | 6.48 | 13.3798 +/- 0.13641 | 152064 | 13.3798 | | [causallm_14b.IQ4_XS.gguf](https://huggingface.co/Limour/CausalLM-14B-GGUF/blob/main/causallm_14b.IQ4_XS.gguf) | 7.85 | 13.4127 +/- 0.13762 | 152064 | 13.4127 | | [causallm_14b.Q4_0.gguf](https://huggingface.co/TheBloke/CausalLM-14B-GGUF/blob/main/causallm_14b.Q4_0.gguf) | 8.18 | 13.6714 +/- 0.13964 | 152064 | 13.6714 | | [causallm_14b.IQ2_XXS.gguf](https://huggingface.co/Limour/CausalLM-14B-GGUF/blob/main/causallm_14b.IQ2_XXS.gguf) | 4.98 | 15.0160 +/- 0.15004 | 152064 | 15.0160 | | [Yi-9B-200K_iQ3xxs.gguf](https://huggingface.co/MarsupialAI/Yi-9B-200K_iMatrix_GGUF/blob/main/Yi-9B-200K_iQ3xxs.gguf) | 3.47 | 6.8157 +/- 0.05453 | 64000 | 16.1941 | | [Fi-9B-200K-Q8_0.gguf](https://huggingface.co/DisOOM/Fi-9B-GGUF/blob/main/Fi-9B-Q8_0.gguf) | 9.38 | 6.8402 +/- 0.05741 | 64000 | 16.2523 | | [causallm_7b.Q5_K_M.gguf](https://huggingface.co/TheBloke/CausalLM-7B-GGUF/blob/main/causallm_7b.Q5_K_M.gguf) | 5.53 | 16.5278 +/- 0.18005 | 152064 | 16.5278 | | [Qwen1.5-22B-Chat-Merge-Q4_0.gguf](https://huggingface.co/DisOOM/Qwen1.5-22B-Chat-Merge-GGUF/blob/main/Qwen1.5-22B-Chat-Merge-Q4_0.gguf) | 12.6 | 21.9669 +/- 0.28980 | 152064 | 21.9669 | | [Kunoichi-DPO-v2-7B-Q4_K_M-imatrix.gguf](https://hf-mirror.com/Lewdiculous/Kunoichi-DPO-v2-7B-GGUF-Imatrix/blob/main/Kunoichi-DPO-v2-7B-Q4_K_M-imatrix.gguf) | 4.37 | 6.7096 +/- 0.04519 | 32000 | 31.8840 | | [WizardLM-2-7B-IQ4_XS-imat.gguf](https://huggingface.co/ABX-AI/WizardLM-2-7B-GGUF-IQ-Imatrix/blob/main/WizardLM-2-7B-IQ4_XS-imat.gguf) | 3.91 | 9.8891 +/- 0.08106 | 32000 | 46.9930 | For a model that returns tokens completely at random, we have $$ P(token|context) = \frac{1}{n_{vocab}}, \quad PPL = \sqrt[N]{\left(\frac{1}{P}\right)^N} = n_{vocab} $$ therefore $$ PPL_{adjust} = \frac{PPL}{n_{vocab}} \times 152064 $$

许可证:CC BY-NC-SA 4.0 语言:中文 标签:不适合全年龄段受众 https://www.kaggle.com/code/reginliu/perplexity | 模型 | 大小 | 困惑度(Perplexity,简称PPL) | 词汇表规模($n_{vocab}$) | 调整后困惑度($PPL_{adjust}$) | |-------|---------|---------|---------|---------| | [qwen1_5-14b-chat-IQ3_XS.gguf](https://huggingface.co/Limour/Qwen1.5-14B-Chat-GGUF/blob/main/qwen1_5-14b-chat-IQ3_XS.gguf) | 6.48 | 11.8084 ± 0.121615 | 152064 | 11.8084 | | [causallm_14b.IQ3_XS.gguf](https://huggingface.co/Limour/CausalLM-14B-GGUF/blob/main/causallm_14b.IQ3_XS.gguf) | 6.48 | 13.3798 ± 0.13641 | 152064 | 13.3798 | | [causallm_14b.IQ4_XS.gguf](https://huggingface.co/Limour/CausalLM-14B-GGUF/blob/main/causallm_14b.IQ4_XS.gguf) | 7.85 | 13.4127 ± 0.13762 | 152064 | 13.4127 | | [causallm_14b.Q4_0.gguf](https://huggingface.co/TheBloke/CausalLM-14B-GGUF/blob/main/causallm_14b.Q4_0.gguf) | 8.18 | 13.6714 ± 0.13964 | 152064 | 13.6714 | | [causallm_14b.IQ2_XXS.gguf](https://huggingface.co/Limour/CausalLM-14B-GGUF/blob/main/causallm_14b.IQ2_XXS.gguf) | 4.98 | 15.0160 ± 0.15004 | 152064 | 15.0160 | | [Yi-9B-200K_iQ3xxs.gguf](https://huggingface.co/MarsupialAI/Yi-9B-200K_iMatrix_GGUF/blob/main/Yi-9B-200K_iQ3xxs.gguf) | 3.47 | 6.8157 ± 0.05453 | 64000 | 16.1941 | | [Fi-9B-200K-Q8_0.gguf](https://huggingface.co/DisOOM/Fi-9B-GGUF/blob/main/Fi-9B-Q8_0.gguf) | 9.38 | 6.8402 ± 0.05741 | 64000 | 16.2523 | | [causallm_7b.Q5_K_M.gguf](https://huggingface.co/TheBloke/CausalLM-7B-GGUF/blob/main/causallm_7b.Q5_K_M.gguf) | 5.53 | 16.5278 ± 0.18005 | 152064 | 16.5278 | | [Qwen1.5-22B-Chat-Merge-Q4_0.gguf](https://huggingface.co/DisOOM/Qwen1.5-22B-Chat-Merge-GGUF/blob/main/Qwen1.5-22B-Chat-Merge-Q4_0.gguf) | 12.6 | 21.9669 ± 0.28980 | 152064 | 21.9669 | | [Kunoichi-DPO-v2-7B-Q4_K_M-imatrix.gguf](https://hf-mirror.com/Lewdiculous/Kunoichi-DPO-v2-7B-GGUF-Imatrix/blob/main/Kunoichi-DPO-v2-7B-Q4_K_M-imatrix.gguf) | 4.37 | 6.7096 ± 0.04519 | 32000 | 31.8840 | | [WizardLM-2-7B-IQ4_XS-imat.gguf](https://huggingface.co/ABX-AI/WizardLM-2-7B-GGUF-IQ-Imatrix/blob/main/WizardLM-2-7B-IQ4_XS-imat.gguf) | 3.91 | 9.8891 ± 0.08106 | 32000 | 46.9930 | 对于完全随机生成词元(Token)的模型,有如下推导: $$ P(token|context) = frac{1}{n_{vocab}}, quad PPL = sqrt[N]{left(frac{1}{P} ight)^N} = n_{vocab} $$ 因此调整后困惑度计算公式为: $$ PPL_{adjust} = frac{PPL}{n_{vocab}} imes 152064 $$

提供机构:
Limour
原始信息汇总

数据集概述

数据集信息

  • 许可证: cc-by-nc-sa-4.0
  • 语言: 中文
  • 标签: 不适用于所有观众

模型数据

模型名称 大小 PPL n_vocab PPL_adjust
qwen1_5-14b-chat-IQ3_XS.gguf 6.48 11.8084 +/- 0.121615 152064 11.8084
causallm_14b.IQ3_XS.gguf 6.48 13.3798 +/- 0.13641 152064 13.3798
causallm_14b.IQ4_XS.gguf 7.85 13.4127 +/- 0.13762 152064 13.4127
causallm_14b.Q4_0.gguf 8.18 13.6714 +/- 0.13964 152064 13.6714
causallm_14b.IQ2_XXS.gguf 4.98 15.0160 +/- 0.15004 152064 15.0160
Yi-9B-200K_iQ3xxs.gguf 3.47 6.8157 +/- 0.05453 64000 16.1941
Fi-9B-200K-Q8_0.gguf 9.38 6.8402 +/- 0.05741 64000 16.2523
causallm_7b.Q5_K_M.gguf 5.53 16.5278 +/- 0.18005 152064 16.5278
Qwen1.5-22B-Chat-Merge-Q4_0.gguf 12.6 21.9669 +/- 0.28980 152064 21.9669
Kunoichi-DPO-v2-7B-Q4_K_M-imatrix.gguf 4.37 6.7096 +/- 0.04519 32000 31.8840
WizardLM-2-7B-IQ4_XS-imat.gguf 3.91 9.8891 +/- 0.08106 32000 46.9930

公式说明

$$ P(token|context) = frac{1}{n_{vocab}}, quad PPL = sqrt[N]{left(frac{1}{P} ight)^N} = n_{vocab} $$ $$ PPL_{adjust} = frac{PPL}{n_{vocab}} imes 152064 $$

搜集汇总
数据集介绍
构建方式
在自然语言处理领域,困惑度(Perplexity, PPL)是衡量语言模型生成能力的重要指标。Limour/perplexity 数据集基于 Kaggle 平台上相关代码构建,旨在系统性地评估不同量化级别与大语言模型在中文语境下的性能表现。该数据集通过统一采用固定的评估脚本与测试语料,对包括 Qwen2.5、CausalLM、Yi 等多个系列模型及其 GGUF 格式的量化版本进行推理计算,最终以表格形式呈现各模型的参数量、原始困惑度、词汇表大小以及经词汇表规模调整后的困惑度(PPL_adjust),从而构建起一个可横向比较的基准评测集。
特点
该数据集的核心特色在于其精细化的困惑度校准机制。考虑到不同模型因词汇表大小(n_vocab)差异而导致的困惑度不可比性,数据集引入 PPL_adjust 指标,通过将原始 PPL 除以词汇表大小并乘以固定参考值(152064),实现了跨模型间的公平对比。例如,Yi-9B-200K 虽原始 PPL 较低,但经调整后数值显著上升,揭示了词汇表规模对评估结果的潜在影响。此外,数据集涵盖从 2 位到 8 位多种量化精度(如 IQ2_XXS、Q8_0),便于研究者直观理解量化强度与模型语言建模能力之间的权衡关系。
使用方法
使用该数据集时,研究者可直接引用表格中经调整后的 PPL_adjust 值作为模型语言流畅性的统一度量标准。对于希望复现或拓展评估的用户,可参考其基于 Kaggle 的原始代码,在自有模型或量化版本上运行相同的困惑度计算流程。数据集以开源形式发布,采用 CC-BY-NC-SA 4.0 许可协议,适用于学术研究与非商业应用场景。用户需注意部分模型标签标记为“not-for-all-audiences”,在使用时应遵循相应合规要求。通过此数据集,从业者能够高效筛选出在中文任务中兼顾压缩率与生成质量的优选模型。
背景与挑战
背景概述
在大规模语言模型(LLM)蓬勃发展的时代,量化压缩技术成为平衡模型性能与部署效率的关键手段。Limour/perplexity数据集由研究者Limour构建,旨在系统评估不同量化策略对语言模型困惑度(Perplexity)的影响。该数据集聚焦于中文语境下多款主流模型(如Qwen2.5、CausalLM等)在不同量化级别(如FP16、IQ4_XS等)的表现,核心研究问题在于揭示量化程度与模型语言建模能力之间的权衡关系。通过提供标准化评估框架,该数据集为模型压缩领域提供了重要参考,推动了高效部署方案的优化与选择。
当前挑战
该数据集面临的核心挑战包括:其一,如何精准量化不同模型在多样化量化策略下的性能退化程度,确保PPL指标能真实反映模型语言理解能力,避免因词汇表差异(n_vocab)导致的评估偏差;其二,构建过程中需克服不同模型架构、量化算法及硬件兼容性带来的标准化难题,确保比较的公平性与可复现性;其三,面对快速演进的模型家族(如Qwen系列),数据集需持续更新以保持时效性,同时应对量化后模型在特定任务上可能出现的非单调性能变化,这对评估框架的鲁棒性提出了更高要求。
常用场景
经典使用场景
在自然语言处理与大型语言模型评估领域,困惑度(Perplexity, PPL)作为衡量语言模型生成能力的关键指标,被广泛用于量化模型对文本序列的预测准确性。该数据集系统收集了多种主流中文大语言模型(如Qwen2.5、CausalLM、Yi系列等)在不同量化精度下的困惑度值,并创新性地引入了基于词汇表大小的归一化调整值(PPL_adjust),为跨模型、跨词汇表的公平比较提供了标准化基准。研究者可借此深入分析模型规模、量化策略与语言建模性能之间的内在关联。
衍生相关工作
该数据集的发布催生了多项关于量化感知训练与模型压缩的后续研究。例如,基于PPL_adjust指标,研究者开发了自适应量化策略,能够根据模型各层的敏感度动态分配位宽,在保持整体困惑度低增幅的前提下进一步压缩模型。此外,该数据集还被用于验证新型量化方法(如Imatrix量化)的有效性,并启发了针对中文大模型的高效评估基准构建工作,促进了语言模型轻量化与部署优化领域的交叉创新。
数据集最近研究
最新研究方向
在大规模语言模型快速迭代的背景下,困惑度(Perplexity, PPL)作为衡量模型生成能力的关键指标,正受到学界与业界的广泛关注。Limour/perplexity数据集聚焦于不同量化版本与架构的语言模型在中文语境下的表现评估,通过系统比较Qwen2.5、CausalLM等系列模型在14B及以下参数量级的PPL值,揭示了模型压缩技术与词表规模对生成流畅性的深层影响。该数据集引入的PPL_adjust标准化指标,为跨词表模型的公平对比提供了新范式,其研究直接关联到边缘部署与资源受限场景下模型选型的实际需求。当前,围绕低比特量化对模型语言理解能力的折中效应,以及如何通过差异化词表设计优化中文语义表征,已成为该领域的前沿探索方向。这一数据集的发布,不仅为模型压缩技术的效果验证提供了可靠基准,更推动了语言模型在中文应用中的实用化进程,对促进高效、轻量化AI模型的落地具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务