immatrix-quant-data
收藏资源简介:
## 文件说明 ### 校准数据(文本) | 文件 | 内容 | 条数 | 用途 | |---|---|---|---| | **num_calibration.txt** | 纯数值任务(大数乘/阶乘/幂/质数/进制/混合运算) | 194 | 数值场景校准 | | **full_en_calibration.txt** | 英文全面(数值+代码+问答+推理+写作) | 561 | 通用场景校准(英文) | | **zh_calibration.txt** | 中文(数值题中文表达+中文问答+中文写作) | 410 | 中文场景校准 | | **bilingual_calibration.txt** | 中英双语混合(推荐) | 969 | **通用推荐** | ### 重要性矩阵(imatrix.dat) | 文件 | 来源 | 格式 | |---|---|---| | **fable_num_imatrix.dat** | num_calibration.txt × f16 模型 | dat(legacy) | | **fable_bilingual_imatrix.dat** | bilingual_calibration.txt × f16 模型 | dat(legacy) | > 注意:imatrix 用 **dat 格式**(`--output-format dat`)。GGUF 格式对中文数据有写入 bug(in_sum2 全 0/nan),dat 格式正常。 --- ## 使用方法 ```bash # 1. 生成校准数据(或直接用本仓库文件) python3 gen_calibration.py # 生成 txt # 2. 用 f16 模型计算 imatrix llama-imatrix -m model-f16.gguf -f bilingual_calibration.txt \ -o fable_bilingual_imatrix.dat -ngl 999 -c 4096 \ --output-format dat # 3. 数据驱动分层量化 python3 build_config.py fable_bilingual_imatrix.dat 64 config.txt llama-quantize --imatrix fable_bilingual_imatrix.dat \ --tensor-type <config> model-f16.gguf out.gguf Q4_K ``` --- ## 实测要点 - **中文数据**:必须用 dat 格式(GGUF 格式中文 in_sum2 写入异常) - **校准数据量**:需 ≥8192 tokens(否则 llama-imatrix 报错) - **全面数据**(双语 969 条)比纯数值更能反映真实使用场景,层重要性更均衡



