Quantuzo
收藏资源简介:
Quantuzo是一个用于评估KV缓存量化级别对软件工程任务影响的基准数据集。该数据集通过使用SWE-bench框架,测量不同KV缓存配置(如q8_0、q5_0、q4_0等)对模型在实际编码任务中表现的影响。数据集包含运行记录、元数据、预测结果和评估日志,结构清晰,便于程序化访问。每个运行记录包含模型名称、KV缓存类型、上下文大小、加速器类型、代理版本等字段,并统计了任务解决率、失败率和错误率。该数据集适用于研究模型量化对代码生成和理解能力的影响,尤其适用于需要在有限硬件资源上运行大型模型的场景。
Quantuzo: KV Cache Quantization Benchmark 数据集概述
数据集基本信息
- 数据集名称: Quantuzo: KV Cache Quantization Benchmark
- 数据集地址: https://huggingface.co/datasets/burakaydinofficial/Quantuzo
- 许可证: MIT
- 任务类别: 文本生成
- 标签: 基准测试, llama-cpp, kv-cache, 量化, swe-bench, swe-agent, 代码生成
研究目标
评估在 llama.cpp 中,KV 缓存量化级别对模型在真实世界软件工程任务中编码能力的影响。该数据集通过在不同 KV 缓存配置下运行相同的 SWE-bench 评估来提供实证结果。
评估方法
- 推理: 使用 llama.cpp 通过
--cache-type-k和--cache-type-v参数配置 KV 缓存量化来服务 GGUF 模型。 - 智能体: 使用 mini-SWE-agent 通过智能体循环生成补丁。
- 评估: 使用 SWE-bench 测试工具,针对真实测试套件运行生成的补丁。
- 上下文: 所有运行均使用 64K 令牌上下文以确保可比性。
数据集结构
Quantuzo/ ├── README.md ├── leaderboard.jsonl # 每行一个运行记录的 JSON(用于程序化访问) └── runs/ └── {run_id}/ ├── metadata.json # 运行配置 ├── preds.json # 智能体预测(以 instance_id 为键) ├── swebench_predictions.json # SWE-bench 测试工具格式 ├── evaluation_results.json # 完整的评估结果 ├── {instance_id}/ # 每个实例的轨迹数据 ├── run.log # 完整运行日志 └── minisweagent.log # 智能体日志
排行榜模式
leaderboard.jsonl 中每一行包含以下字段:
| 字段 | 类型 | 描述 |
|---|---|---|
| run_id | 字符串 | 唯一运行标识符 |
| timestamp | 字符串 | ISO 8601 UTC 时间戳 |
| model_name | 字符串 | 模型名称 |
| model_file | 字符串 | GGUF 文件名 |
| kv_type_k | 字符串 | KV 缓存键类型 (f16, q8_0, q5_0, q4_0) |
| kv_type_v | 字符串 | KV 缓存值类型 (f16, q8_0, q5_0, q4_0) |
| ctx_size | 整数 | 上下文大小(令牌数) |
| accelerator | 字符串 | cpu 或 gpu |
| agent_version | 字符串 | mini-swe-agent 版本 |
| agent_branch | 字符串 | 智能体分支 (v1/v2) |
| benchmark | 字符串 | 基准测试变体 (swe-bench-lite 等) |
| total | 整数 | 数据集中的总实例数 |
| resolved | 整数 | 补丁通过测试的实例数 |
| failed | 整数 | 补丁未通过测试的实例数 |
| error | 整数 | 评估出错的实例数 |
| rate | 浮点数 | 解决率 (%) |
KV 缓存配置
| 配置 | KV_TYPE_K | KV_TYPE_V | 相对内存占用 |
|---|---|---|---|
| f16 | f16 | f16 | 100% (基线) |
| q8 | q8_0 | q8_0 | ~75% |
| q5 | q5_0 | q5_0 | ~69% |
| q8-q4 | q8_0 | q4_0 | ~69% |
| q4 | q4_0 | q4_0 | ~63% |
使用方式
可通过 huggingface_hub 库下载 leaderboard.jsonl 文件并加载 JSON 数据进行分析。
源代码
完整的基准测试基础设施是开源的:https://github.com/burakaydinofficial/Quantuzo



