遇见数据集

0xNeoAi/llama-cpp-rx7800xt-benchmarks

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含在本地AMD Radeon RX 7800 XT Linux桌面上收集的llama.cpp HIP/ROCm基准测试结果,包括解析后的结果表和原始基准测试日志,以便审核数据。数据集专注于llama.cpp在AMD Radeon RX 7800 XT GPU上的ROCm性能基准测试。

This dataset contains `llama.cpp` HIP/ROCm benchmark results collected on a local AMD Radeon RX 7800 XT Linux desktop. It includes both parsed result tables and the original raw benchmark logs so the numbers can be audited.

提供机构:
0xNeoAi
搜集汇总
数据集介绍
0xNeoAi/llama-cpp-rx7800xt-benchmarks 数据集图片
构建方式
该数据集基于AMD Radeon RX 7800 XT显卡在Linux系统上的本地实验环境构建,采用llama.cpp的HIP/ROCm编译版本进行性能测试。通过统一的命令行参数(如512个词的提示长度和128个词的生成长度)对多个GGUF格式的量化模型执行基准测试,收集了llama-bench输出的原始日志,并从中解析出提示处理与令牌生成的吞吐量数据,形成结构化表格与JSONL文件。同时保留了失败或不完整的测试记录以确保透明度。
特点
数据集聚焦于消费级AMD显卡在本地大语言模型推理场景下的表现,涵盖了从8B到27B参数规模的多种模型及不同量化方案(如Q4_K_M、Q5_K_M、Q8_0等)的测试结果。最佳提示处理速度达到6002.21 tokens/s,最佳令牌生成速度为199.70 tokens/s,并提供了多次重复测试结果以反映性能稳定性。原始日志与解析数据并存,便于审计与复现。
使用方法
用户可直接利用CSV或JSONL格式的解析结果进行模型间性能比较,或深入原始日志文件(raw/目录)查看详细命令与未处理结果。数据集适用于评估RX 7800 XT在llama.cpp框架下的推理效率,为消费者级硬件上的模型选择与量化策略提供参考。需注意某些文件(如投机解码尝试)标注为无效测试,不应纳入正常对比分析。
背景与挑战
背景概述
大语言模型(LLM)在个人计算设备上的部署需求日益增长,推动了推理效率基准测试的发展。在此背景下,llama-cpp-rx7800xt-benchmarks数据集由独立研究者0xNeoAi于2025年创建,聚焦于AMD Radeon RX 7800 XT显卡上,通过llama.cpp的HIP/ROCm后端对多种开源模型(如LFM2.5-8B-A1B、Qwen3-14B、Qwen3.6-27B)在不同量化等级下的推理性能进行系统性评估。该数据集以标准化测试方法(固定提示长度512、生成长度128、批量大小512)记录了提示处理与文本生成两阶段的吞吐量(tokens/sec),并附有完整的原始日志以确保可审计性。其发布为研究AMD GPU在本地LLM推理场景中的实际表现提供了权威的参考基准,对消费级硬件部署社区具有重要影响。
当前挑战
该数据集所应对的核心挑战在于,AMD ROCm生态在LLM推理领域的性能评估尚未形成标准化、可复现的公开基准体系。具体而言,领域问题层面,开发者难以对不同模型与量化方案在RX 7800 XT上的实际吞吐量进行横向比较,导致硬件选型与模型部署决策缺乏数据支撑。构建过程中,遭遇了包括Qwen3.6-35B-A3B模型的投机解码(speculative decoding)测试因缺少-draft模型参数而全部失败,以及Qwen3-14B的UD-Q8_K_XL量化版本在基准测试中仅生成元数据而无完整结果行等非预期情况,这些失败与不完整记录均被保留以保障透明度,但增加了数据清洗与结果解读的复杂性。
常用场景
经典使用场景
在边缘计算与消费级GPU推理日益普及的背景下,该数据集为评测AMD Radeon RX 7800 XT在llama.cpp框架下运行大语言模型的性能提供了系统化的基准。其经典使用场景涵盖对LlamaForMoe、Qwen3系列等不同架构模型在多种量化精度下的吞吐量测试,通过统一的提示处理与令牌生成指标,系统性地刻画了ROCm软件栈在本地桌面环境中的推理表现。
实际应用
在实际应用中,该数据集为开发者选择适配AMD显卡的本地大语言模型推理方案提供了精准的决策依据。其性能数据直接指导了量化模型的选型与硬件适配,助力在有限显存条件下实现高吞吐的提示处理或流畅的文本生成。此外,作为开源基准,它支持社区复现与横向对比,降低了AMD平台部署私有化AI服务的技术门槛,加速了消费级硬件在智能客服、文档总结等轻量级场景中的落地。
衍生相关工作
该数据集衍生了一系列围绕AMD GPU推理性能的后续工作,包括不同消费级显卡(如RX 7900系列)的对比基准,以及针对量化策略与批处理大小的深度优化研究。此外,其公开的原始日志格式也被社区采纳为llama.cpp性能报告的标准模板,催生了跨模型、跨硬件的自动化评测工具。这些工作共同构建了AMD ROCm生态下大模型推理的实证知识体系,为硬件适配与算法改进提供了持续迭代的反馈闭环。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务