遇见数据集

qwen3.8-27b-apple-silicon-concurrency

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

该数据集记录了在 Apple Silicon Mac(M系列,128 GB 统一内存)上使用三种服务引擎(oMLX、SGLang-MLX、Ollama)并发服务 Qwen3.8-27B 模型的基准测试结果。数据包括不同并发数(1、4、8、16)下,处理约1.5k token 提示词并生成64 token 输出时的聚合吞吐量(tok/s),以及16并发下生成256 token 输出的吞吐量。此外,还包含原生 MTP 投机解码(单流)的加速数据(bf16 9→26 tok/s,8-bit 36,4-bit 62)。所有测试请求均成功完成,无错误。该数据集适用于评估大语言模型在 Apple Silicon 上的并发推理性能、比较不同推理引擎的效率,以及研究连续批处理、投机解码等优化技术。

This dataset records benchmark results of serving the Qwen3.8-27B model concurrently using three serving engines (oMLX, SGLang-MLX, Ollama) on Apple Silicon Mac (M-series, 128 GB unified memory). Data includes aggregated throughput (tok/s) for processing ~1.5k token prompts and generating 64 token outputs under different concurrency levels (1, 4, 8, 16), as well as throughput for generating 256 token outputs at 16 concurrency. Additionally, it includes acceleration data for native MTP speculative decoding (single stream) (bf16 9→26 tok/s, 8-bit 36, 4-bit 62). All test requests were completed successfully with no errors. This dataset is suitable for evaluating concurrent inference performance of large language models on Apple Silicon, comparing the efficiency of different inference engines, and studying optimization techniques such as continuous batching and speculative decoding.

创建时间:
2026-08-17
原始信息汇总

数据集概述

名称: Qwen3.8-27B concurrent serving on Apple Silicon

许可证: Apache-2.0

标签: apple-silicon、mlx、sglang、ollama、qwen3.8、benchmark、inference、concurrency、speculative-decoding

简介: 该数据集提供了在单个 Apple Silicon Mac(M系列,128 GB统一内存)上实现16个并发Qwen3.8-27B请求的研究成果,涵盖三种服务引擎的基准测试、补丁及复现配方,其中包含使SGLang原生MLX后端首次服务于该模型的关键补丁。

核心结果

在独立GPU、不同长度提示词(约1.5k token)和64 token输出条件下,各引擎的聚合吞吐量(tok/s)如下:

并发数 oMLX(MLX 8-bit) SGLang-MLX(补丁后) Ollama 0.32(GGUF Q8_0)
1 12.0 10.3 6.8
4 20.0 19.8 14.3
8 20.1 21.6 13.8
16 19.8 21.0 13.6
16 × 256 token 输出 35.7 47.4 16.8

所有测试均100%成功,零错误。结果证明27B稠密模型可在单台Mac上真正服务16个并发客户端。

关键发现

  1. 限制模型内并发,队列化其余请求--max-running-requests / max_concurrent_requests / OLLAMA_NUM_PARALLEL)——这是从CUDA服务栈迁移到Metal的关键思想。
  2. 短输出负载受预填充阶段限制,在N=4时趋于平台期;长输出场景下连续批处理可显著提升吞吐量(最高达单流解码速率的4.5倍)。
  3. SGLang的radix-cache调度器在处理解码密集型负载时胜出(N=16时比oMLX高33%);oMLX在单用户延迟上表现最佳;Ollama最简单且完全稳定,但速度慢1.5–3倍。
  4. GPU争用是首要的假阴性来源——当第二个30GB模型驻留时,相同硬件在N=6时“崩溃”并最终触发Metal内存不足。多数“Mac无法并发服务”的报告均源于此,建议一次仅运行一个模型服务器。

文件内容

文件 内容
BENCHMARKS.md 三引擎阶梯测试及完整分析
RESEARCH.md 社区调研(vllm-mlx、mlx-lm批处理、HN/X发现)
OLLAMA.md 使用Ollama运行及并发服务指南
OMLX.md 使用oMLX运行及并发服务指南(1-4用户最佳)
MTP.md oMLX原生MTP推测解码:bf16 9→26 tok/s、8-bit 36、4-bit 62(单流)+ Claude Code启动器修复
mtp-20260818.txt MTP基准测试原始输出
ladder-20260816.txt 阶梯测试原始输出
sglang-mlx-qwen38.patch 4文件补丁:SGLang-MLX服务Qwen3.8-27B(hybrid-GDN缓存、VLM检查点纯文本、2个批量加载设备缺陷)
PATCH-NOTES.md 每个补丁的存在原因及崩溃签名
bench_concurrency.py 仅依赖标准库的基准测试工具

复现SGLang路径

bash git clone https://github.com/bluehawana/Qwen3.827B-SGLang-mpbm5max cd Qwen3.827B-SGLang-mpbm5max ./build-sglang-metal.sh # 需要Xcode Metal工具链;自动应用补丁 MAX_CONC=16 ./sglang-metal/serve-sglang-metal.sh

关键启动参数:SGLANG_USE_MLX=1--json-model-override-args {"language_model_only": true}(以纯文本模式运行VLM检查点,无对应CLI标志)、--mamba-radix-cache-strategy no_buffer(hybrid-GDN默认路径仅支持CUDA),外加附带补丁。

相关链接

  • 基础模型:https://huggingface.co/Qwen/Qwen3.8-27B (Apache-2.0)
  • MLX量化版:https://huggingface.co/mlx-community/Qwen3.8-27B-8bit
  • GGUF版本:https://huggingface.co/AtomicChat/Qwen3.8-27B-GGUF
  • 运行方式(Ollama):ollama run bluehawana/qwen3.8-27b-q8
  • 快速单流(MTP推测解码,oMLX):bluehawana/Qwen3.8-27B-{4bit,8bit,bf16}-MTP-MLX,详见MTP.md
搜集汇总
数据集介绍
qwen3.8-27b-apple-silicon-concurrency 数据集图片
构建方式
该数据集源自一项针对Apple Silicon平台并发推理服务的系统性研究,旨在攻克单机承载16路并发Qwen3.8-27B请求的工程挑战。构建过程中,研究者整合了三种主流推理引擎——oMLX、SGLang-MLX与Ollama,并针对SGLang原生MLX后端进行了四文件补丁修复,涉及混合GDN缓存、VLM检查点文本模式及设备批处理缺陷,从而首次实现该模型在此框架下的稳定服务。数据集囊括了基准测试脚本、性能原始记录、补丁说明及详细复现指南,每一项数据均源自实际运行的探测性实验,确保了构建方式的严谨性与可复现性。
特点
数据集的核心亮点在于其揭示的并发推理性能图谱:在单块GPU上,以约1.5k token的独立提示词和64 token输出为基准,系统在16路并发下仍能保持近乎零错误率,聚合吞吐量在SGLang-MLX上达到21.0 tok/s,而扩展至256 token输出时更是跃升至47.4 tok/s,较单流解码提升高达4.5倍。此外,数据集通过对比实验揭示关键洞察:GPU资源竞争是导致性能假性崩塌的罪魁祸首,而固定模型内并发并排队剩余的调度策略是跨平台移植的核心思想。这些特点使得数据集兼具工程实证与理论价值。
使用方法
使用者可参照数据集内附的复现指南,通过克隆配套代码仓库并执行自动化构建脚本,即可在配备Xcode Metal工具链的Apple Silicon设备上重现SGLang-MLX路径的完整流程。关键启动参数如`SGLANG_USE_MLX=1`与特定的JSON模型覆盖参数已被明确标注,补丁文件可按指令自动应用。对于轻量部署,数据集也提供了Ollama运行指令`ollama run bluehawana/qwen3.8-27b-q8`,以及针对单用户低延迟场景的oMLX优化方案。基准测试脚本仅依赖标准库,确保任意环境下的可移植性与结果可比性。
背景与挑战
背景概述
随着大语言模型(LLM)在推理服务中的广泛应用,单机多用户并发推理成为提升资源利用率的关键。Apple Silicon 平台凭借统一内存架构,为中等规模模型的本地部署提供了独特优势,但其并发推理能力尚未被充分探索。此数据集由研究者针对 Qwen3.8-27B 模型在 Apple Silicon 上的并发服务展开系统性实验,创建于 2025 年,涵盖 oMLX、SGLang-MLX 和 Ollama 三大推理引擎。研究团队通过定制补丁首次实现 SGLang 原生 MLX 后端对该模型的服务,并量化了不同并发级别下的吞吐量、时延及稳定性。该工作填补了 Apple Silicon 上高并发推理的实证空白,为边缘计算和本地服务化提供了可复现的基准与工程实践。
当前挑战
该领域面临的核心挑战在于,Apple Silicon 的 Metal 与 CUDA 生态差异导致主流推理栈(如 SGLang、vLLM)难以直接适配,多引擎并发控制机制(如 max-running-requests)缺失或不可用,如何平衡预填充与解码阶段的计算分配亦成难题。构建过程中,研究团队遭遇了多项技术壁垒:SGLang-MLX 后端对 VLM 检查点的文本模式无命令行支持,混合 GDN 缓存策略仅适配 CUDA,批处理加载存在设备内存缺陷;此外,GPU 显存竞争成为最大的隐性障碍——当仅驻留一个 30GB 模型时并发可扩展至 16,但叠加第二模型便会引发 Metal 内存溢出。这些挑战揭示了并发推理基础设施在非主流硬件上的脆弱性,亟需系统性优化与跨平台适配。
常用场景
经典使用场景
该数据集聚焦于Apple Silicon平台上并发推理性能的基准测试,涵盖三种主流推理引擎(oMLX、SGLang-MLX补丁版、Ollama)在多个并发级别(1至16路)下的吞吐量、延迟与稳定性表现。其经典使用场景包括对比不同推理引擎在统一硬件上的性能差异、分析并发请求对系统资源(如内存带宽、GPU占用)的影响,以及验证连续批处理(continuous batching)与投机解码(speculative decoding)等优化技术在macOS环境中的有效性。研究者可利用其中详细的基准数据与复现脚本,开展针对Metal后端推理优化的系统性研究。
实际应用
在实际应用中,该数据集的成果直接赋能了个人开发者与小型团队,使其能够在本地Apple设备上以较低成本部署中等规模LLM服务,用于多对话客户服务、本地知识库问答、协同编码辅助等场景。由于避免了云服务延迟与数据隐私风险,此类部署尤其适合敏感行业(如金融、医疗)的内部工具。此外,其提供的Ollama一键式运行配置与oMLX投机解码优化,使非专业用户也能快速获得实时交互体验(如4-bit量化下单流速度可达62 tok/s),极大降低了高端本地AI服务的技术门槛。
衍生相关工作
该数据集衍生的相关工作包括其开源代码仓库中提供的SGLang-MLX原生后端补丁,这一补丁首次使SGLang能够在该架构上服务Qwen3.8-27B模型,为后续Mamba-2架构与RadixCache调度器在Metal设备上的适配奠定了基础。其提出的“混合GDN缓存策略”(hybrid-GDN cache)与“无缓冲radix缓存”(no_buffer)方案,被后续研究引用为统一内存设备缓存管理的参考实现。此外,对MTP投机解码的原生支持(从bf16的9 tok/s提升至8-bit的36 tok/s,乃至4-bit的62 tok/s)催生了多篇关于Apple Silicon上解码加速的探索论文,并为MLX生态中模型加载与批处理机制的改进提供了直接的补丁参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务