Aller au contenu
Source

Soothill — SGLang vs vLLM vs llama.cpp on Strix Halo

GMKtec EVO-X3, vLLM 0.26.0, SGLang 0.5.17, llama.cpp b10333, ROCm 7.14.0 : Qwen3.5-0.8B BF16 vLLM 86,6 (C=1), 246,5 (C=4), 311,6 t/s (C=8) ; llama.cpp.

Confirmée#strix-halo#vllm#llama-cpp#multi-utilisateurs#benchmarkPublié le 16 sept. 2026Mis à jour le 16 sept. 2026
Organisation
soothill.io
Auteur
Darren Soothill
Type
Benchmark
Fiabilité
Fiabilité haute
Publié
2026-08-10
Consulté le
16 septembre 2026
Sujets
strix-halo, vllm, llama-cpp, multi-utilisateurs, benchmark

Citée par 7 page(s)

Inférence : panorama des moteursInférence · Comparaison des moteurs de serving (llama-server, Ollama, LM Studio, vLLM, SGLang, Lemonade) pour un Strix Halo sous Linux, et recommandation initiale prudente : llama-server d'abord, vLLM à évaluer.vLLM et SGLang sur Strix HaloInférence · État du support gfx1151 (doc officielle vs images communautaires), avantages pour le multi-utilisateurs, coûts en mémoire et complexité, et critères pour basculer depuis llama-server.Multi-utilisateurs : servir 5 à 10 personnes sur une seule machineMulti-utilisateurs · Pourquoi une machine à 256 Go/s est bornée en génération, ce que le batching et les MoE y changent, ce que les mesures publiées disent, et ce qu'il reste à mesurer avant de promettre un nombre d'utilisateurs.Qwen3.5 et suivants (3.6, 3.8)Modèle · Famille Qwen la plus récente (février à août 2026) : hybrides Gated DeltaNet + MoE, 201 langues, Apache 2.0 ; le 35B-A3B est le modèle des seules mesures multi-slots publiées sur Strix Halo.Qwen3.5-122B-A10B Q4_K_XL — llama.cpp b10333 ROCm 7.14 — 13,6 t/s, TTFT 1,78 s (Soothill)Benchmark · Côté llama.cpp du comparatif vLLM / SGLang / llama.cpp : 13,6 t/s à 1 client, 17,9 t/s agrégés à 2 clients, TTFT 1,775 s sur un MoE de 122 Md.Qwen3.5-122B-A10B GPTQ — vLLM 0.26.0 ROCm 7.14 — 10,3 t/s, TTFT 1,06 s (Soothill)Benchmark · Côté vLLM du comparatif : 10,3 t/s à 1 client, 16,2 t/s agrégés à 2 clients, TTFT 1,056 s ; plus lent en génération mais 40 % plus rapide au premier token que llama.cpp.Évaluer vLLM sur ROCm gfx1151Expérimentation · Vérifier si l'image officielle vllm/vllm-openai-rocm tourne sans patch sur la machine, si elle sert gpt-oss-120b, et si son ordonnanceur apporte un gain mesurable en TTFT et en débit agrégé face à llama-server.

Ce que dit la source

GMKtec EVO-X3, vLLM 0.26.0, SGLang 0.5.17, llama.cpp b10333, ROCm 7.14.0 : Qwen3.5-0.8B BF16 vLLM 86,6 (C=1), 246,5 (C=4), 311,6 t/s (C=8) ; llama.cpp 81,7, 138,0, 207,1 ; Qwen3.5-122B-A10B llama.cpp Q4_K_XL 13,6 (C=1) puis 17,9 (C=2), vLLM GPTQ 10,3 puis 16,2 ; TTFT 122B vLLM 1,056 s vs llama.cpp 1,775 s ; SGLang 36 à 47 % derrière vLLM ; « no single fastest LLM server on Strix Halo ».

Ce qu'on en retient

Seule comparaison multi-clients vLLM / llama.cpp trouvée sur Strix Halo. vLLM monte mieux en charge sur petit modèle ; en 122B les quantifications diffèrent.

Limites

Débits agrégés ; quantifications non équivalentes entre moteurs ; machine GMKtec (même puce).

content/sources/soothill-sglang-vllm-llamacpp-strix-halo.md116 mots