Soothill — SGLang vs vLLM vs llama.cpp on Strix Halo
GMKtec EVO-X3, vLLM 0.26.0, SGLang 0.5.17, llama.cpp b10333, ROCm 7.14.0 : Qwen3.5-0.8B BF16 vLLM 86,6 (C=1), 246,5 (C=4), 311,6 t/s (C=8) ; llama.cpp.
- Organisation
- soothill.io
- Auteur
- Darren Soothill
- Type
- Benchmark
- Fiabilité
- Fiabilité haute
- Publié
- 2026-08-10
- Consulté le
- 16 septembre 2026
- Sujets
- strix-halo, vllm, llama-cpp, multi-utilisateurs, benchmark
Citée par 7 page(s)
Ce que dit la source
GMKtec EVO-X3, vLLM 0.26.0, SGLang 0.5.17, llama.cpp b10333, ROCm 7.14.0 : Qwen3.5-0.8B BF16 vLLM 86,6 (C=1), 246,5 (C=4), 311,6 t/s (C=8) ; llama.cpp 81,7, 138,0, 207,1 ; Qwen3.5-122B-A10B llama.cpp Q4_K_XL 13,6 (C=1) puis 17,9 (C=2), vLLM GPTQ 10,3 puis 16,2 ; TTFT 122B vLLM 1,056 s vs llama.cpp 1,775 s ; SGLang 36 à 47 % derrière vLLM ; « no single fastest LLM server on Strix Halo ».
Ce qu'on en retient
Seule comparaison multi-clients vLLM / llama.cpp trouvée sur Strix Halo. vLLM monte mieux en charge sur petit modèle ; en 122B les quantifications diffèrent.
Limites
Débits agrégés ; quantifications non équivalentes entre moteurs ; machine GMKtec (même puce).