Benchmark
Qwen3.5-122B-A10B GPTQ — vLLM 0.26.0 ROCm 7.14 — 10,3 t/s, TTFT 1,06 s (Soothill)
Côté vLLM du comparatif : 10,3 t/s à 1 client, 16,2 t/s agrégés à 2 clients, TTFT 1,056 s ; plus lent en génération mais 40 % plus rapide au premier token que llama.cpp.
Confirmée#benchmark#strix-halo#vllm#rocm#qwen#multi-utilisateursPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
Conditions
- Date
- 10 août 2026
- Runtime
- vLLM 0.26.0, ROCm 7.14.0
- Modèle
- Qwen3.5-122B-A10B GPTQ
- Quantification
- GPTQ
- Prompt
- charge HTTP, concurrence 1 (et 2 dans le corps)
- Utilisateurs simultanés
- 1
Mesures
- TTFTBenchmark indépendant
- 1 056 ms
- GénérationBenchmark indépendant
- 10,3 tok/s
Conditions
GMKtec EVO-X3, vLLM 0.26.0, ROCm 7.14.0, modèle en quantification GPTQ (pas GGUF) 1. Image vLLM (officielle ou patchée) non précisée dans nos notes.
Résultat
1 client : 10,3 t/s, TTFT 1,056 s. 2 clients : 16,2 t/s agrégés. Dans le même article, sur Qwen3.5-0.8B BF16, vLLM passe de 86,6 à 311,6 t/s agrégés entre 1 et 8 clients, contre 81,7 à 207,1 pour llama.cpp ; SGLang est 36 à 47 % derrière vLLM.
Lecture
Sources
- 1Soothill — SGLang vs vLLM vs llama.cpp on Strix HaloBenchmarkFiabilité hautesoothill.io · Darren Soothill · publié 2026-08-10 · consulté le 16 sept. 2026 · fiche source