Aller au contenu
Benchmark

Qwen3.5-122B-A10B GPTQ — vLLM 0.26.0 ROCm 7.14 — 10,3 t/s, TTFT 1,06 s (Soothill)

Côté vLLM du comparatif : 10,3 t/s à 1 client, 16,2 t/s agrégés à 2 clients, TTFT 1,056 s ; plus lent en génération mais 40 % plus rapide au premier token que llama.cpp.

Confirmée#benchmark#strix-halo#vllm#rocm#qwen#multi-utilisateursPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
Benchmark indépendantRésultat : OKSérie : strix-halo-vllm-vs-llamacppsource de la mesure

Conditions

Date
10 août 2026
Runtime
vLLM 0.26.0, ROCm 7.14.0
Quantification
GPTQ
Prompt
charge HTTP, concurrence 1 (et 2 dans le corps)
Utilisateurs simultanés
1

Mesures

TTFTBenchmark indépendant
1 056 ms
GénérationBenchmark indépendant
10,3 tok/s

Conditions

GMKtec EVO-X3, vLLM 0.26.0, ROCm 7.14.0, modèle en quantification GPTQ (pas GGUF) 1. Image vLLM (officielle ou patchée) non précisée dans nos notes.

Résultat

1 client : 10,3 t/s, TTFT 1,056 s. 2 clients : 16,2 t/s agrégés. Dans le même article, sur Qwen3.5-0.8B BF16, vLLM passe de 86,6 à 311,6 t/s agrégés entre 1 et 8 clients, contre 81,7 à 207,1 pour llama.cpp ; SGLang est 36 à 47 % derrière vLLM.

Lecture

content/benchmarks/2026-08-10-qwen3-5-122b-a10b-vllm-soothill.md131 mots