Benchmark
Qwen3.5-122B-A10B Q4_K_XL — llama.cpp b10333 ROCm 7.14 — 13,6 t/s, TTFT 1,78 s (Soothill)
Côté llama.cpp du comparatif vLLM / SGLang / llama.cpp : 13,6 t/s à 1 client, 17,9 t/s agrégés à 2 clients, TTFT 1,775 s sur un MoE de 122 Md.
Confirmée#benchmark#strix-halo#llama-cpp#rocm#qwen#multi-utilisateurs#vllmPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
Conditions
- Date
- 10 août 2026
- Runtime
- llama.cpp b10333, ROCm 7.14.0
- Quantification
- Q4_K_XL
- Prompt
- charge HTTP, concurrence 1 (et 2 dans le corps)
- Utilisateurs simultanés
- 1
Mesures
- TTFTBenchmark indépendant
- 1 775 ms
- GénérationBenchmark indépendant
- 13,6 tok/s
Conditions
GMKtec EVO-X3 (Strix Halo 128 Go), llama.cpp b10333, ROCm 7.14.0, 10 août 2026 1. Outil de charge et longueur des prompts non relevés dans nos notes.
Résultat
1 client : 13,6 t/s, TTFT 1,775 s. 2 clients : 17,9 t/s agrégés (les débits de cet article sont agrégés ; par utilisateur ≈ 9 t/s, estimation).
Lecture
Le même modèle est mesuré à 21 à 23 t/s en llama-bench par Soothill lui-même (3 août) : la charge HTTP avec prompts réels donne des valeurs plus basses que pp512/tg128. Comparer avec la fiche jumelle vLLM : llama.cpp plus rapide en génération, vLLM meilleur en TTFT, quantifications différentes.
Sources
- 1Soothill — SGLang vs vLLM vs llama.cpp on Strix HaloBenchmarkFiabilité hautesoothill.io · Darren Soothill · publié 2026-08-10 · consulté le 16 sept. 2026 · fiche source