Aller au contenu
Benchmark

Qwen3.5-122B-A10B Q4_K_XL — llama.cpp b10333 ROCm 7.14 — 13,6 t/s, TTFT 1,78 s (Soothill)

Côté llama.cpp du comparatif vLLM / SGLang / llama.cpp : 13,6 t/s à 1 client, 17,9 t/s agrégés à 2 clients, TTFT 1,775 s sur un MoE de 122 Md.

Confirmée#benchmark#strix-halo#llama-cpp#rocm#qwen#multi-utilisateurs#vllmPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
Benchmark indépendantRésultat : OKSérie : strix-halo-vllm-vs-llamacppsource de la mesure

Conditions

Date
10 août 2026
Runtime
llama.cpp b10333, ROCm 7.14.0
Quantification
Q4_K_XL
Prompt
charge HTTP, concurrence 1 (et 2 dans le corps)
Utilisateurs simultanés
1

Mesures

TTFTBenchmark indépendant
1 775 ms
GénérationBenchmark indépendant
13,6 tok/s

Conditions

GMKtec EVO-X3 (Strix Halo 128 Go), llama.cpp b10333, ROCm 7.14.0, 10 août 2026 1. Outil de charge et longueur des prompts non relevés dans nos notes.

Résultat

1 client : 13,6 t/s, TTFT 1,775 s. 2 clients : 17,9 t/s agrégés (les débits de cet article sont agrégés ; par utilisateur ≈ 9 t/s, estimation).

Lecture

Le même modèle est mesuré à 21 à 23 t/s en llama-bench par Soothill lui-même (3 août) : la charge HTTP avec prompts réels donne des valeurs plus basses que pp512/tg128. Comparer avec la fiche jumelle vLLM : llama.cpp plus rapide en génération, vLLM meilleur en TTFT, quantifications différentes.

content/benchmarks/2026-08-10-qwen3-5-122b-a10b-llamacpp-soothill.md106 mots