Aller au contenu
Benchmark

Qwen3-Coder-30B-A3B Q4_K_S — llama.cpp Vulkan — 97,7 t/s (Soothill)

Comparatif Vulkan vs ROCm de Soothill : côté Vulkan, 97,7 t/s en génération et 1 115 t/s en prompt sur Qwen3-Coder-30B-A3B Q4_K_S.

Confirmée#benchmark#strix-halo#llama-cpp#vulkan#qwenPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
Benchmark indépendantRésultat : OKSérie : strix-halo-qwen3-30b-a3bsource de la mesure

Conditions

Date
3 août 2026
Runtime
llama.cpp b10085 / b10216 (Vulkan)
Quantification
Q4_K_S
Prompt
pp512 / tg128 (llama-bench)
Tokens prompt
512
Utilisateurs simultanés
1

Mesures

Tokens générésBenchmark indépendant
128
GénérationBenchmark indépendant
97,7 tok/s
Prompt processingBenchmark indépendant
1 115 tok/s

Conditions

Darren Soothill, 3 août 2026, llama.cpp b10085 / b10216, backend Vulkan 1. Machine Strix Halo de l'auteur (GMKtec EVO-X3 dans son article suivant ; non confirmé pour celui-ci). Variante Coder du modèle : même architecture que l'Instruct.

Résultat

tg128 : 97,7 t/s ; pp512 : 1 115 t/s.

Lecture

Vulkan gagne 24,6 % en génération face à ROCm (73,7 t/s), mais perd 20,6 % en prompt (1 345 t/s côté ROCm). Voir la fiche jumelle ROCm. Pour la Box, le prefill compte autant que la génération (RAG, dossiers) : le choix du backend n'est pas évident (Q-008).

content/benchmarks/2026-08-03-qwen3-30b-a3b-vulkan-soothill.md98 mots