Benchmark
Qwen3-Coder-30B-A3B Q4_K_S — llama.cpp Vulkan — 97,7 t/s (Soothill)
Comparatif Vulkan vs ROCm de Soothill : côté Vulkan, 97,7 t/s en génération et 1 115 t/s en prompt sur Qwen3-Coder-30B-A3B Q4_K_S.
Confirmée#benchmark#strix-halo#llama-cpp#vulkan#qwenPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
Conditions
- Date
- 3 août 2026
- Runtime
- llama.cpp b10085 / b10216 (Vulkan)
- Quantification
- Q4_K_S
- Prompt
- pp512 / tg128 (llama-bench)
- Tokens prompt
- 512
- Utilisateurs simultanés
- 1
Mesures
- Tokens générésBenchmark indépendant
- 128
- GénérationBenchmark indépendant
- 97,7 tok/s
- Prompt processingBenchmark indépendant
- 1 115 tok/s
Conditions
Darren Soothill, 3 août 2026, llama.cpp b10085 / b10216, backend Vulkan 1. Machine Strix Halo de l'auteur (GMKtec EVO-X3 dans son article suivant ; non confirmé pour celui-ci). Variante Coder du modèle : même architecture que l'Instruct.
Résultat
tg128 : 97,7 t/s ; pp512 : 1 115 t/s.
Lecture
Vulkan gagne 24,6 % en génération face à ROCm (73,7 t/s), mais perd 20,6 % en prompt (1 345 t/s côté ROCm). Voir la fiche jumelle ROCm. Pour la Box, le prefill compte autant que la génération (RAG, dossiers) : le choix du backend n'est pas évident (Q-008).
Sources
- 1llama.cpp: Vulkan vs ROCm on Strix Halo (Soothill)BenchmarkFiabilité moyennesoothill.io · Darren Soothill · publié 2026-08-03 · consulté le 16 sept. 2026 · fiche source