Benchmark
Qwen3-Coder-30B-A3B Q4_K_S — llama.cpp ROCm — 73,7 t/s, pp 1 345 t/s (Soothill)
Comparatif Vulkan vs ROCm de Soothill : côté ROCm, 73,7 t/s en génération mais 1 345 t/s en prompt, le meilleur prefill de la série.
Confirmée#benchmark#strix-halo#llama-cpp#rocm#qwenPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
Conditions
- Date
- 3 août 2026
- Runtime
- llama.cpp b10085 / b10216 (ROCm)
- Quantification
- Q4_K_S
- Prompt
- pp512 / tg128 (llama-bench)
- Tokens prompt
- 512
- Utilisateurs simultanés
- 1
Mesures
- Tokens générésBenchmark indépendant
- 128
- GénérationBenchmark indépendant
- 73,7 tok/s
- Prompt processingBenchmark indépendant
- 1 345 tok/s
Conditions
Identiques à la fiche Vulkan, backend ROCm (version ROCm non relevée dans nos notes) 1.
Résultat
tg128 : 73,7 t/s ; pp512 : 1 345 t/s.
Lecture
ROCm +20,6 % en prompt, Vulkan +24,6 % en génération. Bkpaine obtient un classement inverse avec des flags de build ROCm optimisés (rocWMMA, NO_VMM, hipBLASLt) : la réponse dépend du build. À mesurer sur notre stack avec les deux backends et les flags consignés.
Sources
- 1llama.cpp: Vulkan vs ROCm on Strix Halo (Soothill)BenchmarkFiabilité moyennesoothill.io · Darren Soothill · publié 2026-08-03 · consulté le 16 sept. 2026 · fiche source