Aller au contenu
Benchmark

Qwen3-Coder-30B-A3B Q4_K_S — llama.cpp ROCm — 73,7 t/s, pp 1 345 t/s (Soothill)

Comparatif Vulkan vs ROCm de Soothill : côté ROCm, 73,7 t/s en génération mais 1 345 t/s en prompt, le meilleur prefill de la série.

Confirmée#benchmark#strix-halo#llama-cpp#rocm#qwenPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
Benchmark indépendantRésultat : OKSérie : strix-halo-qwen3-30b-a3bsource de la mesure

Conditions

Date
3 août 2026
Runtime
llama.cpp b10085 / b10216 (ROCm)
Quantification
Q4_K_S
Prompt
pp512 / tg128 (llama-bench)
Tokens prompt
512
Utilisateurs simultanés
1

Mesures

Tokens générésBenchmark indépendant
128
GénérationBenchmark indépendant
73,7 tok/s
Prompt processingBenchmark indépendant
1 345 tok/s

Conditions

Identiques à la fiche Vulkan, backend ROCm (version ROCm non relevée dans nos notes) 1.

Résultat

tg128 : 73,7 t/s ; pp512 : 1 345 t/s.

Lecture

ROCm +20,6 % en prompt, Vulkan +24,6 % en génération. Bkpaine obtient un classement inverse avec des flags de build ROCm optimisés (rocWMMA, NO_VMM, hipBLASLt) : la réponse dépend du build. À mesurer sur notre stack avec les deux backends et les flags consignés.

content/benchmarks/2026-08-03-qwen3-30b-a3b-rocm-soothill.md72 mots