Benchmark
Qwen3-30B-A3B Q4 — llama.cpp b5863 — 72,0 t/s (lhl, Framework Desktop)
Premier point de la série Qwen3-30B-A3B sur le Framework Desktop : 72,0 t/s en génération et 604,8 t/s en prompt, mi-2025.
Confirmée#benchmark#strix-halo#llama-cpp#qwen#frameworkPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
Conditions
- Date
- 22 juillet 2025
- Kernel
- 6.15.x
- Runtime
- llama.cpp b5863
- Modèle
- Qwen3-30B-A3B Q4
- Quantification
- Q4
- Prompt
- pp512 / tg128 (llama-bench)
- Tokens prompt
- 512
- Utilisateurs simultanés
- 1
Mesures
- Tokens générésBenchmark indépendant
- 128
- GénérationBenchmark indépendant
- 72 tok/s
- Prompt processingBenchmark indépendant
- 605 tok/s
Conditions
Framework Desktop, llama.cpp b5863, juillet 2025, backend Vulkan selon la recherche matérielle (HIP selon un autre résumé : à relire dans le fil) 1. Version exacte du modèle (avril 2025 ou 2507) non précisée.
Résultat
tg128 : 72,0 t/s ; pp512 : 604,8 t/s.
Lecture
Valeur basse de la série (72 à 98 t/s) : les builds de 2026 gagnent 20 à 35 % en génération et doublent le prefill. Montre l'intérêt de figer et de noter le build.
Sources
- 1Strix Halo (Ryzen AI Max+ 395) LLM Benchmark Results (Level1Techs, lhl)BenchmarkFiabilité moyenneLevel1Techs Forums · lhl · publié 2025-07-22 (màj 2025-08-31) · consulté le 16 sept. 2026 · fiche source