Aller au contenu
Benchmark

Qwen3-30B-A3B Q4 — llama.cpp b5863 — 72,0 t/s (lhl, Framework Desktop)

Premier point de la série Qwen3-30B-A3B sur le Framework Desktop : 72,0 t/s en génération et 604,8 t/s en prompt, mi-2025.

Confirmée#benchmark#strix-halo#llama-cpp#qwen#frameworkPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
Benchmark indépendantRésultat : OKSérie : strix-halo-qwen3-30b-a3bsource de la mesure

Conditions

Date
22 juillet 2025
Kernel
6.15.x
Runtime
llama.cpp b5863
Quantification
Q4
Prompt
pp512 / tg128 (llama-bench)
Tokens prompt
512
Utilisateurs simultanés
1

Mesures

Tokens générésBenchmark indépendant
128
GénérationBenchmark indépendant
72 tok/s
Prompt processingBenchmark indépendant
605 tok/s

Conditions

Framework Desktop, llama.cpp b5863, juillet 2025, backend Vulkan selon la recherche matérielle (HIP selon un autre résumé : à relire dans le fil) 1. Version exacte du modèle (avril 2025 ou 2507) non précisée.

Résultat

tg128 : 72,0 t/s ; pp512 : 604,8 t/s.

Lecture

Valeur basse de la série (72 à 98 t/s) : les builds de 2026 gagnent 20 à 35 % en génération et doublent le prefill. Montre l'intérêt de figer et de noter le build.

content/benchmarks/2025-07-22-qwen3-30b-a3b-q4-llamacpp-lhl.md80 mots