Aller au contenu
Benchmark

Qwen3-235B-A22B Q3_K_M — llama.cpp ROCm — 17,2 t/s, pp 101 t/s (visorcraft)

Le plus gros MoE Qwen3 en 3 bits sur Strix Halo : 17,2 t/s en génération mais seulement 101 t/s en prompt.

À vérifier#benchmark#strix-halo#llama-cpp#rocm#qwenPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
Benchmark indépendantRésultat : OKSérie : strix-halo-large-moesource de la mesure

Conditions

Date
16 février 2026
Runtime
llama.cpp ROCm (build non relevé)
Quantification
Q3_K_M
Prompt
pp512 / tg128
Tokens prompt
512
Utilisateurs simultanés
1

Mesures

Tokens générésBenchmark indépendant
128
GénérationBenchmark indépendant
17,2 tok/s
Prompt processingBenchmark indépendant
101 tok/s

Conditions

Dépôt visorcraft (mise à jour 16 février 2026), llama.cpp ROCm, machine GMKtec ou Beelink Strix Halo 128 Go 1. Version du modèle (2504 ou 2507) non précisée.

Résultat

tg128 : 17,2 t/s ; pp512 : 101 t/s. Point de comparaison : lhl mesure 16,1 t/s en Q3_K_XL sous Vulkan en 2025 2.

Lecture

Génération acceptable pour un utilisateur seul, mais prefill très lent (un dossier de 20 000 tokens ≈ 3,3 min, estimation) et mémoire presque saturée. La qualité en 3 bits face à gpt-oss-120b en 4 bits natifs reste à évaluer (Q-003).

content/benchmarks/2026-02-16-qwen3-235b-a22b-q3-rocm-visorcraft.md94 mots