Benchmark
Qwen3-235B-A22B Q3_K_M — llama.cpp ROCm — 17,2 t/s, pp 101 t/s (visorcraft)
Le plus gros MoE Qwen3 en 3 bits sur Strix Halo : 17,2 t/s en génération mais seulement 101 t/s en prompt.
À vérifier#benchmark#strix-halo#llama-cpp#rocm#qwenPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
Conditions
- Date
- 16 février 2026
- Runtime
- llama.cpp ROCm (build non relevé)
- Modèle
- Qwen3-235B-A22B Q3_K_M
- Quantification
- Q3_K_M
- Prompt
- pp512 / tg128
- Tokens prompt
- 512
- Utilisateurs simultanés
- 1
Mesures
- Tokens générésBenchmark indépendant
- 128
- GénérationBenchmark indépendant
- 17,2 tok/s
- Prompt processingBenchmark indépendant
- 101 tok/s
Conditions
Dépôt visorcraft (mise à jour 16 février 2026), llama.cpp ROCm, machine GMKtec ou Beelink Strix Halo 128 Go 1. Version du modèle (2504 ou 2507) non précisée.
Résultat
tg128 : 17,2 t/s ; pp512 : 101 t/s. Point de comparaison : lhl mesure 16,1 t/s en Q3_K_XL sous Vulkan en 2025 2.
Lecture
Génération acceptable pour un utilisateur seul, mais prefill très lent (un dossier de 20 000 tokens ≈ 3,3 min, estimation) et mémoire presque saturée. La qualité en 3 bits face à gpt-oss-120b en 4 bits natifs reste à évaluer (Q-003).
Sources
- 1strix-halo-llm-perf (visorcraft)BenchmarkFiabilité moyenneGitHub (communauté) · visorcraft · publié 2026-02-16 (màj) · consulté le 16 sept. 2026 · fiche source
- 2AMD Strix Halo (Ryzen AI Max+ 395) GPU Performance (llm-tracker)BenchmarkFiabilité hautellm-tracker.info · lhl · publié 2025-05-17 · consulté le 16 sept. 2026 · fiche source