Source
The 2026 Strix Halo Ultimate Benchmark Suite (dev.to)
ConfirméePublié le 16 sept. 2026Mis à jour le 16 sept. 2026
- Organisation
- dev.to
- Auteur
- Agustin Sacco
- Type
- Benchmark
- Fiabilité
- Fiabilité moyenne
- Publié
- 2026-05-31
- Consulté le
- 16 septembre 2026
- Sujets
- strix-halo, llama-cpp, vulkan, benchmark, qwen
Citée par 4 page(s)
Framework Desktop (Ryzen AI Max+ 395, 128 Go)Matériel · Machine candidate de la Box IA : APU AMD Strix Halo avec 128 Go de mémoire unifiée, compacte et silencieuse, mais dont le support ROCm n'est officiel que depuis août 2026 et dont la stabilité sous forte charge GPU reste à démontrer.Gemma 3 27BModèle · Dense multimodal Google de 27 Md, plus de 140 langues, sous Gemma Terms of Use : bon multilingue, mais licence à conditions et lenteur d'un dense ; aucun chiffre Strix Halo trouvé.Qwen3-32BModèle · Dense Alibaba de 32,8 Md, Apache 2.0, contexte 32k natif : référence dense de taille moyenne, plus lente qu'un MoE mais avec un mode raisonnement.Qwen3.5 et suivants (3.6, 3.8)Modèle · Famille Qwen la plus récente (février à août 2026) : hybrides Gated DeltaNet + MoE, 201 langues, Apache 2.0 ; le 35B-A3B est le modèle des seules mesures multi-slots publiées sur Strix Halo.
Ce que dit la source
llama.cpp Vulkan, ROCm 7.2.2 : Qwen 3.6 27B dense Q4_K_XL tg 11,8 t/s (20,0 avec MTP) ; Qwen 3.5 122B MoE Q4_K_M tg 23,2 (24,4 MTP) à 32k de contexte.
Ce qu'on en retient
Ordre de grandeur pour un 27B dense (≈ 12 t/s) faute de chiffre Gemma 3 27B.
Limites
Modèles Qwen 3.5/3.6 non retenus dans le dossier ; MTP est une optimisation spécifique.