Aller au contenu
Source

strix-halo-llm-perf (visorcraft)

ConfirméePublié le 16 sept. 2026Mis à jour le 16 sept. 2026
Organisation
GitHub (communauté)
Auteur
visorcraft
Type
Benchmark
Fiabilité
Fiabilité moyenne
Publié
2026-02-16 (màj)
Consulté le
16 septembre 2026
Sujets
strix-halo, llama-cpp, benchmark, gpt-oss, qwen

Citée par 8 page(s)

ROCm et Vulkan sur gfx1151Linux · État du support ROCm pour le GPU Strix Halo (gfx1151), officiel depuis ROCm 7.13 preview et 10.0 stable, et comparaison Vulkan/RADV contre ROCm/HIP pour llama.cpp, avec des sources contradictoires.Framework Desktop (Ryzen AI Max+ 395, 128 Go)Matériel · Machine candidate de la Box IA : APU AMD Strix Halo avec 128 Go de mémoire unifiée, compacte et silencieuse, mais dont le support ROCm n'est officiel que depuis août 2026 et dont la stabilité sous forte charge GPU reste à démontrer.GMKtec EVO-X2 (Ryzen AI Max+ 395, 128 Go)Matériel · Mini-PC Strix Halo 128 Go au même silicium que le Framework Desktop, plus cher en août 2026 (3 649,99 $), limité au 2,5 GbE et décrit comme bruyant.gpt-oss-120bModèle · MoE OpenAI de 117 Md (5,1 Md actifs) sous Apache 2.0 : le candidat principal de la Box, mesuré entre 30 et 56 t/s sur Strix Halo selon le runtime.Qwen3-235B-A22B (Instruct-2507)Modèle · Plus gros MoE Qwen3 (235 Md, 22 Md actifs) : trop grand pour 128 Go en Q4 ; praticable en Q3 avec 16 à 17 t/s mesurés, au prix d'une forte quantification.Qwen3-30B-A3B (Instruct-2507)Modèle · MoE Alibaba de 30,5 Md (3,3 Md actifs), Apache 2.0, 18,6 Go en Q4 : le candidat « rapide » de la Box, mesuré entre 72 et 98 t/s sur Strix Halo.gpt-oss-120b Q4_K_M — llama-server ROCm — 53,4 t/s (visorcraft)Benchmark · gpt-oss-120b sous llama-server avec backend ROCm sur un mini-PC Strix Halo : 53,4 t/s en génération.Qwen3-235B-A22B Q3_K_M — llama.cpp ROCm — 17,2 t/s, pp 101 t/s (visorcraft)Benchmark · Le plus gros MoE Qwen3 en 3 bits sur Strix Halo : 17,2 t/s en génération mais seulement 101 t/s en prompt.

Ce que dit la source

Sept backends comparés (Q6_K_XL) : ROCm 7.x nightlies meilleur en pp (≈ 502 t/s), AMDVLK meilleur en tg (38,65 t/s, +16 %). gpt-oss-120b Q4_K_M llama-server ROCm tg 53,4 ; gpt-oss-120b MXFP4 pp 174 / tg 51,1 ; Qwen3 30B-A3B Q4_K_M ROCm pp 1 142 / tg 86,1 ; Qwen3-235B-A22B Q3_K_M ROCm pp 101 / tg 17,2.

Ce qu'on en retient

Seule source chiffrée pour Qwen3-235B sur Strix Halo ; confirme ≈ 51–53 t/s pour gpt-oss-120b.

Limites

Machines GMKtec/Beelink (pas Framework) ; ROCm nightlies de février 2026.

content/sources/visorcraft-strix-halo-llm-perf.md91 mots