Source
AMD Strix Halo (Ryzen AI Max+ 395) GPU Performance (llm-tracker)
ConfirméePublié le 16 sept. 2026Mis à jour le 16 sept. 2026
- Organisation
- llm-tracker.info
- Auteur
- lhl
- Type
- Benchmark
- Fiabilité
- Fiabilité haute
- Publié
- 2025-05-17
- Consulté le
- 16 septembre 2026
- Sujets
- strix-halo, benchmark, vulkan, rocm, llama-cpp
Citée par 9 page(s)
Comparaisons matériellesComparaisons · Lecture guidée du tableau comparatif des machines : bande passante, mémoire adressable, prix par Go de mémoire GPU, consommation, écosystème logiciel, bruit et disponibilité, avec l'origine de chaque donnée et une conclusion prudente sur le choix du Framework Desktop.llama.cpp et llama-serverInférence · Le moteur de départ de la Box : slots, contexte partagé, KV cache quantifié, flash attention, métriques Prometheus, images Docker ROCm/Vulkan et flags connus pour gfx1151.ROCm et Vulkan sur gfx1151Linux · État du support ROCm pour le GPU Strix Halo (gfx1151), officiel depuis ROCm 7.13 preview et 10.0 stable, et comparaison Vulkan/RADV contre ROCm/HIP pour llama.cpp, avec des sources contradictoires.Multi-utilisateurs : servir 5 à 10 personnes sur une seule machineMulti-utilisateurs · Pourquoi une machine à 256 Go/s est bornée en génération, ce que le batching et les MoE y changent, ce que les mesures publiées disent, et ce qu'il reste à mesurer avant de promettre un nombre d'utilisateurs.Framework Desktop (Ryzen AI Max+ 395, 128 Go)Matériel · Machine candidate de la Box IA : APU AMD Strix Halo avec 128 Go de mémoire unifiée, compacte et silencieuse, mais dont le support ROCm n'est officiel que depuis août 2026 et dont la stabilité sous forte charge GPU reste à démontrer.gpt-oss-120bModèle · MoE OpenAI de 117 Md (5,1 Md actifs) sous Apache 2.0 : le candidat principal de la Box, mesuré entre 30 et 56 t/s sur Strix Halo selon le runtime.Llama 3.3 70B InstructModèle · Dense Meta de 70 Md, français officiellement supporté, 42,5 Go en Q4 : la référence « gros modèle dense », bornée à environ 5 t/s par la bande passante de Strix Halo.Qwen3-235B-A22B (Instruct-2507)Modèle · Plus gros MoE Qwen3 (235 Md, 22 Md actifs) : trop grand pour 128 Go en Q4 ; praticable en Q3 avec 16 à 17 t/s mesurés, au prix d'une forte quantification.Qwen3-235B-A22B Q3_K_M — llama.cpp ROCm — 17,2 t/s, pp 101 t/s (visorcraft)Benchmark · Le plus gros MoE Qwen3 en 3 bits sur Strix Halo : 17,2 t/s en génération mais seulement 101 t/s en prompt.
Ce que dit la source
Premier benchmark systématique : bande passante mesurée ≈ 212 Go/s (rocm_bandwidth_test) ; Llama-2-7B Q4_0 : HIP+WMMA+FA pp 343,9 / tg 50,9 contre Vulkan+FA pp 884,2 / tg 52,7 ; Llama 4 Scout 109B Q4 Vulkan pp 102,6 / tg 20,2 ; HIP « bien inférieur aux attentes » en prompt processing ; PyTorch Flash Attention non fonctionnel sur gfx1151 à cette date.
Ce qu'on en retient
Bande passante réelle ≈ 83 % de l'annonce ; Vulkan déjà compétitif en 2025.
Limites
Mai 2025 : pilotes et ROCm ont beaucoup évolué depuis. Ne pas utiliser les chiffres absolus comme référence 2026.