Aller au contenu
Source

Strix Halo (Ryzen AI Max+ 395) LLM Benchmark Results (Level1Techs, lhl)

ConfirméePublié le 16 sept. 2026Mis à jour le 16 sept. 2026
Organisation
Level1Techs Forums
Auteur
lhl
Type
Benchmark
Fiabilité
Fiabilité moyenne
Publié
2025-07-22 (màj 2025-08-31)
Consulté le
16 septembre 2026
Sujets
strix-halo, llama-cpp, vulkan, benchmark, llama

Citée par 8 page(s)

Dimensionner la Box pour un cabinetMulti-utilisateurs · Méthode pour passer d'un profil d'usage (requêtes courtes, analyses de dossiers longs) à un choix de modèle, de slots et de contexte, avec trois scénarios et la liste de ce qu'il faudra mesurer.Multi-utilisateurs : servir 5 à 10 personnes sur une seule machineMulti-utilisateurs · Pourquoi une machine à 256 Go/s est bornée en génération, ce que le batching et les MoE y changent, ce que les mesures publiées disent, et ce qu'il reste à mesurer avant de promettre un nombre d'utilisateurs.Framework Desktop (Ryzen AI Max+ 395, 128 Go)Matériel · Machine candidate de la Box IA : APU AMD Strix Halo avec 128 Go de mémoire unifiée, compacte et silencieuse, mais dont le support ROCm n'est officiel que depuis août 2026 et dont la stabilité sous forte charge GPU reste à démontrer.Llama 3.3 70B InstructModèle · Dense Meta de 70 Md, français officiellement supporté, 42,5 Go en Q4 : la référence « gros modèle dense », bornée à environ 5 t/s par la bande passante de Strix Halo.Llama 4 Scout (109B-A17B)Modèle · MoE multimodal Meta de 109 Md (17 Md actifs), 19 à 20 t/s mesurés sur Strix Halo, mais licence excluant les entités domiciliées dans l'UE : écarté pour la Box.Qwen3-30B-A3B (Instruct-2507)Modèle · MoE Alibaba de 30,5 Md (3,3 Md actifs), Apache 2.0, 18,6 Go en Q4 : le candidat « rapide » de la Box, mesuré entre 72 et 98 t/s sur Strix Halo.Llama 3.3 70B (Shisa V2) Q4_K_M — llama.cpp b5863 — 5,0 t/s (lhl, Framework Desktop)Benchmark · Un dense de 70 Md en Q4 sur le Framework Desktop : 5,0 t/s en génération et 94,7 t/s en prompt, exactement au plafond de bande passante.Qwen3-30B-A3B Q4 — llama.cpp b5863 — 72,0 t/s (lhl, Framework Desktop)Benchmark · Premier point de la série Qwen3-30B-A3B sur le Framework Desktop : 72,0 t/s en génération et 604,8 t/s en prompt, mi-2025.

Ce que dit la source

llama.cpp Vulkan b5863 : Shisa V2 70B (base Llama 3.3) Q4 pp512 94,7 / tg128 5,0 ; Qwen3 30B-A3B Q4 pp 604,8 / tg 72,0.

Ce qu'on en retient

Confirme qu'un 70B dense tourne à ≈ 5 t/s : trop lent pour un usage interactif multi-utilisateurs.

Limites

Été 2025 ; versions llama.cpp et pilotes anciennes.

content/sources/level1techs-strix-halo-benchmarks.md60 mots