Source
Running 122B-Parameter LLMs Locally on AMD Strix Halo (Pellegrini, LinkedIn)
ConfirméePublié le 16 sept. 2026Mis à jour le 16 sept. 2026À revérifier le 15 déc. 2026
- Organisation
- LinkedIn (article personnel)
- Auteur
- Pellegrini
- Type
- Benchmark
- Fiabilité
- Fiabilité moyenne
- Publié
- 2026
- Consulté le
- 16 septembre 2026
- Sujets
- strix-halo, gpt-oss, benchmark, rocm
Citée par 8 page(s)
llama.cpp et llama-serverInférence · Le moteur de départ de la Box : slots, contexte partagé, KV cache quantifié, flash attention, métriques Prometheus, images Docker ROCm/Vulkan et flags connus pour gfx1151.Dimensionner la Box pour un cabinetMulti-utilisateurs · Méthode pour passer d'un profil d'usage (requêtes courtes, analyses de dossiers longs) à un choix de modèle, de slots et de contexte, avec trois scénarios et la liste de ce qu'il faudra mesurer.Multi-utilisateurs : servir 5 à 10 personnes sur une seule machineMulti-utilisateurs · Pourquoi une machine à 256 Go/s est bornée en génération, ce que le batching et les MoE y changent, ce que les mesures publiées disent, et ce qu'il reste à mesurer avant de promettre un nombre d'utilisateurs.Coûts et pricingCoûts & pricing · Coût réel d'une Box (CAPEX, OPEX, TCO 3 ans) à partir des prix constatés et des consommations mesurées par des tiers, puis méthode de marge et scénarios de prix pour un cabinet de 8 personnes ; tout prix est une hypothèse.gpt-oss-120bModèle · MoE OpenAI de 117 Md (5,1 Md actifs) sous Apache 2.0 : le candidat principal de la Box, mesuré entre 30 et 56 t/s sur Strix Halo selon le runtime.Qwen3.5 et suivants (3.6, 3.8)Modèle · Famille Qwen la plus récente (février à août 2026) : hybrides Gated DeltaNet + MoE, 201 langues, Apache 2.0 ; le 35B-A3B est le modèle des seules mesures multi-slots publiées sur Strix Halo.gpt-oss-120b MXFP4 — llama.cpp ROCm 7.2.0 (fork Lychee b8182) — 51,1 t/s (Pellegrini)Benchmark · gpt-oss-120b sous ROCm 7.2.0 avec un fork llama.cpp : 51,1 t/s en génération, 174 t/s en prompt (charge applicative), environ 59 Go GPU, pic 140 W.Benchmark gpt-oss-120b à 1 utilisateur : Vulkan vs ROCm, contexte court et longExpérimentation · Reproduire sur le Framework Desktop les 51 à 56 t/s publiés pour gpt-oss-120b, comparer les deux backends et mesurer la dégradation à 4k et 32k de profondeur.
Ce que dit la source
gpt-oss-120b (MXFP4) sous ROCm 7.2.0 avec un fork de llama.cpp (b8182) : 51,1 tokens/s en génération, 174 tokens/s en prompt processing, environ 59 Go de mémoire GPU, pic de consommation autour de 140 W. L'auteur note un « poor tool calling ».
Ce qu'on en retient
Ordre de grandeur cohérent avec d'autres mesures (51 à 56 tokens/s mono-utilisateur pour gpt-oss-120b). La consommation en inférence (environ 140 W en pic) dépasse la moyenne mesurée par Phoronix sur charge mixte.
Limites
Charge applicative, fork non standard, date imprécise ; ne pas comparer directement avec des mesures llama-bench.