Tag
#strix-halo
67 entrée(s) portent ce tag.
Pages
12
Architecture Box v1Architecture · Composition candidate de la première Box : Framework Desktop sous Linux, Docker Compose, llama-server, Open WebUI, PostgreSQL, Caddy, restic et monitoring, avec un budget mémoire explicite.16 sept. 2026Le laboratoire : lire et alimenter les benchmarksBenchmarks · Ce que la collection benchmarks enregistre, comment lire une fiche (TTFT, tok/s, pp, p50/p95), d'où viennent les données (nôtres ou publiées), comment en ajouter une et quelles séries de comparaison sont prévues.16 sept. 2026Comparaisons matériellesComparaisons · Lecture guidée du tableau comparatif des machines : bande passante, mémoire adressable, prix par Go de mémoire GPU, consommation, écosystème logiciel, bruit et disponibilité, avec l'origine de chaque donnée et une conclusion prudente sur le choix du Framework Desktop.16 sept. 2026Inférence : panorama des moteursInférence · Comparaison des moteurs de serving (llama-server, Ollama, LM Studio, vLLM, SGLang, Lemonade) pour un Strix Halo sous Linux, et recommandation initiale prudente : llama-server d'abord, vLLM à évaluer.16 sept. 2026llama.cpp et llama-serverInférence · Le moteur de départ de la Box : slots, contexte partagé, KV cache quantifié, flash attention, métriques Prometheus, images Docker ROCm/Vulkan et flags connus pour gfx1151.16 sept. 2026vLLM et SGLang sur Strix HaloInférence · État du support gfx1151 (doc officielle vs images communautaires), avantages pour le multi-utilisateurs, coûts en mémoire et complexité, et critères pour basculer depuis llama-server.16 sept. 2026Linux : vue d'ensembleLinux · Rôle du système serveur de la Box, choix de distribution (Fedora, Ubuntu, Debian, Bazzite) face au support Framework et à la matrice ROCm, noyau requis, pilotes, conteneurs, mises à jour et rollback, administration distante.16 sept. 2026Installation reproductibleLinux · Canevas d'installation du serveur Linux de la Box, du BIOS aux conteneurs, présenté étape par étape avec, pour chacune, l'indication de ce qui est sourcé et de ce qui reste à valider sur la machine.16 sept. 2026Mémoire GPU allouable sous LinuxLinux · Comment dépasser les 64 Go de GTT par défaut sur Strix Halo (UMA BIOS, ttm.pages_limit, amd-ttm), avec les plafonds observés (108 et 120 Go), les paramètres contradictoires et la procédure de mesure à réaliser.16 sept. 2026ROCm et Vulkan sur gfx1151Linux · État du support ROCm pour le GPU Strix Halo (gfx1151), officiel depuis ROCm 7.13 preview et 10.0 stable, et comparaison Vulkan/RADV contre ROCm/HIP pour llama.cpp, avec des sources contradictoires.16 sept. 2026Stabilité et problèmes connusLinux · Inventaire sourcé des problèmes de fiabilité rapportés sur Strix Halo et Framework Desktop sous Linux (crashs GPU, VGPR, MES ring timeout, xHCI/s2idle, USB-C, BIOS, NIC Beelink) avec leur état et les contournements.16 sept. 2026Multi-utilisateurs : servir 5 à 10 personnes sur une seule machineMulti-utilisateurs · Pourquoi une machine à 256 Go/s est bornée en génération, ce que le batching et les MoE y changent, ce que les mesures publiées disent, et ce qu'il reste à mesurer avant de promettre un nombre d'utilisateurs.16 sept. 2026
Matériel
4
Beelink GTR9 Pro (Ryzen AI Max+ 395, 128 Go)Matériel · Mini-PC Strix Halo 128 Go avec deux ports 10 GbE Intel E610, machine de référence des guides communautaires Linux, mais dont les cartes réseau plantent sous charge selon des utilisateurs et dont le prix a plus que doublé (4 349 $ en août 2026).16 sept. 2026Framework Desktop (Ryzen AI Max+ 395, 128 Go)Matériel · Machine candidate de la Box IA : APU AMD Strix Halo avec 128 Go de mémoire unifiée, compacte et silencieuse, mais dont le support ROCm n'est officiel que depuis août 2026 et dont la stabilité sous forte charge GPU reste à démontrer.16 sept. 2026GMKtec EVO-X2 (Ryzen AI Max+ 395, 128 Go)Matériel · Mini-PC Strix Halo 128 Go au même silicium que le Framework Desktop, plus cher en août 2026 (3 649,99 $), limité au 2,5 GbE et décrit comme bruyant.16 sept. 2026HP Z2 Mini G1a (Ryzen AI Max+ PRO 395, 128 Go)Matériel · Station compacte HP sur Strix Halo PRO : seule machine 128 Go de la famille à annoncer de la mémoire ECC et un support professionnel, à un prix proche du Framework (3 342 à 3 734 $).16 sept. 2026
Modèles
6
gpt-oss-120bModèle · MoE OpenAI de 117 Md (5,1 Md actifs) sous Apache 2.0 : le candidat principal de la Box, mesuré entre 30 et 56 t/s sur Strix Halo selon le runtime.16 sept. 2026Llama 3.3 70B InstructModèle · Dense Meta de 70 Md, français officiellement supporté, 42,5 Go en Q4 : la référence « gros modèle dense », bornée à environ 5 t/s par la bande passante de Strix Halo.16 sept. 2026Llama 4 Scout (109B-A17B)Modèle · MoE multimodal Meta de 109 Md (17 Md actifs), 19 à 20 t/s mesurés sur Strix Halo, mais licence excluant les entités domiciliées dans l'UE : écarté pour la Box.16 sept. 2026Qwen3-235B-A22B (Instruct-2507)Modèle · Plus gros MoE Qwen3 (235 Md, 22 Md actifs) : trop grand pour 128 Go en Q4 ; praticable en Q3 avec 16 à 17 t/s mesurés, au prix d'une forte quantification.16 sept. 2026Qwen3-30B-A3B (Instruct-2507)Modèle · MoE Alibaba de 30,5 Md (3,3 Md actifs), Apache 2.0, 18,6 Go en Q4 : le candidat « rapide » de la Box, mesuré entre 72 et 98 t/s sur Strix Halo.16 sept. 2026Qwen3.5 et suivants (3.6, 3.8)Modèle · Famille Qwen la plus récente (février à août 2026) : hybrides Gated DeltaNet + MoE, 201 langues, Apache 2.0 ; le 35B-A3B est le modèle des seules mesures multi-slots publiées sur Strix Halo.16 sept. 2026
Benchmarks
17
Llama 3.3 70B (Shisa V2) Q4_K_M — llama.cpp b5863 — 5,0 t/s (lhl, Framework Desktop)Benchmark · Un dense de 70 Md en Q4 sur le Framework Desktop : 5,0 t/s en génération et 94,7 t/s en prompt, exactement au plafond de bande passante.16 sept. 2026Qwen3-30B-A3B Q4 — llama.cpp b5863 — 72,0 t/s (lhl, Framework Desktop)Benchmark · Premier point de la série Qwen3-30B-A3B sur le Framework Desktop : 72,0 t/s en génération et 604,8 t/s en prompt, mi-2025.16 sept. 2026gpt-oss-120b Q4_K_M — llama-server ROCm — 53,4 t/s (visorcraft)Benchmark · gpt-oss-120b sous llama-server avec backend ROCm sur un mini-PC Strix Halo : 53,4 t/s en génération.16 sept. 2026Qwen3-235B-A22B Q3_K_M — llama.cpp ROCm — 17,2 t/s, pp 101 t/s (visorcraft)Benchmark · Le plus gros MoE Qwen3 en 3 bits sur Strix Halo : 17,2 t/s en génération mais seulement 101 t/s en prompt.16 sept. 2026gpt-oss-120b MXFP4 — llama.cpp Vulkan RADV b9049 — 55,6 t/s (hogeheer)Benchmark · Meilleure mesure publiée de gpt-oss-120b sur Strix Halo : 55,57 t/s en génération et 727 t/s en prompt processing, Vulkan RADV, Beelink GTR9 Pro.16 sept. 2026gpt-oss-120b — LM Studio (runtime ROCm llama.cpp) — environ 30 t/s (MindStudio)Benchmark · gpt-oss-120b servi par LM Studio avec le runtime ROCm : environ 30 t/s, soit près de la moitié des mesures llama.cpp directes. Contradiction documentée.16 sept. 2026Qwen3-Coder-30B-A3B Q4_K_S — llama.cpp ROCm — 73,7 t/s, pp 1 345 t/s (Soothill)Benchmark · Comparatif Vulkan vs ROCm de Soothill : côté ROCm, 73,7 t/s en génération mais 1 345 t/s en prompt, le meilleur prefill de la série.16 sept. 2026Qwen3-Coder-30B-A3B Q4_K_S — llama.cpp Vulkan — 97,7 t/s (Soothill)Benchmark · Comparatif Vulkan vs ROCm de Soothill : côté Vulkan, 97,7 t/s en génération et 1 115 t/s en prompt sur Qwen3-Coder-30B-A3B Q4_K_S.16 sept. 2026Qwen3.5-122B-A10B Q4_K_XL — llama.cpp b10333 ROCm 7.14 — 13,6 t/s, TTFT 1,78 s (Soothill)Benchmark · Côté llama.cpp du comparatif vLLM / SGLang / llama.cpp : 13,6 t/s à 1 client, 17,9 t/s agrégés à 2 clients, TTFT 1,775 s sur un MoE de 122 Md.16 sept. 2026Qwen3.5-122B-A10B GPTQ — vLLM 0.26.0 ROCm 7.14 — 10,3 t/s, TTFT 1,06 s (Soothill)Benchmark · Côté vLLM du comparatif : 10,3 t/s à 1 client, 16,2 t/s agrégés à 2 clients, TTFT 1,056 s ; plus lent en génération mais 40 % plus rapide au premier token que llama.cpp.16 sept. 2026Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 1 — 59,2 t/s, TTFT 117 ms (hogeheer)Benchmark · Point de référence à 1 slot de la seule courbe de montée en charge publiée sur Strix Halo : 59,2 t/s et 117 ms de TTFT.16 sept. 2026Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 16 — 10,4 t/s par utilisateur, 166 agrégés (hogeheer)Benchmark · À 16 slots, l'agrégé plafonne (166 t/s, +2,5 % par rapport à 8 slots) et chaque utilisateur tombe à 10,4 t/s avec 547 ms de TTFT.16 sept. 2026Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 4 — 32,7 t/s par utilisateur, 130,8 agrégés (hogeheer)Benchmark · À 4 slots, chaque utilisateur reçoit 32,7 t/s (130,8 t/s agrégés, 2,2 fois le mono) avec un TTFT de 237 ms.16 sept. 2026Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 8 — 20,3 t/s par utilisateur, 162 agrégés (hogeheer)Benchmark · À 8 slots, 20,3 t/s par utilisateur et 162 t/s agrégés (2,7 fois le mono), TTFT 307 ms : le point d'équilibre retenu par l'auteur.16 sept. 2026DeepSeek-R1-Distill-Qwen-32B Q4_K_M — llama.cpp HIP — 11,2 t/s (praveentechworld)Benchmark · Un dense de 32 Md en Q4 (19,8 Go) sur Strix Halo : 11,2 t/s, cohérent avec le plafond bande passante ÷ poids.16 sept. 2026Llama 3.3 70B Q4_K_M — llama.cpp HIP ROCm 6.3+ — 5,1 t/s, contexte 64k (praveentechworld)Benchmark · Llama 3.3 70B Q4_K_M (42,5 Go) sous ROCm avec un contexte de 64k : 5,1 t/s, confirmant le plafond de bande passante un an après la première mesure.16 sept. 2026gpt-oss-120b MXFP4 — llama.cpp ROCm 7.2.0 (fork Lychee b8182) — 51,1 t/s (Pellegrini)Benchmark · gpt-oss-120b sous ROCm 7.2.0 avec un fork llama.cpp : 51,1 t/s en génération, 174 t/s en prompt (charge applicative), environ 59 Go GPU, pic 140 W.16 sept. 2026
Expérimentations
7
Benchmark gpt-oss-120b à 1 utilisateur : Vulkan vs ROCm, contexte court et longExpérimentation · Reproduire sur le Framework Desktop les 51 à 56 t/s publiés pour gpt-oss-120b, comparer les deux backends et mesurer la dégradation à 4k et 32k de profondeur.16 sept. 2026Montée en charge de 1 à 10 utilisateurs : gpt-oss-120b et Qwen3-30B-A3BExpérimentation · Mesurer le débit par utilisateur, l'agrégé et le TTFT p95 à 1, 2, 3, 5 et 10 clients simultanés avec des prompts français courts, RAG et dossiers, pour remplir la matrice de capacité.16 sept. 2026Comparer Vulkan/RADV et ROCm/HIP dans llama.cppExpérimentation · Mesurer sur nos modèles cibles et nos longueurs de prompt RAG le débit de prompt processing et de génération des deux backends GPU de llama.cpp, pour trancher Q-008.16 sept. 2026Évaluer vLLM sur ROCm gfx1151Expérimentation · Vérifier si l'image officielle vllm/vllm-openai-rocm tourne sans patch sur la machine, si elle sert gpt-oss-120b, et si son ordonnanceur apporte un gain mesurable en TTFT et en débit agrégé face à llama-server.16 sept. 2026Mesurer la consommation et le bruit en inférenceExpérimentation · Relever à la prise et au sonomètre ce que consomme et ce qu'émet le Framework Desktop au repos, en inférence mono-utilisateur et sous charge 4 slots, pour remplacer les valeurs contradictoires publiées.16 sept. 2026Mesurer la mémoire GPU allouable sur le Framework DesktopExpérimentation · Établir combien de Go de GTT le GPU gfx1151 peut utiliser de façon stable sous Linux (108 ? 120 ?) avec BIOS 3.06 et noyau 6.18.4+, et le comportement à l'échec.16 sept. 2026Stabilité sous charge continue pendant 24 heuresExpérimentation · Faire tourner llama-server 24 h avec 4 slots actifs et journaliser dmesg, températures et consommation, pour vérifier que les crashs GPU rapportés depuis mars 2026 ne se reproduisent pas avec BIOS 3.06 et noyau 6.18.4+.16 sept. 2026
Questions
3
Combien d'utilisateurs simultanés la Box peut-elle réellement servir ?Question · 1 à 3 actifs simultanés est l'hypothèse de départ ; il faut mesurer la dégradation réelle (tok/s par utilisateur, TTFT) de 1 à 10 utilisateurs, modèle par modèle.16 sept. 2026Combien de mémoire GPU peut-on réellement allouer sur 128 Go ?Question · Les retours vont de 96 Go (UMA BIOS) à 108 ou 120 Go via paramètres noyau ; la valeur stable sur notre machine est à mesurer.16 sept. 2026La plateforme Strix Halo est-elle assez stable pour un serveur 24 h/24 ?Question · Des blocages sous charge GPU et des problèmes de reprise sont rapportés depuis mars 2026 ; un test d'endurance sur notre machine est indispensable avant tout client.16 sept. 2026
Notes
2
Les modèles denses 70B tournent à ~5 tok/s sur Strix HaloNote · Trois sources indépendantes 2025-2026 convergent : Llama 3.3 70B Q4_K_M ≈ 4,7 à 5,1 tok/s. Trop lent pour un assistant interactif.16 sept. 2026ROCm 10.0 supporte officiellement gfx1151Note · ROCm 10.0.0 (26 août 2026) liste enfin Strix Halo ; auparavant « fonctionne mais non listé ».16 sept. 2026
Sources
9
AMD — binaires llama.cpp validés pour ROCm 7.1.1 (Radeon/Ryzen)Source · Binaires llama.cpp « AMD-validated » pour gfx1150/gfx1151, ROCm 7.1.1, Ubuntu 24.04, incluant llama-server, llama-bench et llama-cli.16 sept. 2026Running LM Studio on Linux with Strix Halo (guide et dépannage)Source · Guide communautaire : sélection des runtimes Vulkan et ROCm de LM Studio sous Linux sur Strix Halo, points de blocage.16 sept. 2026strix-halo-sglang — image Docker SGLang pour gfx1151Source · Image communautaire SGLang 0.5.17 / ROCm 7.14 avec gfx1151 ajouté à la liste des cibles AOT.16 sept. 2026amd-strix-halo-vllm-toolboxes (kyuz0)Source · Image vLLM « patchée » (AITER MoE/FP8 désactivés sur gfx1x, contournements RMSNorm et CUDA Graph) ; image ROCm 10.0 sans benchmark publié ; TP=2 sur d.16 sept. 2026lemonade-sdk/llamacpp-rocm — builds nightly llama.cpp + ROCm 7Source · Builds nightly de llama.cpp avec ROCm 7 pour gfx1151 (Windows et Ubuntu).16 sept. 2026praveentechworld — AMD Strix Halo Local LLM Benchmarks: 128GB Unified Memory GuideSource · Bande passante effective environ 213 Go/s (« 75 à 80 % » d'un théorique annoncé à 273 Go/s) ; Llama 3.3 70B Q4_K_M (42,5 Go) 5,1 t/s en HIP ROCm 6.3+.16 sept. 2026SGLang — issue #5131 support Strix/Strix Halo (gfx1150/gfx1151)Source · Demande de support gfx1151 fermée « inactive » sans réponse de mainteneur.16 sept. 2026Soothill — SGLang vs vLLM vs llama.cpp on Strix HaloSource · GMKtec EVO-X3, vLLM 0.26.0, SGLang 0.5.17, llama.cpp b10333, ROCm 7.14.0 : Qwen3.5-0.8B BF16 vLLM 86,6 (C=1), 246,5 (C=4), 311,6 t/s (C=8) ; llama.cpp.16 sept. 2026vLLM — installation GPU AMD ROCmSource · GPU listés : MI200/MI300/MI350, RX 7900, RX 9000, Ryzen AI MAX / AI 300 (gfx1151/1150) avec ROCm 7.0.2 minimum ; images vllm/vllm-openai-rocm (latest.16 sept. 2026
Glossaire
5
Bande passante mémoireTerme · Quantité de données que le processeur ou le GPU peut lire en mémoire par seconde, exprimée en gigaoctets par seconde ; elle borne la vitesse de génération d'un modèle de langage.16 sept. 2026GTT (Graphics Translation Table)Terme · Mécanisme du pilote graphique Linux (amdgpu, via TTM) qui permet au GPU d'adresser de la mémoire système au-delà de la réservation fixée dans le BIOS.16 sept. 2026Mémoire unifiéeTerme · Architecture dans laquelle le processeur et le processeur graphique partagent la même mémoire physique, ce qui permet au GPU d'utiliser une grande partie de la RAM du système pour charger un modèle.16 sept. 2026NPUTerme · Accélérateur spécialisé pour les réseaux de neurones, intégré au processeur, conçu pour des inférences à faible consommation plutôt que pour les grands modèles de langage.16 sept. 2026Strix HaloTerme · Nom de code de la famille de processeurs AMD Ryzen AI Max, qui réunit sur une même puce des cœurs Zen 5, un GPU intégré RDNA 3.5 de grande taille (Radeon 8060S) et un NPU, avec jusqu'à 128 Go de mémoire unifiée LPDDR5X.16 sept. 2026