Aller au contenu
Tag

#strix-halo

67 entrée(s) portent ce tag.

Pages

12

Architecture Box v1Architecture · Composition candidate de la première Box : Framework Desktop sous Linux, Docker Compose, llama-server, Open WebUI, PostgreSQL, Caddy, restic et monitoring, avec un budget mémoire explicite.Le laboratoire : lire et alimenter les benchmarksBenchmarks · Ce que la collection benchmarks enregistre, comment lire une fiche (TTFT, tok/s, pp, p50/p95), d'où viennent les données (nôtres ou publiées), comment en ajouter une et quelles séries de comparaison sont prévues.Comparaisons matériellesComparaisons · Lecture guidée du tableau comparatif des machines : bande passante, mémoire adressable, prix par Go de mémoire GPU, consommation, écosystème logiciel, bruit et disponibilité, avec l'origine de chaque donnée et une conclusion prudente sur le choix du Framework Desktop.Inférence : panorama des moteursInférence · Comparaison des moteurs de serving (llama-server, Ollama, LM Studio, vLLM, SGLang, Lemonade) pour un Strix Halo sous Linux, et recommandation initiale prudente : llama-server d'abord, vLLM à évaluer.llama.cpp et llama-serverInférence · Le moteur de départ de la Box : slots, contexte partagé, KV cache quantifié, flash attention, métriques Prometheus, images Docker ROCm/Vulkan et flags connus pour gfx1151.vLLM et SGLang sur Strix HaloInférence · État du support gfx1151 (doc officielle vs images communautaires), avantages pour le multi-utilisateurs, coûts en mémoire et complexité, et critères pour basculer depuis llama-server.Linux : vue d'ensembleLinux · Rôle du système serveur de la Box, choix de distribution (Fedora, Ubuntu, Debian, Bazzite) face au support Framework et à la matrice ROCm, noyau requis, pilotes, conteneurs, mises à jour et rollback, administration distante.Installation reproductibleLinux · Canevas d'installation du serveur Linux de la Box, du BIOS aux conteneurs, présenté étape par étape avec, pour chacune, l'indication de ce qui est sourcé et de ce qui reste à valider sur la machine.Mémoire GPU allouable sous LinuxLinux · Comment dépasser les 64 Go de GTT par défaut sur Strix Halo (UMA BIOS, ttm.pages_limit, amd-ttm), avec les plafonds observés (108 et 120 Go), les paramètres contradictoires et la procédure de mesure à réaliser.ROCm et Vulkan sur gfx1151Linux · État du support ROCm pour le GPU Strix Halo (gfx1151), officiel depuis ROCm 7.13 preview et 10.0 stable, et comparaison Vulkan/RADV contre ROCm/HIP pour llama.cpp, avec des sources contradictoires.Stabilité et problèmes connusLinux · Inventaire sourcé des problèmes de fiabilité rapportés sur Strix Halo et Framework Desktop sous Linux (crashs GPU, VGPR, MES ring timeout, xHCI/s2idle, USB-C, BIOS, NIC Beelink) avec leur état et les contournements.Multi-utilisateurs : servir 5 à 10 personnes sur une seule machineMulti-utilisateurs · Pourquoi une machine à 256 Go/s est bornée en génération, ce que le batching et les MoE y changent, ce que les mesures publiées disent, et ce qu'il reste à mesurer avant de promettre un nombre d'utilisateurs.

Benchmarks

17

Llama 3.3 70B (Shisa V2) Q4_K_M — llama.cpp b5863 — 5,0 t/s (lhl, Framework Desktop)Benchmark · Un dense de 70 Md en Q4 sur le Framework Desktop : 5,0 t/s en génération et 94,7 t/s en prompt, exactement au plafond de bande passante.Qwen3-30B-A3B Q4 — llama.cpp b5863 — 72,0 t/s (lhl, Framework Desktop)Benchmark · Premier point de la série Qwen3-30B-A3B sur le Framework Desktop : 72,0 t/s en génération et 604,8 t/s en prompt, mi-2025.gpt-oss-120b Q4_K_M — llama-server ROCm — 53,4 t/s (visorcraft)Benchmark · gpt-oss-120b sous llama-server avec backend ROCm sur un mini-PC Strix Halo : 53,4 t/s en génération.Qwen3-235B-A22B Q3_K_M — llama.cpp ROCm — 17,2 t/s, pp 101 t/s (visorcraft)Benchmark · Le plus gros MoE Qwen3 en 3 bits sur Strix Halo : 17,2 t/s en génération mais seulement 101 t/s en prompt.gpt-oss-120b MXFP4 — llama.cpp Vulkan RADV b9049 — 55,6 t/s (hogeheer)Benchmark · Meilleure mesure publiée de gpt-oss-120b sur Strix Halo : 55,57 t/s en génération et 727 t/s en prompt processing, Vulkan RADV, Beelink GTR9 Pro.gpt-oss-120b — LM Studio (runtime ROCm llama.cpp) — environ 30 t/s (MindStudio)Benchmark · gpt-oss-120b servi par LM Studio avec le runtime ROCm : environ 30 t/s, soit près de la moitié des mesures llama.cpp directes. Contradiction documentée.Qwen3-Coder-30B-A3B Q4_K_S — llama.cpp ROCm — 73,7 t/s, pp 1 345 t/s (Soothill)Benchmark · Comparatif Vulkan vs ROCm de Soothill : côté ROCm, 73,7 t/s en génération mais 1 345 t/s en prompt, le meilleur prefill de la série.Qwen3-Coder-30B-A3B Q4_K_S — llama.cpp Vulkan — 97,7 t/s (Soothill)Benchmark · Comparatif Vulkan vs ROCm de Soothill : côté Vulkan, 97,7 t/s en génération et 1 115 t/s en prompt sur Qwen3-Coder-30B-A3B Q4_K_S.Qwen3.5-122B-A10B Q4_K_XL — llama.cpp b10333 ROCm 7.14 — 13,6 t/s, TTFT 1,78 s (Soothill)Benchmark · Côté llama.cpp du comparatif vLLM / SGLang / llama.cpp : 13,6 t/s à 1 client, 17,9 t/s agrégés à 2 clients, TTFT 1,775 s sur un MoE de 122 Md.Qwen3.5-122B-A10B GPTQ — vLLM 0.26.0 ROCm 7.14 — 10,3 t/s, TTFT 1,06 s (Soothill)Benchmark · Côté vLLM du comparatif : 10,3 t/s à 1 client, 16,2 t/s agrégés à 2 clients, TTFT 1,056 s ; plus lent en génération mais 40 % plus rapide au premier token que llama.cpp.Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 1 — 59,2 t/s, TTFT 117 ms (hogeheer)Benchmark · Point de référence à 1 slot de la seule courbe de montée en charge publiée sur Strix Halo : 59,2 t/s et 117 ms de TTFT.Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 16 — 10,4 t/s par utilisateur, 166 agrégés (hogeheer)Benchmark · À 16 slots, l'agrégé plafonne (166 t/s, +2,5 % par rapport à 8 slots) et chaque utilisateur tombe à 10,4 t/s avec 547 ms de TTFT.Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 4 — 32,7 t/s par utilisateur, 130,8 agrégés (hogeheer)Benchmark · À 4 slots, chaque utilisateur reçoit 32,7 t/s (130,8 t/s agrégés, 2,2 fois le mono) avec un TTFT de 237 ms.Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 8 — 20,3 t/s par utilisateur, 162 agrégés (hogeheer)Benchmark · À 8 slots, 20,3 t/s par utilisateur et 162 t/s agrégés (2,7 fois le mono), TTFT 307 ms : le point d'équilibre retenu par l'auteur.DeepSeek-R1-Distill-Qwen-32B Q4_K_M — llama.cpp HIP — 11,2 t/s (praveentechworld)Benchmark · Un dense de 32 Md en Q4 (19,8 Go) sur Strix Halo : 11,2 t/s, cohérent avec le plafond bande passante ÷ poids.Llama 3.3 70B Q4_K_M — llama.cpp HIP ROCm 6.3+ — 5,1 t/s, contexte 64k (praveentechworld)Benchmark · Llama 3.3 70B Q4_K_M (42,5 Go) sous ROCm avec un contexte de 64k : 5,1 t/s, confirmant le plafond de bande passante un an après la première mesure.gpt-oss-120b MXFP4 — llama.cpp ROCm 7.2.0 (fork Lychee b8182) — 51,1 t/s (Pellegrini)Benchmark · gpt-oss-120b sous ROCm 7.2.0 avec un fork llama.cpp : 51,1 t/s en génération, 174 t/s en prompt (charge applicative), environ 59 Go GPU, pic 140 W.

Expérimentations

7

Benchmark gpt-oss-120b à 1 utilisateur : Vulkan vs ROCm, contexte court et longExpérimentation · Reproduire sur le Framework Desktop les 51 à 56 t/s publiés pour gpt-oss-120b, comparer les deux backends et mesurer la dégradation à 4k et 32k de profondeur.Montée en charge de 1 à 10 utilisateurs : gpt-oss-120b et Qwen3-30B-A3BExpérimentation · Mesurer le débit par utilisateur, l'agrégé et le TTFT p95 à 1, 2, 3, 5 et 10 clients simultanés avec des prompts français courts, RAG et dossiers, pour remplir la matrice de capacité.Comparer Vulkan/RADV et ROCm/HIP dans llama.cppExpérimentation · Mesurer sur nos modèles cibles et nos longueurs de prompt RAG le débit de prompt processing et de génération des deux backends GPU de llama.cpp, pour trancher Q-008.Évaluer vLLM sur ROCm gfx1151Expérimentation · Vérifier si l'image officielle vllm/vllm-openai-rocm tourne sans patch sur la machine, si elle sert gpt-oss-120b, et si son ordonnanceur apporte un gain mesurable en TTFT et en débit agrégé face à llama-server.Mesurer la consommation et le bruit en inférenceExpérimentation · Relever à la prise et au sonomètre ce que consomme et ce qu'émet le Framework Desktop au repos, en inférence mono-utilisateur et sous charge 4 slots, pour remplacer les valeurs contradictoires publiées.Mesurer la mémoire GPU allouable sur le Framework DesktopExpérimentation · Établir combien de Go de GTT le GPU gfx1151 peut utiliser de façon stable sous Linux (108 ? 120 ?) avec BIOS 3.06 et noyau 6.18.4+, et le comportement à l'échec.Stabilité sous charge continue pendant 24 heuresExpérimentation · Faire tourner llama-server 24 h avec 4 slots actifs et journaliser dmesg, températures et consommation, pour vérifier que les crashs GPU rapportés depuis mars 2026 ne se reproduisent pas avec BIOS 3.06 et noyau 6.18.4+.

Sources

9

AMD — binaires llama.cpp validés pour ROCm 7.1.1 (Radeon/Ryzen)Source · Binaires llama.cpp « AMD-validated » pour gfx1150/gfx1151, ROCm 7.1.1, Ubuntu 24.04, incluant llama-server, llama-bench et llama-cli.Running LM Studio on Linux with Strix Halo (guide et dépannage)Source · Guide communautaire : sélection des runtimes Vulkan et ROCm de LM Studio sous Linux sur Strix Halo, points de blocage.strix-halo-sglang — image Docker SGLang pour gfx1151Source · Image communautaire SGLang 0.5.17 / ROCm 7.14 avec gfx1151 ajouté à la liste des cibles AOT.amd-strix-halo-vllm-toolboxes (kyuz0)Source · Image vLLM « patchée » (AITER MoE/FP8 désactivés sur gfx1x, contournements RMSNorm et CUDA Graph) ; image ROCm 10.0 sans benchmark publié ; TP=2 sur d.lemonade-sdk/llamacpp-rocm — builds nightly llama.cpp + ROCm 7Source · Builds nightly de llama.cpp avec ROCm 7 pour gfx1151 (Windows et Ubuntu).praveentechworld — AMD Strix Halo Local LLM Benchmarks: 128GB Unified Memory GuideSource · Bande passante effective environ 213 Go/s (« 75 à 80 % » d'un théorique annoncé à 273 Go/s) ; Llama 3.3 70B Q4_K_M (42,5 Go) 5,1 t/s en HIP ROCm 6.3+.SGLang — issue #5131 support Strix/Strix Halo (gfx1150/gfx1151)Source · Demande de support gfx1151 fermée « inactive » sans réponse de mainteneur.Soothill — SGLang vs vLLM vs llama.cpp on Strix HaloSource · GMKtec EVO-X3, vLLM 0.26.0, SGLang 0.5.17, llama.cpp b10333, ROCm 7.14.0 : Qwen3.5-0.8B BF16 vLLM 86,6 (C=1), 246,5 (C=4), 311,6 t/s (C=8) ; llama.cpp.vLLM — installation GPU AMD ROCmSource · GPU listés : MI200/MI300/MI350, RX 7900, RX 9000, Ryzen AI MAX / AI 300 (gfx1151/1150) avec ROCm 7.0.2 minimum ; images vllm/vllm-openai-rocm (latest.