Tag
#rocm
46 entrée(s) portent ce tag.
Pages
10
Comparaisons matériellesComparaisons · Lecture guidée du tableau comparatif des machines : bande passante, mémoire adressable, prix par Go de mémoire GPU, consommation, écosystème logiciel, bruit et disponibilité, avec l'origine de chaque donnée et une conclusion prudente sur le choix du Framework Desktop.16 sept. 2026Inférence : panorama des moteursInférence · Comparaison des moteurs de serving (llama-server, Ollama, LM Studio, vLLM, SGLang, Lemonade) pour un Strix Halo sous Linux, et recommandation initiale prudente : llama-server d'abord, vLLM à évaluer.16 sept. 2026llama.cpp et llama-serverInférence · Le moteur de départ de la Box : slots, contexte partagé, KV cache quantifié, flash attention, métriques Prometheus, images Docker ROCm/Vulkan et flags connus pour gfx1151.16 sept. 2026Ollama, LM Studio, Lemonade : les moteurs « faciles »Inférence · Trois surcouches de llama.cpp orientées simplicité : variables de parallélisme d'Ollama, requêtes concurrentes de LM Studio, Lemonade porté par AMD ; limites pour un serveur multi-utilisateurs.16 sept. 2026vLLM et SGLang sur Strix HaloInférence · État du support gfx1151 (doc officielle vs images communautaires), avantages pour le multi-utilisateurs, coûts en mémoire et complexité, et critères pour basculer depuis llama-server.16 sept. 2026Linux : vue d'ensembleLinux · Rôle du système serveur de la Box, choix de distribution (Fedora, Ubuntu, Debian, Bazzite) face au support Framework et à la matrice ROCm, noyau requis, pilotes, conteneurs, mises à jour et rollback, administration distante.16 sept. 2026Installation reproductibleLinux · Canevas d'installation du serveur Linux de la Box, du BIOS aux conteneurs, présenté étape par étape avec, pour chacune, l'indication de ce qui est sourcé et de ce qui reste à valider sur la machine.16 sept. 2026Mémoire GPU allouable sous LinuxLinux · Comment dépasser les 64 Go de GTT par défaut sur Strix Halo (UMA BIOS, ttm.pages_limit, amd-ttm), avec les plafonds observés (108 et 120 Go), les paramètres contradictoires et la procédure de mesure à réaliser.16 sept. 2026ROCm et Vulkan sur gfx1151Linux · État du support ROCm pour le GPU Strix Halo (gfx1151), officiel depuis ROCm 7.13 preview et 10.0 stable, et comparaison Vulkan/RADV contre ROCm/HIP pour llama.cpp, avec des sources contradictoires.16 sept. 2026Stabilité et problèmes connusLinux · Inventaire sourcé des problèmes de fiabilité rapportés sur Strix Halo et Framework Desktop sous Linux (crashs GPU, VGPR, MES ring timeout, xHCI/s2idle, USB-C, BIOS, NIC Beelink) avec leur état et les contournements.16 sept. 2026
Benchmarks
9
gpt-oss-120b Q4_K_M — llama-server ROCm — 53,4 t/s (visorcraft)Benchmark · gpt-oss-120b sous llama-server avec backend ROCm sur un mini-PC Strix Halo : 53,4 t/s en génération.16 sept. 2026Qwen3-235B-A22B Q3_K_M — llama.cpp ROCm — 17,2 t/s, pp 101 t/s (visorcraft)Benchmark · Le plus gros MoE Qwen3 en 3 bits sur Strix Halo : 17,2 t/s en génération mais seulement 101 t/s en prompt.16 sept. 2026gpt-oss-120b — LM Studio (runtime ROCm llama.cpp) — environ 30 t/s (MindStudio)Benchmark · gpt-oss-120b servi par LM Studio avec le runtime ROCm : environ 30 t/s, soit près de la moitié des mesures llama.cpp directes. Contradiction documentée.16 sept. 2026Qwen3-Coder-30B-A3B Q4_K_S — llama.cpp ROCm — 73,7 t/s, pp 1 345 t/s (Soothill)Benchmark · Comparatif Vulkan vs ROCm de Soothill : côté ROCm, 73,7 t/s en génération mais 1 345 t/s en prompt, le meilleur prefill de la série.16 sept. 2026Qwen3.5-122B-A10B Q4_K_XL — llama.cpp b10333 ROCm 7.14 — 13,6 t/s, TTFT 1,78 s (Soothill)Benchmark · Côté llama.cpp du comparatif vLLM / SGLang / llama.cpp : 13,6 t/s à 1 client, 17,9 t/s agrégés à 2 clients, TTFT 1,775 s sur un MoE de 122 Md.16 sept. 2026Qwen3.5-122B-A10B GPTQ — vLLM 0.26.0 ROCm 7.14 — 10,3 t/s, TTFT 1,06 s (Soothill)Benchmark · Côté vLLM du comparatif : 10,3 t/s à 1 client, 16,2 t/s agrégés à 2 clients, TTFT 1,056 s ; plus lent en génération mais 40 % plus rapide au premier token que llama.cpp.16 sept. 2026DeepSeek-R1-Distill-Qwen-32B Q4_K_M — llama.cpp HIP — 11,2 t/s (praveentechworld)Benchmark · Un dense de 32 Md en Q4 (19,8 Go) sur Strix Halo : 11,2 t/s, cohérent avec le plafond bande passante ÷ poids.16 sept. 2026Llama 3.3 70B Q4_K_M — llama.cpp HIP ROCm 6.3+ — 5,1 t/s, contexte 64k (praveentechworld)Benchmark · Llama 3.3 70B Q4_K_M (42,5 Go) sous ROCm avec un contexte de 64k : 5,1 t/s, confirmant le plafond de bande passante un an après la première mesure.16 sept. 2026gpt-oss-120b MXFP4 — llama.cpp ROCm 7.2.0 (fork Lychee b8182) — 51,1 t/s (Pellegrini)Benchmark · gpt-oss-120b sous ROCm 7.2.0 avec un fork llama.cpp : 51,1 t/s en génération, 174 t/s en prompt (charge applicative), environ 59 Go GPU, pic 140 W.16 sept. 2026
Expérimentations
5
Benchmark gpt-oss-120b à 1 utilisateur : Vulkan vs ROCm, contexte court et longExpérimentation · Reproduire sur le Framework Desktop les 51 à 56 t/s publiés pour gpt-oss-120b, comparer les deux backends et mesurer la dégradation à 4k et 32k de profondeur.16 sept. 2026Comparer Vulkan/RADV et ROCm/HIP dans llama.cppExpérimentation · Mesurer sur nos modèles cibles et nos longueurs de prompt RAG le débit de prompt processing et de génération des deux backends GPU de llama.cpp, pour trancher Q-008.16 sept. 2026Évaluer vLLM sur ROCm gfx1151Expérimentation · Vérifier si l'image officielle vllm/vllm-openai-rocm tourne sans patch sur la machine, si elle sert gpt-oss-120b, et si son ordonnanceur apporte un gain mesurable en TTFT et en débit agrégé face à llama-server.16 sept. 2026Mesurer la mémoire GPU allouable sur le Framework DesktopExpérimentation · Établir combien de Go de GTT le GPU gfx1151 peut utiliser de façon stable sous Linux (108 ? 120 ?) avec BIOS 3.06 et noyau 6.18.4+, et le comportement à l'échec.16 sept. 2026Stabilité sous charge continue pendant 24 heuresExpérimentation · Faire tourner llama-server 24 h avec 4 slots actifs et journaliser dmesg, températures et consommation, pour vérifier que les crashs GPU rapportés depuis mars 2026 ne se reproduisent pas avec BIOS 3.06 et noyau 6.18.4+.16 sept. 2026
Décisions
2
Utiliser Linux comme système du serveur IADécision · Le serveur Box IA tourne sous Linux ; les utilisateurs n'y touchent jamais et passent par un navigateur.16 sept. 2026Démarrer avec llama.cpp (llama-server) comme runtime d'inférenceDécision · Runtime initial du prototype : llama-server, API OpenAI-compatible, slots parallèles ; vLLM sera évalué ensuite.16 sept. 2026
Questions
3
Quel runtime d'inférence est le plus performant sur AMD Strix Halo ?Question · llama.cpp est le point de départ (ADR-004) ; vLLM et SGLang sur ROCm restent à évaluer pour le multi-utilisateur.16 sept. 2026Quelle distribution Linux pour la Box ?Question · Fedora (support Framework, noyau récent) contre Ubuntu LTS (support ROCm officiel, stabilité longue) ; Debian et Bazzite en second rang.16 sept. 2026Vulkan (RADV) ou ROCm (HIP) pour llama.cpp sur Strix Halo ?Question · Les sources se contredisent : Vulkan plus simple et parfois plus rapide en génération, ROCm meilleur en prompt processing selon certains ; à mesurer.16 sept. 2026
Sources
10
AMD — binaires llama.cpp validés pour ROCm 7.1.1 (Radeon/Ryzen)Source · Binaires llama.cpp « AMD-validated » pour gfx1150/gfx1151, ROCm 7.1.1, Ubuntu 24.04, incluant llama-server, llama-bench et llama-cli.16 sept. 2026Running LM Studio on Linux with Strix Halo (guide et dépannage)Source · Guide communautaire : sélection des runtimes Vulkan et ROCm de LM Studio sous Linux sur Strix Halo, points de blocage.16 sept. 2026strix-halo-sglang — image Docker SGLang pour gfx1151Source · Image communautaire SGLang 0.5.17 / ROCm 7.14 avec gfx1151 ajouté à la liste des cibles AOT.16 sept. 2026amd-strix-halo-vllm-toolboxes (kyuz0)Source · Image vLLM « patchée » (AITER MoE/FP8 désactivés sur gfx1x, contournements RMSNorm et CUDA Graph) ; image ROCm 10.0 sans benchmark publié ; TP=2 sur d.16 sept. 2026Lemonade Server — options du backend llama.cppSource · Canal ROCm stable (lemonade-sdk/llama.cpp) ou nightly (lemonade-sdk/llamacpp-rocm) avec builds par architecture dont gfx1151 ; commande lemonade confi.16 sept. 2026lemonade-sdk/llamacpp-rocm — builds nightly llama.cpp + ROCm 7Source · Builds nightly de llama.cpp avec ROCm 7 pour gfx1151 (Windows et Ubuntu).16 sept. 2026Ollama — support matériel GPUSource · Ollama s'appuie sur ROCm ; Vulkan en complément sous Windows et Linux ; gfx1151 (Ryzen AI Max+ 395) listé supporté sous Linux.16 sept. 2026SGLang — plateforme AMD GPUSource · Documentation AMD de SGLang : MI300X et MI250 ; images lmsysorg/sglang ROCm ; gfx1151 non mentionné.16 sept. 2026SGLang — issue #5131 support Strix/Strix Halo (gfx1150/gfx1151)Source · Demande de support gfx1151 fermée « inactive » sans réponse de mainteneur.16 sept. 2026vLLM — installation GPU AMD ROCmSource · GPU listés : MI200/MI300/MI350, RX 7900, RX 9000, Ryzen AI MAX / AI 300 (gfx1151/1150) avec ROCm 7.0.2 minimum ; images vllm/vllm-openai-rocm (latest.16 sept. 2026
Glossaire
4
HIPTerme · Interface de programmation GPU d'AMD, proche de CUDA, qui fait partie de ROCm et permet de compiler le même code pour GPU AMD et NVIDIA.16 sept. 2026Traitement du prompt (prompt processing)Terme · Phase d'inférence pendant laquelle le modèle ingère l'ensemble du prompt avant de produire le premier token, mesurée en tokens traités par seconde.16 sept. 2026ROCmTerme · Pile logicielle open source d'AMD pour le calcul sur GPU (pilotes, bibliothèques, compilateur HIP), équivalent de CUDA chez NVIDIA.16 sept. 2026vLLMTerme · Serveur d'inférence haute performance conçu pour les GPU de datacenter, avec continuous batching natif et gestion paginée du KV cache (PagedAttention).16 sept. 2026