Tag
#vulkan
25 entrée(s) portent ce tag.
Pages
6
Comparaisons matériellesComparaisons · Lecture guidée du tableau comparatif des machines : bande passante, mémoire adressable, prix par Go de mémoire GPU, consommation, écosystème logiciel, bruit et disponibilité, avec l'origine de chaque donnée et une conclusion prudente sur le choix du Framework Desktop.16 sept. 2026Inférence : panorama des moteursInférence · Comparaison des moteurs de serving (llama-server, Ollama, LM Studio, vLLM, SGLang, Lemonade) pour un Strix Halo sous Linux, et recommandation initiale prudente : llama-server d'abord, vLLM à évaluer.16 sept. 2026llama.cpp et llama-serverInférence · Le moteur de départ de la Box : slots, contexte partagé, KV cache quantifié, flash attention, métriques Prometheus, images Docker ROCm/Vulkan et flags connus pour gfx1151.16 sept. 2026Ollama, LM Studio, Lemonade : les moteurs « faciles »Inférence · Trois surcouches de llama.cpp orientées simplicité : variables de parallélisme d'Ollama, requêtes concurrentes de LM Studio, Lemonade porté par AMD ; limites pour un serveur multi-utilisateurs.16 sept. 2026Installation reproductibleLinux · Canevas d'installation du serveur Linux de la Box, du BIOS aux conteneurs, présenté étape par étape avec, pour chacune, l'indication de ce qui est sourcé et de ce qui reste à valider sur la machine.16 sept. 2026ROCm et Vulkan sur gfx1151Linux · État du support ROCm pour le GPU Strix Halo (gfx1151), officiel depuis ROCm 7.13 preview et 10.0 stable, et comparaison Vulkan/RADV contre ROCm/HIP pour llama.cpp, avec des sources contradictoires.16 sept. 2026
Benchmarks
6
gpt-oss-120b MXFP4 — llama.cpp Vulkan RADV b9049 — 55,6 t/s (hogeheer)Benchmark · Meilleure mesure publiée de gpt-oss-120b sur Strix Halo : 55,57 t/s en génération et 727 t/s en prompt processing, Vulkan RADV, Beelink GTR9 Pro.16 sept. 2026Qwen3-Coder-30B-A3B Q4_K_S — llama.cpp Vulkan — 97,7 t/s (Soothill)Benchmark · Comparatif Vulkan vs ROCm de Soothill : côté Vulkan, 97,7 t/s en génération et 1 115 t/s en prompt sur Qwen3-Coder-30B-A3B Q4_K_S.16 sept. 2026Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 1 — 59,2 t/s, TTFT 117 ms (hogeheer)Benchmark · Point de référence à 1 slot de la seule courbe de montée en charge publiée sur Strix Halo : 59,2 t/s et 117 ms de TTFT.16 sept. 2026Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 16 — 10,4 t/s par utilisateur, 166 agrégés (hogeheer)Benchmark · À 16 slots, l'agrégé plafonne (166 t/s, +2,5 % par rapport à 8 slots) et chaque utilisateur tombe à 10,4 t/s avec 547 ms de TTFT.16 sept. 2026Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 4 — 32,7 t/s par utilisateur, 130,8 agrégés (hogeheer)Benchmark · À 4 slots, chaque utilisateur reçoit 32,7 t/s (130,8 t/s agrégés, 2,2 fois le mono) avec un TTFT de 237 ms.16 sept. 2026Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 8 — 20,3 t/s par utilisateur, 162 agrégés (hogeheer)Benchmark · À 8 slots, 20,3 t/s par utilisateur et 162 t/s agrégés (2,7 fois le mono), TTFT 307 ms : le point d'équilibre retenu par l'auteur.16 sept. 2026
Expérimentations
4
Benchmark gpt-oss-120b à 1 utilisateur : Vulkan vs ROCm, contexte court et longExpérimentation · Reproduire sur le Framework Desktop les 51 à 56 t/s publiés pour gpt-oss-120b, comparer les deux backends et mesurer la dégradation à 4k et 32k de profondeur.16 sept. 2026Comparer Vulkan/RADV et ROCm/HIP dans llama.cppExpérimentation · Mesurer sur nos modèles cibles et nos longueurs de prompt RAG le débit de prompt processing et de génération des deux backends GPU de llama.cpp, pour trancher Q-008.16 sept. 2026Mesurer la mémoire GPU allouable sur le Framework DesktopExpérimentation · Établir combien de Go de GTT le GPU gfx1151 peut utiliser de façon stable sous Linux (108 ? 120 ?) avec BIOS 3.06 et noyau 6.18.4+, et le comportement à l'échec.16 sept. 2026Stabilité sous charge continue pendant 24 heuresExpérimentation · Faire tourner llama-server 24 h avec 4 slots actifs et journaliser dmesg, températures et consommation, pour vérifier que les crashs GPU rapportés depuis mars 2026 ne se reproduisent pas avec BIOS 3.06 et noyau 6.18.4+.16 sept. 2026
Sources
3
Running LM Studio on Linux with Strix Halo (guide et dépannage)Source · Guide communautaire : sélection des runtimes Vulkan et ROCm de LM Studio sous Linux sur Strix Halo, points de blocage.16 sept. 2026Ollama — support matériel GPUSource · Ollama s'appuie sur ROCm ; Vulkan en complément sous Windows et Linux ; gfx1151 (Ryzen AI Max+ 395) listé supporté sous Linux.16 sept. 2026Phoronix — Ollama rolls out experimental Vulkan supportSource · Ollama 0.12.6 introduit un backend Vulkan expérimental.16 sept. 2026
Glossaire
3
Traitement du prompt (prompt processing)Terme · Phase d'inférence pendant laquelle le modèle ingère l'ensemble du prompt avant de produire le premier token, mesurée en tokens traités par seconde.16 sept. 2026RADVTerme · Pilote Vulkan open source pour GPU AMD inclus dans Mesa, livré par défaut avec les distributions Linux.16 sept. 2026VulkanTerme · API graphique et de calcul multiplateforme, ouverte, utilisée par llama.cpp comme backend GPU indépendant du fabricant, disponible sur AMD via les pilotes Mesa.16 sept. 2026