Aller au contenu
Source

llama.cpp discussion #20856 — Known-Good Strix Halo ROCm + llama.cpp Stack

ConfirméePublié le 16 sept. 2026Mis à jour le 16 sept. 2026
Organisation
GitHub ggml-org (communauté)
Auteur
realugbun
Type
GitHub
Fiabilité
Fiabilité moyenne
Publié
2026-03-22 (màj 2026-07-23)
Consulté le
16 septembre 2026
Sujets
llama-cpp, rocm, vulkan, strix-halo

Citée par 9 page(s)

llama.cpp et llama-serverInférence · Le moteur de départ de la Box : slots, contexte partagé, KV cache quantifié, flash attention, métriques Prometheus, images Docker ROCm/Vulkan et flags connus pour gfx1151.Installation reproductibleLinux · Canevas d'installation du serveur Linux de la Box, du BIOS aux conteneurs, présenté étape par étape avec, pour chacune, l'indication de ce qui est sourcé et de ce qui reste à valider sur la machine.ROCm et Vulkan sur gfx1151Linux · État du support ROCm pour le GPU Strix Halo (gfx1151), officiel depuis ROCm 7.13 preview et 10.0 stable, et comparaison Vulkan/RADV contre ROCm/HIP pour llama.cpp, avec des sources contradictoires.Stabilité et problèmes connusLinux · Inventaire sourcé des problèmes de fiabilité rapportés sur Strix Halo et Framework Desktop sous Linux (crashs GPU, VGPR, MES ring timeout, xHCI/s2idle, USB-C, BIOS, NIC Beelink) avec leur état et les contournements.Multi-utilisateurs : servir 5 à 10 personnes sur une seule machineMulti-utilisateurs · Pourquoi une machine à 256 Go/s est bornée en génération, ce que le batching et les MoE y changent, ce que les mesures publiées disent, et ce qu'il reste à mesurer avant de promettre un nombre d'utilisateurs.Framework Desktop (Ryzen AI Max+ 395, 128 Go)Matériel · Machine candidate de la Box IA : APU AMD Strix Halo avec 128 Go de mémoire unifiée, compacte et silencieuse, mais dont le support ROCm n'est officiel que depuis août 2026 et dont la stabilité sous forte charge GPU reste à démontrer.gpt-oss-120bModèle · MoE OpenAI de 117 Md (5,1 Md actifs) sous Apache 2.0 : le candidat principal de la Box, mesuré entre 30 et 56 t/s sur Strix Halo selon le runtime.Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 16 — 10,4 t/s par utilisateur, 166 agrégés (hogeheer)Benchmark · À 16 slots, l'agrégé plafonne (166 t/s, +2,5 % par rapport à 8 slots) et chaque utilisateur tombe à 10,4 t/s avec 547 ms de TTFT.Comparer Vulkan/RADV et ROCm/HIP dans llama.cppExpérimentation · Mesurer sur nos modèles cibles et nos longueurs de prompt RAG le débit de prompt processing et de génération des deux backends GPU de llama.cpp, pour trancher Q-008.

Ce que dit la source

Pile ROCm « connue bonne » : ROCm 7.2.0 + noyau 6.19.2, flags de compilation GPU_TARGETS=gfx1151, GGML_HIP_NO_VMM=ON (« fixes stability issues »), GGML_HIP_ROCWMMA_FATTN=ON ; option -dio requise pour les modèles de plus de 6 Go (« prevents hangs »). Qwen3.5-35B Q4_K_M ≈ 45 t/s mono / ≈ 168 t/s agrégé à 16 slots (mars). En juillet 2026, l'auteur passe à Vulkan/RADV : ≈ 59 → ≈ 80 t/s (+28 %) ; glslc 2026.3+ requis.

Ce qu'on en retient

Un utilisateur ROCm expérimenté a migré vers Vulkan pour la génération ; flags ROCm de stabilité documentés.

Limites

Une machine, un utilisateur ; chiffre multi-slots « jamais re-vérifié ».

content/sources/llama-cpp-discussion-20856-strix-halo.md112 mots