ROCm et Vulkan sur gfx1151
État du support ROCm pour le GPU Strix Halo (gfx1151), officiel depuis ROCm 7.13 preview et 10.0 stable, et comparaison Vulkan/RADV contre ROCm/HIP pour llama.cpp, avec des sources contradictoires.
L'essentiel
- Le GPU du Framework Desktop est identifié gfx1151 (Strix Halo, RDNA 3.5) dans la matrice ROCm 1.
- Support officiel : ROCm 7.13.0 preview (15 mai 2026) 2, puis ROCm 10.0.0 stable (26 août 2026) 3. Avant : « fonctionne mais non listé ».
- Le support officiel ne couvre qu'Ubuntu (26.04 noyau 7.0, 24.04.4 noyau OEM 6.17) ; hors de ces distributions, AMD exige un noyau 6.18.4 ou plus récent 4.
- Pour llama.cpp, les sources 2026 convergent vers Vulkan/RADV pour la génération et HIP pour les prompts longs ; une source conteste cette généralisation. Rien n'est tranché (Q-008).
- AMD a abandonné AMDVLK le 15 septembre 2025 au profit de RADV 12 ; ne pas l'installer.
Chronologie du support gfx1151
| Période | Version ROCm | Statut | Source | Type |
|---|---|---|---|---|
| 2025 – février 2026 | 6.4.x, 7.0, 7.1, 7.2 | gfx1151 absent de la matrice, mais rocminfo détecte le GPU et PyTorch fonctionne ; cible gfx11-generic utile | 7 | communauté |
| 16 septembre 2025 | — | Issue #5339 signale l'incohérence entre l'annonce ROCm 7 (« supports… Ryzen AI MAX ») et la matrice ; fermée sans réponse AMD visible | 6 | tracker officiel |
| 18 janvier 2026 | 6.x / 7.x | Crashs attribués à un comptage incorrect de VGPR, corrigés côté noyau ; stable avec firmware 2026010+ et noyau 6.18.4+ sur Fedora 43 | 8 | communauté |
| 15 mai 2026 | 7.13.0 preview | Ajout officiel de Ryzen AI Max+ 395 (Radeon 8060S), Max+ PRO 395, 392, PRO 390/385 ; OS : Ubuntu 26.04, Ubuntu 24.04.4, Windows 11 25H2 | 2 | doc officielle |
| 19–26 août 2026 | 10.0.0 stable | Matrice datée du 19 août : gfx1151 listé ; « inbox kernel driver » sur les Ubuntu supportés ; Adrenalin 26.8.1 côté Windows | 1 3 | doc officielle |
| ROCm 10.0 (doc Strix Halo) | 7.11.0 / 7.12.0, 7.2.1–7.2.3 | Mentionnés comme stables avec les noyaux recommandés (6.18.4+) | 4 | doc officielle |
Noyau et distributions
Distributions et statut ROCm :
| Distribution | Framework | Matrice ROCm 10.0 | Doc Strix Halo AMD | Commentaire |
|---|---|---|---|---|
| Ubuntu 26.04 (noyau 7.0) | non listée (25.10 listée) | officielle | stable | seule voie « tout officiel » |
| Ubuntu 24.04.4 (OEM 6.17) | non listée | officielle | via HWE/OEM | LTS, noyau ancien hors OEM |
| Ubuntu 25.10 | officielle | non | — | ni LTS ni ROCm officiel |
| Fedora 43 | officielle | non | listée stable | choix de la communauté kyuz0 ; ROCm empaqueté par Fedora, non par AMD |
| Bazzite | officielle | non | — | orientée jeu, image immuable |
| Arch Linux | « Some Risk » | non | listée stable | rolling, noyau récent |
| Debian | non | non | non | noyau stable trop ancien sans backports |
Le choix est instruit dans Q-007 et sur la vue d'ensemble Linux.
Vulkan/RADV ou ROCm/HIP pour llama.cpp
Deux backends GPU sont utilisables par llama.cpp sur Strix Halo : HIP (ROCm, cible gfx1151) et Vulkan via le pilote Mesa RADV. Les mesures publiées :
| Source (type, date) | Modèle | ROCm/HIP pp / tg | Vulkan pp / tg | Conclusion de l'auteur |
|---|---|---|---|---|
| llm-tracker 16 (indépendant, 05/2025) | Llama-2-7B Q4_0 | 343,9 / 50,9 (WMMA+FA) | 884,2 / 52,7 (FA) | HIP « bien inférieur aux attentes » en pp ; HIP+rocWMMA meilleur à 8K de contexte |
| strixhalo.wiki 13 (communauté) | Qwen3 30B-A3B UD-Q4_K_XL | 650,6 / 64,2 (rocWMMA) ; 659,1 / 67,7 (tuned) | RADV 755,1 / 85,1 ; AMDVLK 741,6 / 81,8 | tester soi-même, pilotes en évolution |
| visorcraft 15 (indépendant, 03/2026) | Q6_K_XL, 7 backends | meilleur pp (≈ 502) | AMDVLK tg 38,65 (+16 %), pire pp (358) | Vulkan interactif, ROCm batch/prefill |
| strix-halo-guide 17 (communauté, 2026) | Qwen MoE | HIP b8460 pp 1 047 | RADV pp 1 080 | RADV recommandé ; ROCm « peut gagner sur pp16384+ » ; « Do not install AMDVLK » (–39 % pp) |
| llama.cpp #20856 10 (communauté, 07/2026) | Qwen3.5-35B Q4_K_M | ≈ 59 t/s | ≈ 80 t/s (+28 %) | migration ROCm → Vulkan/RADV ; glslc 2026.3+ requis |
| Soothill 14 (indépendant, 08/2026) | Qwen3-Coder-30B (17,5 Go) | 1 344,7 / 73,7 (b10085) | 1 115,3 / 97,7 (b10216) | « two-phase, model-specific decision » |
| kyuz0 toolboxes 18 (communauté) | — | ROCm 10.0 « stable, officiel » | « most stable and compatible. Recommended for most users » | — |
Ce que cela implique pour la Box
- Le RAG envoie au modèle des prompts de plusieurs milliers de tokens (contexte documentaire) : la phase de prompt processing pèse sur le TTFT. ROCm pourrait y être avantageux.
- La génération pèse sur la fluidité perçue : Vulkan y est plus rapide selon la majorité des sources.
- La stabilité est le premier critère pour un serveur : Vulkan/RADV est décrit comme « le plus stable » ; ROCm exige des flags spécifiques (ci-dessous).
- Décision provisoire du dossier (ADR-004) : llama.cpp comme runtime ; le backend reste ouvert (Q-008) jusqu'à mesure.
Flags et réglages cités par les sources
Ces flags proviennent des sources ; ils n'ont pas été vérifiés par nous Communauté.
| Réglage | Contexte | Effet rapporté | Source |
|---|---|---|---|
GPU_TARGETS=gfx1151 | compilation llama.cpp HIP | cible correcte | 10 |
GGML_HIP_NO_VMM=ON | compilation HIP | « fixes stability issues » | 10 |
GGML_HIP_ROCWMMA_FATTN=ON | compilation HIP | flash attention via rocWMMA | 10 |
-dio (direct I/O) | exécution, modèles de plus de 6 Go | « prevents hangs » | 10 |
-fa 1 et --no-mmap | exécution | évite crashs et ralentissements | 18 |
| glslc 2026.3+ | compilation Vulkan | requis pour les shaders récents | 10 |
| Ne pas installer AMDVLK | système | écrase RADV, –39 % pp | 17 |
Installation de ROCm : grandes lignes
Aucune commande d'installation n'a été relevée textuellement dans les sources consultées ; cette section décrit la démarche, pas une procédure. Les commandes seront ajoutées après lecture de la documentation d'installation ROCm 10.0 et validation sur la machine (Installation).
- Choisir la voie : Ubuntu 26.04 ou 24.04.4 avec les dépôts AMD (voie officielle, pilote noyau inbox 1), ou Fedora 43 avec les paquets ROCm de la distribution (voie communautaire 8).
- Vérifier le noyau : 6.18.4 ou plus récent, firmware linux-firmware récent (2026010+).
- Régler le BIOS et la mémoire GPU : voir Mémoire GPU.
- Installer ROCm 10.0 (dépôts AMD) ou les paquets distribution ; vérifier avec
rocminfoque le GPU apparaît comme gfx1151. - Compiler ou récupérer llama.cpp avec le backend HIP (flags ci-dessus) et le backend Vulkan (Mesa RADV, glslc récent) pour pouvoir comparer.
- Alternative sans installation : les conteneurs kyuz0 18 fournissent des builds Vulkan et ROCm prêts à l'emploi.
Autres runtimes : vLLM fonctionne via les nightlies TheRock et HIP_FORCE_DEV_KERNARG=1, mais gfx1151 n'est pas dans la liste upstream et amdsmi ne reconnaît pas la puce 11 ; à considérer comme expérimental. Ollama est déconseillé par plusieurs guides au profit de llama.cpp direct 17.
Questions ouvertes
- Q-002Quel runtime d'inférence est le plus performant sur AMD Strix Halo ?HauteEn cours
- Q-007Quelle distribution Linux pour la Box ?MoyenneOuverte
- Q-008Vulkan (RADV) ou ROCm (HIP) pour llama.cpp sur Strix Halo ?HauteOuverte
Ce qu'il reste à tester
- Benchmark gpt-oss-120b à 1 utilisateur : Vulkan vs ROCm, contexte court et longSur le Framework Desktop, gpt-oss-120b MXFP4 atteint au moins 50 t/s en tg128 avec l'un des deux backends, et le prefill pp512 dépasse 500 t/s ; la génération baisse de moins de 20 % à 32k de profondeur.À tester
- Comparer Vulkan/RADV et ROCm/HIP dans llama.cppVulkan/RADV est plus rapide en génération (+15 à +30 %) et ROCm/HIP plus rapide en prompt processing au-delà de quelques milliers de tokens ; pour les prompts RAG de la Box (4k à 16k tokens), la différence de temps de réponse total est inférieure à 20 % et la stabilité départage les deux.À tester
- Évaluer vLLM sur ROCm gfx1151En septembre 2026, l'image officielle vllm/vllm-openai-rocm démarre sur gfx1151 avec ROCm 7.x sans patch, sert un MoE de taille moyenne, et donne un TTFT p95 inférieur à celui de llama-server à 5 clients ; mais elle ne sert pas gpt-oss-120b en MXFP4 sans conversion, et réserve plus de mémoire que llama-server pour un même contexte.À tester
- Mesurer la mémoire GPU allouable sur le Framework DesktopAvec BIOS 3.06, UMA à 512 Mo, noyau 6.18.4+ et ttm.pages_limit fixé via amd-ttm, le GPU peut allouer au moins 100 Go de façon stable ; gpt-oss-120b MXFP4 se charge avec 32k tokens de contexte pour 4 slots.À tester
- Stabilité sous charge continue pendant 24 heuresAvec BIOS 3.06, noyau 6.18.4+, firmware 2026010+, veille désactivée, amdgpu.gpu_recovery=1 et 100 Go de GTT, llama-server (backend retenu) sert 4 utilisateurs simulés en continu pendant 24 h sans reset GPU, sans erreur amdgpu dans dmesg et sans redémarrage du service.À tester
- Benchmark gpt-oss-120b à 1 utilisateur : Vulkan vs ROCm, contexte court et longSur le Framework Desktop, gpt-oss-120b MXFP4 atteint au moins 50 t/s en tg128 avec l'un des deux backends, et le prefill pp512 dépasse 500 t/s ; la génération baisse de moins de 20 % à 32k de profondeur.À tester
- Comparer Vulkan/RADV et ROCm/HIP dans llama.cppVulkan/RADV est plus rapide en génération (+15 à +30 %) et ROCm/HIP plus rapide en prompt processing au-delà de quelques milliers de tokens ; pour les prompts RAG de la Box (4k à 16k tokens), la différence de temps de réponse total est inférieure à 20 % et la stabilité départage les deux.À tester
- Mesurer la mémoire GPU allouable sur le Framework DesktopAvec BIOS 3.06, UMA à 512 Mo, noyau 6.18.4+ et ttm.pages_limit fixé via amd-ttm, le GPU peut allouer au moins 100 Go de façon stable ; gpt-oss-120b MXFP4 se charge avec 32k tokens de contexte pour 4 slots.À tester
- Stabilité sous charge continue pendant 24 heuresAvec BIOS 3.06, noyau 6.18.4+, firmware 2026010+, veille désactivée, amdgpu.gpu_recovery=1 et 100 Go de GTT, llama-server (backend retenu) sert 4 utilisateurs simulés en continu pendant 24 h sans reset GPU, sans erreur amdgpu dans dmesg et sans redémarrage du service.À tester
Sources
- 1ROCm 10.0.0 — compatibility matrixDocumentation officielleFiabilité hauteAMD · publié 2026-08-19 · consulté le 16 sept. 2026 · fiche source
- 2ROCm Core SDK 7.13.0 release notes (technology preview)Documentation officielleFiabilité hauteAMD · publié 2026-05-15 · consulté le 16 sept. 2026 · fiche source
- 3ROCm 10.0.0 release notesDocumentation officielleFiabilité hauteAMD · publié 2026-08-26 · consulté le 16 sept. 2026 · fiche source
- 4AMD Strix Halo / RDNA3.5 system optimization (ROCm 10.0)Documentation officielleFiabilité hauteAMD · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 5AMD Strix Halo system optimization (ROCm 7.2.0)Documentation officielleFiabilité hauteAMD · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 6ROCm/ROCm issue #5339 — Confusing rocm support for gfx1151GitHubFiabilité moyenneGitHub ROCm (tracker officiel) · publié 2025-09-16 · consulté le 16 sept. 2026 · fiche source
- 7Upgrading ROCm 7.0 to 7.2 on AMD Strix Halo (gfx1151)BlogFiabilité moyenneTinyComputers.io · publié 2026-02 · consulté le 16 sept. 2026 · fiche source
- 8Linux + ROCm: January 2026 Stable Configurations Update (forum, kyuz0)ForumFiabilité moyenneFramework Community · kyuz0 · publié 2026-01-18 · consulté le 16 sept. 2026 · fiche source
- 9Framework Desktop — onglet Linux (distributions supportées)Constructeur / éditeurFiabilité hauteFramework Computer Inc. · publié 2026-09-16 (consultation) · consulté le 16 sept. 2026 · fiche source
- 10llama.cpp discussion #20856 — Known-Good Strix Halo ROCm + llama.cpp StackGitHubFiabilité moyenneGitHub ggml-org (communauté) · realugbun · publié 2026-03-22 (màj 2026-07-23) · consulté le 16 sept. 2026 · fiche source
- 11Running vLLM on Strix Halo (epheo)BlogFiabilité faibleblog.epheo.eu · epheo · publié 2026-02-15 · consulté le 16 sept. 2026 · fiche source
- 12AMD Officially Confirms The End Of The AMDVLK Driver (Phoronix)Article techniqueFiabilité hautePhoronix · Michael Larabel · publié 2025-09-15 · consulté le 16 sept. 2026 · fiche source
- 13Strix Halo Wiki — llama.cpp Performance (kyuz0)BlogFiabilité moyennestrixhalo.wiki · kyuz0 · publié 2025–2026 · consulté le 16 sept. 2026 · fiche source
- 14llama.cpp: Vulkan vs ROCm on Strix Halo (Soothill)BenchmarkFiabilité moyennesoothill.io · Darren Soothill · publié 2026-08-03 · consulté le 16 sept. 2026 · fiche source
- 15strix-halo-llm-perf (visorcraft)BenchmarkFiabilité moyenneGitHub (communauté) · visorcraft · publié 2026-02-16 (màj) · consulté le 16 sept. 2026 · fiche source
- 16AMD Strix Halo (Ryzen AI Max+ 395) GPU Performance (llm-tracker)BenchmarkFiabilité hautellm-tracker.info · lhl · publié 2025-05-17 · consulté le 16 sept. 2026 · fiche source
- 17strix-halo-guide (README + BENCHMARKS.md)GitHubFiabilité moyenneGitHub (communauté) · hogeheer499 · publié 2026-03 → 2026-08-30 · consulté le 16 sept. 2026 · fiche source
- 18amd-strix-halo-toolboxes (README)GitHubFiabilité moyenneGitHub (communauté) · kyuz0 · publié 2025–2026 · consulté le 16 sept. 2026 · fiche source
- 19I tuned llama.cpp on a Strix Halo mini-PC — why « Vulkan beats ROCm » is a myth (Medium)BlogFiabilité faibleMedium · Bkpaine · publié 2026-07 · consulté le 16 sept. 2026 · fiche source