Linux
Stabilité et problèmes connus
Inventaire sourcé des problèmes de fiabilité rapportés sur Strix Halo et Framework Desktop sous Linux (crashs GPU, VGPR, MES ring timeout, xHCI/s2idle, USB-C, BIOS, NIC Beelink) avec leur état et les contournements.
À vérifier#amd#strix-halo#framework#linux#rocm#monitoringPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026À revérifier le 15 déc. 2026
L'essentiel
- La plateforme est décrite comme « enfin stable » côté ROCm/Linux depuis janvier 2026, à condition d'un noyau 6.18.4 ou plus récent et d'un firmware 2026010+ 2.
- Subsistent : des crashs sous forte charge GPU rapportés depuis mars 2026 sans cause établie 1, un bug amdgpu de type gfx ring timeout 3, et des problèmes USB liés à la veille 4 6.
- Pour un serveur (veille désactivée, pas de périphérique USB-C), les problèmes de veille sont neutralisés ; le risque restant est le crash sous charge GPU, qui doit être testé sur 24 h.
- Aucune source ne rapporte d'erreur mémoire matérielle ; aucune ne mesure les températures. La mémoire n'a pas d'ECC annoncé chez Framework.
- Statut À vérifier : tous les éléments sont des rapports communautaires ou constructeur, non reproduits par nous.
Inventaire des problèmes
| Problème | Détails | État (09/2026) | Impact Box | Source | Type |
|---|---|---|---|---|---|
| Crashs / hard locks sous charge GPU | Framework Desktop 64/128 Go, depuis 03/2026, Windows 11 et Fedora, en jeu et au chargement de modèles IA ; BIOS 3.03/3.04/3.05 beta, Adrenalin 26.2.2/26.3.1 ; pistes : boost GPU instable, état ACPI, mémoire ; contournement cité : iGPU limitée à 24 Go en BIOS | partiellement résolu (Adrenalin 26.3.1 + BIOS 3.05 beta) ; pas de correctif officiel confirmé ; BIOS 3.06 non évalué dans le fil | majeur : le contournement 24 Go est incompatible avec l'usage LLM | 1 | communauté |
| Instabilité ROCm 6.x/7.x | comptage incorrect de VGPR → crashs | corrigé côté noyau ; stable avec firmware 2026010+, noyau 6.18.4+, Fedora 43 | résolu si noyau récent | 2 | communauté |
| gfx ring timeout sous charge GL banale | Kubuntu 26.04, noyau 7.0.0-15.15, BIOS 3.03 ; reset GPU MODE2 ; pci=ecrc=on inefficace ; piste MES (Micro Engine Scheduler) ; amdgpu.gpu_recovery=1 permet la récupération | pattern persistant, correctif upstream attendu (01/05/2026) | moyen : un reset GPU interrompt les inférences en cours ; récupération possible | 3 | communauté |
| xHCI meurt à la reprise de s2idle | Strix Halo USB 3.1 (1022:1587), Fedora 43 noyau 6.18.8 ; délai 10 ms manquant sur D3cold → D0 ; patch Mario Limonciello (AMD) | correctif proposé upstream ; contournement : unbind/bind du pilote | nul si la veille est désactivée | 4 5 | kernel / presse |
| USB-C : PD / DisplayPort Alt Mode | « intermittent compatibility issues » (problème connu BIOS 3.05) ; ports USB-A arrière inactifs après veille (utilisateurs) | ouvert | faible : serveur sans écran ni USB-C | 6 | constructeur + communauté |
| Plafond iGPU 24 Go | bug BIOS | corrigé en BIOS 3.06 (03/08/2026) | résolu ; BIOS 3.06 prérequis | 7 | constructeur |
| Boot lent GRUB / Linux | bug BIOS 3.03/3.04 | corrigé en BIOS 3.05 (02/04/2026) | résolu | 7 | constructeur |
| Hangs llama.cpp ROCm | modèles de plus de 6 Go sans -dio ; VMM | contournements : -dio, GGML_HIP_NO_VMM=ON | moyen, côté logiciel | 9 | communauté |
| Crashs / ralentissements llama.cpp | — | contournements : -fa 1, --no-mmap | faible | 10 | communauté |
| AMDVLK installé par erreur | écrase RADV | –39 % en prompt processing | faible, évitable | 11 | communauté |
| NIC Intel E610 (Beelink GTR9 Pro) | « NICs keep crashing » sous charge, suspicion matérielle | ouvert (10/2025) ; contournement adaptateur USB-C | disqualifiant pour le GTR9 Pro ; sans objet pour Framework (Realtek RTL8126) | 8 | indépendant + commentaires |
| Erreurs mémoire (pas d'ECC) | Framework : pas d'ECC annoncé ; HP annonce « LPDDR5x ECC » | aucune erreur rapportée, aucune recherchée | inconnu | 13 | — |
| Températures | non trouvé (STH : aucune mesure ; Phoronix inaccessible) | — | inconnu ; STH a tenu 1,5 jour à 140 W sans problème | 12 | indépendant |
Lecture pour un serveur
Les correctifs prérequis (BIOS 3.06, noyau 6.18.4+, firmware 2026010+) résolvent trois problèmes sur les six qui concernent un serveur. Les deux problèmes GPU restants n'ont pas de correctif confirmé : c'est l'objet de Q-012 et de l'expérimentation « Stabilité 24 h sous charge ».
Mesures de précaution retenues (hypothèses)
Ces mesures découlent des sources ; elles sont à confirmer lors de l'installation Hypothèse.
- BIOS 3.06 ou plus récent avant toute mesure.
- Noyau 6.18.4 ou plus récent, linux-firmware récent ; ne jamais descendre en dessous après une mise à jour (voir rollback dans la vue d'ensemble Linux).
- Désactiver la veille (s2idle) et l'hibernation ; machine allumée en permanence, sur onduleur.
amdgpu.gpu_recovery=1dans la ligne de commande du noyau pour récupérer d'un ring timeout sans redémarrage (à tester : le paramètre peut aussi masquer des problèmes).- Ne pas installer AMDVLK ; utiliser RADV.
- Côté llama.cpp :
-fa 1,--no-mmap,-dioselon le backend ;GGML_HIP_NO_VMM=ONà la compilation HIP. - Superviser
dmesg(motifsamdgpu,ring,timeout,reset), la température et le redémarrage automatique du service d'inférence (voir Monitoring). - Redémarrage planifié hebdomadaire hors heures ouvrées tant que la stabilité longue durée n'est pas démontrée.
Questions ouvertes
- Q-001Combien d'utilisateurs simultanés la Box peut-elle réellement servir ?HauteOuverte
- Q-011Combien de mémoire GPU peut-on réellement allouer sur 128 Go ?HauteOuverte
- Q-012La plateforme Strix Halo est-elle assez stable pour un serveur 24 h/24 ?HauteOuverte
Ce qu'il reste à tester
- Benchmark gpt-oss-120b à 1 utilisateur : Vulkan vs ROCm, contexte court et longSur le Framework Desktop, gpt-oss-120b MXFP4 atteint au moins 50 t/s en tg128 avec l'un des deux backends, et le prefill pp512 dépasse 500 t/s ; la génération baisse de moins de 20 % à 32k de profondeur.À tester
- Montée en charge de 1 à 10 utilisateurs : gpt-oss-120b et Qwen3-30B-A3BAvec llama-server -np 8 --kv-unified et KV q8_0, gpt-oss-120b sert 3 utilisateurs simultanés à plus de 25 t/s chacun avec un TTFT p95 inférieur à 3 s sur prompts courts ; à 10 utilisateurs, le débit par utilisateur reste au-dessus de 10 t/s. Le comportement suit la courbe publiée pour Qwen3.6-35B-A3B (59 → 20 t/s par utilisateur de 1 à 8 slots) décalée vers le bas.À tester
- Comparer Vulkan/RADV et ROCm/HIP dans llama.cppVulkan/RADV est plus rapide en génération (+15 à +30 %) et ROCm/HIP plus rapide en prompt processing au-delà de quelques milliers de tokens ; pour les prompts RAG de la Box (4k à 16k tokens), la différence de temps de réponse total est inférieure à 20 % et la stabilité départage les deux.À tester
- Évaluer vLLM sur ROCm gfx1151En septembre 2026, l'image officielle vllm/vllm-openai-rocm démarre sur gfx1151 avec ROCm 7.x sans patch, sert un MoE de taille moyenne, et donne un TTFT p95 inférieur à celui de llama-server à 5 clients ; mais elle ne sert pas gpt-oss-120b en MXFP4 sans conversion, et réserve plus de mémoire que llama-server pour un même contexte.À tester
- Mesurer la consommation et le bruit en inférenceAu repos le système consomme 10 à 15 W ; en inférence gpt-oss-120b mono-utilisateur 100 à 130 W ; sous 4 slots 120 à 150 W. Le bruit reste sous 42 dBA à 1 m en charge avec le ventilateur Noctua, ce qui autorise une installation dans un bureau.À tester
- Mesurer la mémoire GPU allouable sur le Framework DesktopAvec BIOS 3.06, UMA à 512 Mo, noyau 6.18.4+ et ttm.pages_limit fixé via amd-ttm, le GPU peut allouer au moins 100 Go de façon stable ; gpt-oss-120b MXFP4 se charge avec 32k tokens de contexte pour 4 slots.À tester
- Stabilité sous charge continue pendant 24 heuresAvec BIOS 3.06, noyau 6.18.4+, firmware 2026010+, veille désactivée, amdgpu.gpu_recovery=1 et 100 Go de GTT, llama-server (backend retenu) sert 4 utilisateurs simulés en continu pendant 24 h sans reset GPU, sans erreur amdgpu dans dmesg et sans redémarrage du service.À tester
Sources
- 1Framework Desktop Crashes (forum)ForumFiabilité moyenneFramework Community · publié 2026-03 et suite · consulté le 16 sept. 2026 · fiche source
- 2Linux + ROCm: January 2026 Stable Configurations Update (forum, kyuz0)ForumFiabilité moyenneFramework Community · kyuz0 · publié 2026-01-18 · consulté le 16 sept. 2026 · fiche source
- 3Strix Halo / gfx1151: gfx ring timeout under mundane GL load (forum)ForumFiabilité moyenneFramework Community · publié 2026-05-01 · consulté le 16 sept. 2026 · fiche source
- 4Kernel bugzilla 221073 — xHCI host controller dies on resume from s2idle (Strix Halo, Framework Desktop)AutreFiabilité moyenneLinux kernel bugzilla (miroir liste linux-usb) · publié 2026-02 · consulté le 16 sept. 2026 · fiche source
- 5Proposed Linux Patch For A Brief Delay To Match PCI Spec (Phoronix)Article techniqueFiabilité moyennePhoronix · Michael Larabel · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 6Framework Desktop Ryzen AI MAX 300 BIOS 3.05 Release STABLE (forum)ForumFiabilité moyenneFramework Community · publié 2026-04-02 · consulté le 16 sept. 2026 · fiche source
- 7Framework Desktop AMD Ryzen AI Max 300 — BIOS & Drivers (notes de version)Documentation officielleFiabilité hauteFramework Computer Inc. · publié 2026-08-03 (BIOS 3.06) · consulté le 16 sept. 2026 · fiche source
- 8Beelink GTR9 Pro Review: 128GB and dual 10GbE (ServeTheHome)BenchmarkFiabilité moyenneServeTheHome · publié 2025-10-11 · consulté le 16 sept. 2026 · fiche source
- 9llama.cpp discussion #20856 — Known-Good Strix Halo ROCm + llama.cpp StackGitHubFiabilité moyenneGitHub ggml-org (communauté) · realugbun · publié 2026-03-22 (màj 2026-07-23) · consulté le 16 sept. 2026 · fiche source
- 10amd-strix-halo-toolboxes (README)GitHubFiabilité moyenneGitHub (communauté) · kyuz0 · publié 2025–2026 · consulté le 16 sept. 2026 · fiche source
- 11strix-halo-guide (README + BENCHMARKS.md)GitHubFiabilité moyenneGitHub (communauté) · hogeheer499 · publié 2026-03 → 2026-08-30 · consulté le 16 sept. 2026 · fiche source
- 12Framework Desktop Review: A Solid AMD Strix Halo (ServeTheHome, p. 5)BenchmarkFiabilité hauteServeTheHome · Patrick Kennedy · publié 2025-11-26 · consulté le 16 sept. 2026 · fiche source
- 13HP Z2 Mini G1a Review: Running GPT-OSS 120B Without a Discrete GPU (StorageReview)BenchmarkFiabilité moyenneStorageReview · publié 2025/2026 · consulté le 16 sept. 2026 · fiche source