Framework Desktop (Ryzen AI Max+ 395, 128 Go)
Machine candidate de la Box IA : APU AMD Strix Halo avec 128 Go de mémoire unifiée, compacte et silencieuse, mais dont le support ROCm n'est officiel que depuis août 2026 et dont la stabilité sous forte charge GPU reste à démontrer.
Fiche technique
- CPUConstructeur
- AMD Ryzen AI Max+ 395
- Cœurs / threadsConstructeur
- 16 cœurs / 32 threads, 3,0 GHz base, 5,1 GHz boost
- GPUConstructeur
- AMD Radeon 8060S (gfx1151, Strix Halo)
- Unités de calculConstructeur
- 40 CU RDNA 3.5, jusqu'à 2,9 GHz, 32 Mo MALL
- NPUConstructeur
- XDNA 2, jusqu'à 50 TOPS (inutilisé par la pile LLM Linux)
- ArchitectureConstructeur
- Zen 5 + RDNA 3.5, mémoire unifiée, TSMC 4 nm
- MémoireConstructeur
- 128 Go
- Type mémoireConstructeur
- LPDDR5x-8000, bus 256 bits, soudée, non extensible, pas d'ECC annoncé
- Bande passanteConstructeur
- 256 Go/s
- Mémoire GPU maxCommunauté
- 120 Go
- StockageConstructeur
- 2 × M.2 2280 NVMe PCIe 4.0 x4, jusqu'à 8 To par slot
- RéseauConstructeur
- 5 GbE Realtek RTL8126 + Wi-Fi 7 AMD RZ717
- TDPConstructeur
- 55 W par défaut, cTDP 45–120 W (AMD) ; 120 W soutenu / 140 W boost (Framework)
- Conso. reposBenchmark indépendant
- 12 W
- Conso. chargeBenchmark indépendant
- 104 W
- RefroidissementConstructeur
- Ventilateur 120 mm (Noctua NF-A12x25 ou Cooler Master Mobius 120P ARGB), PSU 400 W FlexATX
- DimensionsConstructeur
- 96,8 × 205,5 × 226,1 mm, 4,5 L, 3,1 kg
- BruitBenchmark indépendant
- 36–37 dBA repos / 39–41 dBA charge (option Noctua)
- PrixConstructeur
- 3 889 € (3 449 $) — Kit DIY 128 Go, EUR TTC (FR) / USD HT (US), 16/09/2026, sans SSD ni OS
- DisponibilitéConstructeur
- Rupture de stock sur toutes les configurations (16/09/2026)
- LinuxConstructeur
- Fedora 43, Ubuntu 25.10, Bazzite officiels ; noyau 6.11 minimum (Framework), 6.18.4+ requis pour ROCm (AMD)
- ROCmDoc officielle
- gfx1151 officiel depuis ROCm 7.13 preview (05/2026) et 10.0 stable (08/2026), sur Ubuntu uniquement
Avantages
- +128 Go de mémoire unifiée : un modèle MoE de 120 Md (gpt-oss-120b MXFP4 ≈ 61 Go) tient en mémoire avec de la marge pour le KV cache
- +Prix par Go de mémoire GPU sans équivalent chez NVIDIA (≈ 30 € / Go contre plus de 130 € / Go pour une RTX PRO 6000)
- +Compact (4,5 L), silencieux (moins de 41 dBA mesurés), ≈ 100 W en charge : compatible avec un placard de cabinet d'avocats
- +Constructeur qui documente Linux (Fedora 43, Ubuntu 25.10, Bazzite) et publie ses notes BIOS
- +Support ROCm officiel de gfx1151 depuis ROCm 10.0 (août 2026) ; Vulkan/RADV fonctionne indépendamment de ROCm
Limites
- −Bande passante mémoire de 256 Go/s annoncés (≈ 212 Go/s mesurés) : un 70B dense plafonne vers 5 tokens/s
- −Mémoire soudée, sans ECC annoncé : aucune évolution possible, aucune protection contre les erreurs mémoire
- −Prix passé de 1 999 $ (2025) à 3 449 $ (09/2026) et rupture de stock au 16/09/2026
- −Instabilités rapportées sous forte charge GPU (crashs, ring timeout, VGPR) dont la cause n'est pas toujours établie
- −Support ROCm officiel limité à Ubuntu ; Fedora et Debian restent en support communautaire
- −Réseau 5 GbE Realtek (pas de 10 GbE) ; pas de redondance d'alimentation
L'essentiel
- Le Framework Desktop est un PC compact (4,5 L) bâti autour de l'APU AMD Ryzen AI Max+ 395 (Strix Halo) : 16 cœurs Zen 5, GPU Radeon 8060S de 40 CU et 128 Go de LPDDR5x soudée partagée entre CPU et GPU (mémoire unifiée) 1.
- C'est la machine candidate de la Box IA (voir ADR-002) parce qu'elle est la seule, à moins de 4 000 € TTC, à offrir plus de 100 Go de mémoire adressable par le GPU sous Linux 22.
- Sa limite structurelle est la bande passante mémoire : 256 Go/s annoncés, ≈ 212 Go/s mesurés 20. Les modèles MoE (gpt-oss-120b, Qwen3 30B-A3B) sont rapides ; les modèles denses de 70 Md tournent à ≈ 5 tokens/s.
- Le support ROCm de gfx1151 n'est officiel que depuis ROCm 7.13 preview (mai 2026) et 10.0 stable (26 août 2026), sur Ubuntu 14. Vulkan/RADV est la voie recommandée par la communauté pour la génération.
- Le prix a presque doublé en 18 mois (1 999 $ → 3 449 $) et la machine était en rupture de stock le 16 septembre 2026 2. Plusieurs problèmes de stabilité sont documentés, pas tous résolus. Statut de la fiche : À vérifier.
Pourquoi cette machine
Le cahier des charges de la Box impose un LLM de bonne qualité en français, un RAG sur les documents du cabinet et 1 à 3 utilisateurs simultanés, dans un local sans salle serveur. Trois contraintes en découlent :
- Capacité mémoire GPU. Un modèle comme gpt-oss-120b en MXFP4 occupe ≈ 61 Go ; il faut y ajouter le KV cache de plusieurs utilisateurs, un modèle d'embedding et un reranker. En dessous de 96 Go de mémoire GPU, on descend en gamme de modèle.
- Coût. Une carte NVIDIA de 96 Go (RTX PRO 6000) coûte 12 000 à 20 000 $ sur le marché en septembre 2026 ; une RTX 5090 (32 Go) plus de 4 000 $. Le Framework Desktop 128 Go est à 3 889 € TTC.
- Encombrement, bruit, consommation. Un cabinet d'avocats n'a ni baie ni climatisation. Le Framework Desktop mesure ≈ 12 W au repos et ≈ 100 W en charge sous Linux 34, pour 36 à 41 dBA 35.
Le Framework Desktop n'est pas la seule machine Strix Halo 128 Go (voir GMKtec EVO-X2, Beelink GTR9 Pro, HP Z2 Mini G1a). Il a été retenu comme candidat pour son constructeur qui documente Linux et publie ses BIOS, pour sa carte mère standard mini-ITX et pour son refroidissement 120 mm. Ces raisons sont détaillées dans l'ADR-002 ; la page Comparaisons confronte les alternatives.
Ce que disent les sources
Constructeur (Framework, AMD)
Framework publie une fiche technique complète 1, un onglet Linux qui liste les distributions supportées 7, les notes de version BIOS 8 et un billet de blog sur l'IA locale 4. Ce billet annonce 256 Go/s de bande passante sur toutes les configurations et donne des chiffres LM Studio (gpt-oss-120b ≈ 48 tokens/s sous Linux) sans détailler les conditions.
AMD documente le processeur (TDP par défaut 55 W, cTDP 45–120 W, 4 nm) 5 et précise que « jusqu'à 96 Go » peuvent être convertis en VRAM : cette limite concerne Windows (Variable Graphics Memory), pas Linux 6. Les pages amd.com n'ont pas pu être chargées directement lors de la recherche ; les valeurs proviennent d'extraits indirects Non vérifié.
Benchmarks indépendants
Les mesures indépendantes (llm-tracker, Level1Techs, visorcraft, Soothill, Phoronix, ServeTheHome) sont détaillées plus bas. Deux constats convergent : la bande passante réelle est ≈ 212 Go/s (83 % de l'annonce) 20, et le backend (ROCm ou Vulkan) change les résultats de 20 à 30 % selon la phase (prompt ou génération) 27.
Communauté
Les guides communautaires (strix-halo-guide 22, toolboxes kyuz0 24, Jeff Geerling 21) sont la seule source sur l'allocation mémoire GPU au-delà de 64 Go, sur les flags de stabilité et sur la concurrence multi-utilisateurs. Ils sont précieux mais non reproduits indépendamment, souvent sur des machines Beelink ou GMKtec plutôt que Framework.
Performances LLM publiées
Toutes les valeurs sont en tokens par seconde (t/s) ; pp = prompt processing (pp512 = prompt de 512 tokens), tg = génération (tg128 = 128 tokens). Aucune de ces valeurs n'a été mesurée par nous.
| Modèle | Quant. | Runtime / backend | pp | tg | Conditions | Source | Type |
|---|---|---|---|---|---|---|---|
| gpt-oss-120b | MXFP4 | llama.cpp Vulkan RADV b9049 (Beelink) | 727 | 55,6 | pp512 / tg128 | 22 | communauté |
| gpt-oss-120b | Q4_K_M | llama-server ROCm (GMKtec / Beelink) | — | 53,4 | non précisées | 25 | indépendant |
| gpt-oss-120b | MXFP4 | llama.cpp | 174 | 51,1 | non précisées | 25 | indépendant |
| gpt-oss-120b | 4 bits | LM Studio, Linux | — | ≈ 48 | non précisées | 4 | constructeur |
| gpt-oss-120b | — | LM Studio + ROCm | — | ≈ 30 | non précisées | 30 | indépendant |
| gpt-oss-120b | 4 bits | llama.cpp ROCm | — | ≈ 31 | ≈ 120 W | 32 | estimation |
| Qwen3 30B-A3B | UD-Q4_K_XL | llama.cpp Vulkan RADV | 755 | 85,1 | pp512 / tg128 | 28 | communauté |
| Qwen3 30B-A3B | Q4_K_M | llama.cpp ROCm | 1 142 | 86,1 | pp512 | 25 | indépendant |
| Qwen3-Coder 30B-A3B | Q4_K_S | llama.cpp Vulkan RADV b9179 | 1 387 | 98,5 | pp512 / tg128 | 22 | communauté |
| Qwen3-Coder 30B | — | llama.cpp ROCm b10085 / Vulkan b10216 | 1 345 / 1 115 | 73,7 / 97,7 | pp512 / tg128 | 27 | indépendant |
| Qwen3-235B-A22B | Q3_K_M | llama.cpp ROCm | 101 | 17,2 | pp512 / tg128 | 25 | indépendant |
| Llama 3.x 70B | Q4_K_M | Ollama Vulkan RADV (Beelink) | 22–80 | 4,7–4,9 | « bandwidth-bound » | 22 | communauté |
| Shisa V2 70B (Llama 3.3) | Q4 | llama.cpp Vulkan b5863 | 94,7 | 5,0 | pp512 / tg128 | 26 | indépendant |
| Llama 4 Scout 109B | Q4 | llama.cpp Vulkan | 102,6 | 20,2 | pp512 / tg128, mai 2025 | 20 | indépendant |
| Qwen 3.6 27B dense | Q4_K_XL | llama.cpp Vulkan | — | 11,8 | ordre de grandeur d'un 27B dense | 33 | indépendant |
| Mistral Small 3.2 24B | Q6_K | LM Studio, Linux | — | ≈ 12 | non précisées | 4 | constructeur |
Aucun chiffre n'a été trouvé pour Gemma 3 27B ; le guide strix-halo-guide le décrit comme « beaucoup plus lent que les MoE, pas un candidat vitesse » sans valeur 22.
Concurrence multi-utilisateurs
Une seule mesure de continuous batching a été trouvée : Qwen3.6-35B-A3B, llama-server Vulkan RADV b9010 22.
| Slots (-np) | t/s par utilisateur | Agrégé | TTFT |
|---|---|---|---|
| 1 | 59,2 | 59,2 | 0,117 s |
| 4 | 32,7 | 130,8 | 0,237 s |
| 8 | 20,3 | 162,0 | 0,307 s |
| 16 | 10,4 | 166,0 | 0,547 s |
L'auteur recommande 8 slots comme compromis. Aucune donnée multi-utilisateurs n'existe pour gpt-oss-120b ni pour un 70B dense : c'est la principale lacune pour dimensionner la Box (voir Q-001 et la page Multi-utilisateurs).
Mesures du laboratoire
| 16 sept. 2026 | gpt-oss-120b MXFP4 — llama.cpp ROCm 7.2.0 (fork Lychee b8182) — 51,1 t/s (Pellegrini) Framework Desktop (Ryzen AI Max+ 395, 128 Go) · llama.cpp fork Lychee-Technology b8182, ROCm 7.2.0 | 1 | 51,1 |
| 09 sept. 2026 | DeepSeek-R1-Distill-Qwen-32B Q4_K_M — llama.cpp HIP — 11,2 t/s (praveentechworld) Framework Desktop (Ryzen AI Max+ 395, 128 Go) · llama.cpp HIP, ROCm 6.3+ (build non relevé) | 1 | 11,2 |
| 09 sept. 2026 | Llama 3.3 70B Q4_K_M — llama.cpp HIP ROCm 6.3+ — 5,1 t/s, contexte 64k (praveentechworld) Framework Desktop (Ryzen AI Max+ 395, 128 Go) · llama.cpp HIP, ROCm 6.3+ (build non relevé) | 1 | 5,1 |
| 30 août 2026 | Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 1 — 59,2 t/s, TTFT 117 ms (hogeheer) Framework Desktop (Ryzen AI Max+ 395, 128 Go) · llama-server b9010 (Vulkan RADV) | 1 | 59,2 |
| 30 août 2026 | Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 16 — 10,4 t/s par utilisateur, 166 agrégés (hogeheer) Framework Desktop (Ryzen AI Max+ 395, 128 Go) · llama-server b9010 (Vulkan RADV) | 16 | 10,4 |
| 30 août 2026 | Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 4 — 32,7 t/s par utilisateur, 130,8 agrégés (hogeheer) Framework Desktop (Ryzen AI Max+ 395, 128 Go) · llama-server b9010 (Vulkan RADV) | 4 | 32,7 |
| 30 août 2026 | Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 8 — 20,3 t/s par utilisateur, 162 agrégés (hogeheer) Framework Desktop (Ryzen AI Max+ 395, 128 Go) · llama-server b9010 (Vulkan RADV) | 8 | 20,3 |
| 10 août 2026 | Qwen3.5-122B-A10B Q4_K_XL — llama.cpp b10333 ROCm 7.14 — 13,6 t/s, TTFT 1,78 s (Soothill) Framework Desktop (Ryzen AI Max+ 395, 128 Go) · llama.cpp b10333, ROCm 7.14.0 | 1 | 13,6 |
| 10 août 2026 | Qwen3.5-122B-A10B GPTQ — vLLM 0.26.0 ROCm 7.14 — 10,3 t/s, TTFT 1,06 s (Soothill) Framework Desktop (Ryzen AI Max+ 395, 128 Go) · vLLM 0.26.0, ROCm 7.14.0 | 1 | 10,3 |
| 03 août 2026 | Qwen3-Coder-30B-A3B Q4_K_S — llama.cpp ROCm — 73,7 t/s, pp 1 345 t/s (Soothill) Framework Desktop (Ryzen AI Max+ 395, 128 Go) · llama.cpp b10085 / b10216 (ROCm) | 1 | 73,7 |
| 03 août 2026 | Qwen3-Coder-30B-A3B Q4_K_S — llama.cpp Vulkan — 97,7 t/s (Soothill) Framework Desktop (Ryzen AI Max+ 395, 128 Go) · llama.cpp b10085 / b10216 (Vulkan) | 1 | 97,7 |
| 21 juil. 2026 | gpt-oss-120b — LM Studio (runtime ROCm llama.cpp) — environ 30 t/s (MindStudio) Framework Desktop (Ryzen AI Max+ 395, 128 Go) · LM Studio runtime llama.cpp ROCm (version non relevée) | 1 | 30 |
| 07 mai 2026 | gpt-oss-120b MXFP4 — llama.cpp Vulkan RADV b9049 — 55,6 t/s (hogeheer) Framework Desktop (Ryzen AI Max+ 395, 128 Go) · llama.cpp b9049 (Vulkan RADV) | 1 | 55,6 |
| 16 févr. 2026 | gpt-oss-120b Q4_K_M — llama-server ROCm — 53,4 t/s (visorcraft) Framework Desktop (Ryzen AI Max+ 395, 128 Go) · llama-server ROCm (version non relevée) | 1 | 53,4 |
| 16 févr. 2026 | Qwen3-235B-A22B Q3_K_M — llama.cpp ROCm — 17,2 t/s, pp 101 t/s (visorcraft) Framework Desktop (Ryzen AI Max+ 395, 128 Go) · llama.cpp ROCm (build non relevé) | 1 | 17,2 |
| 22 juil. 2025 | Llama 3.3 70B (Shisa V2) Q4_K_M — llama.cpp b5863 — 5,0 t/s (lhl, Framework Desktop) Framework Desktop (Ryzen AI Max+ 395, 128 Go) · llama.cpp b5863 (TheRock 7.0 nightlies) | 1 | 5 |
| 22 juil. 2025 | Qwen3-30B-A3B Q4 — llama.cpp b5863 — 72,0 t/s (lhl, Framework Desktop) Framework Desktop (Ryzen AI Max+ 395, 128 Go) · llama.cpp b5863 | 1 | 72 |
Linux et pile IA
Framework supporte officiellement Fedora 43, Ubuntu 25.10 et Bazzite, avec un noyau 6.11 minimum et 6.15 recommandé 7. Ce minimum vaut pour un usage bureautique. Pour l'IA, AMD exige un noyau 6.18.4 ou plus récent hors distributions listées 17, et la communauté situe la stabilité ROCm à partir du même seuil, avec un firmware 2026010 ou supérieur 10. Le détail est dans la section Linux et sa page ROCm.
Chronologie du support ROCm de gfx1151 :
- ROCm 6.4 à 7.2 : fonctionne (rocminfo, PyTorch) mais absent de la matrice officielle 19 ; incohérence signalée dans l'issue #5339, fermée sans réponse 18.
- ROCm 7.13.0 preview (15 mai 2026) : ajout officiel de Ryzen AI Max+ 395 15.
- ROCm 10.0.0 stable (26 août 2026) : gfx1151 dans la matrice, Ubuntu 26.04 et 24.04.4 uniquement 16.
Pour llama.cpp, les sources 2026 convergent vers Vulkan/RADV pour la génération et la simplicité, et ROCm/HIP pour les prompts longs 27. Une source conteste cette généralisation (voir ROCm). vLLM tourne sur gfx1151 via des nightlies mais n'est pas supporté upstream 38. Le NPU XDNA 2 n'est exploité par aucune des piles LLM Linux étudiées.
Mémoire GPU allouable
Par défaut, le GTT (mémoire système accessible au GPU) est limité à ≈ 50 % de la RAM, soit ≈ 64 Go 17. AMD recommande de garder la réservation VRAM BIOS à 0,5 Go et d'augmenter la limite TTM. Les plafonds observés divergent : ≈ 108 Go stables en août 2025, avec segfaults à 110 Go 21 ; 120 Go mappés dans les guides 2026 22 23. Le BIOS 3.06 (3 août 2026) corrige un plafond iGPU incorrectement fixé à 24 Go 8. La valeur gpuMemoryMaxGb: 120 du frontmatter est donc une valeur communautaire, non mesurée par nous. Procédure et paramètres : Mémoire GPU et Q-011.
Limites et risques
Bande passante
Avec ≈ 212 Go/s mesurés, la génération d'un modèle dense de 70 Md en Q4 (≈ 40 Go à lire par token) plafonne vers 5 t/s 26. Les modèles MoE à faible nombre de paramètres actifs (gpt-oss-120b : 5,1 Md actifs ; Qwen3 30B-A3B : 3 Md actifs) sont les seuls à offrir un débit confortable. Le choix du modèle principal (Q-009) est contraint par cette caractéristique.
Stabilité
Plusieurs problèmes sont documentés, détaillés dans Stabilité et Q-012 :
- crashs et hard locks sur Framework Desktop 64/128 Go depuis mars 2026, sous Windows et Fedora, en jeu et au chargement de modèles ; contournement cité (limiter l'iGPU à 24 Go) incompatible avec l'usage LLM ; pas de correctif officiel confirmé 11 ;
- instabilité ROCm 6.x/7.x due à un comptage incorrect de VGPR, corrigée côté noyau (6.18.4+) 10 ;
- gfx ring timeout sous charge GL banale sur noyau 7.0, piste MES,
amdgpu.gpu_recovery=1permet la récupération 12 ; - contrôleur xHCI qui meurt à la reprise de s2idle (patch AMD proposé) 13 ; problèmes USB-C connus en BIOS 3.05 9.
Pour un serveur, la veille sera désactivée, ce qui neutralise les deux derniers points. Le premier reste le risque majeur.
Mémoire sans ECC, non extensible
Framework n'annonce pas d'ECC (HP le fait sur le Z2 Mini G1a). Aucune source ne rapporte d'erreurs mémoire sur Framework Desktop, mais aucune ne les a cherchées. La mémoire est soudée : le choix 128 Go est définitif.
Prix et disponibilité
| Date | Prix 128 Go (USD HT) | Source |
|---|---|---|
| Lancement 2025 | 1 999 $ | 32 (estimation) |
| 23–24 mars 2026 | 2 851 $ | 36 |
| 11 août 2026 | 3 449 $ | 37 |
| 16 septembre 2026 | 3 449 $ HT / 3 889 € TTC | 2 3 |
La cause avancée par la presse est la hausse du prix de la LPDDR5X. Au 16 septembre 2026, toutes les configurations étaient en rupture de stock et les livraisons vers l'Europe retardées de 7 jours 3. Le prix du kit DIY n'inclut ni SSD ni système : compter un SSD NVMe (idéalement deux pour un miroir, voir Q-006).
Bruit et consommation
| Mesure | Valeur | Source |
|---|---|---|
| Système au repos (Linux) | 12 W moyen | 34 |
| Système en charge (Linux, benchmarks CPU) | 100–104 W moyen, pic ≈ 180 W | 34 |
| Système en charge (Windows, soutenu) | 140–170 W, stabilisé ≈ 140 W | 35 |
| Inférence gpt-oss-120b | ≈ 120 W | 32 (estimation) |
| Bruit repos / charge (Noctua) | 36–37 / 39–41 dBA | 35 |
Questions ouvertes
- Q-001Combien d'utilisateurs simultanés la Box peut-elle réellement servir ?HauteOuverte
- Q-011Combien de mémoire GPU peut-on réellement allouer sur 128 Go ?HauteOuverte
- Q-012La plateforme Strix Halo est-elle assez stable pour un serveur 24 h/24 ?HauteOuverte
À tester
- Mesurer la mémoire GPU allouable (procédure dans Mémoire GPU).
- Comparer Vulkan/RADV et ROCm/HIP sur gpt-oss-120b et Qwen3 30B-A3B avec des prompts de 512, 4 096 et 16 384 tokens.
- Faire tourner llama-server 24 h sous charge continue avec 4 slots et journaliser dmesg.
- Mesurer la consommation à la prise et le bruit à 1 m pendant une inférence de 10 minutes.
- Valider la procédure d'installation reproductible (Installation).
- Benchmark gpt-oss-120b à 1 utilisateur : Vulkan vs ROCm, contexte court et longSur le Framework Desktop, gpt-oss-120b MXFP4 atteint au moins 50 t/s en tg128 avec l'un des deux backends, et le prefill pp512 dépasse 500 t/s ; la génération baisse de moins de 20 % à 32k de profondeur.À tester
- Montée en charge de 1 à 10 utilisateurs : gpt-oss-120b et Qwen3-30B-A3BAvec llama-server -np 8 --kv-unified et KV q8_0, gpt-oss-120b sert 3 utilisateurs simultanés à plus de 25 t/s chacun avec un TTFT p95 inférieur à 3 s sur prompts courts ; à 10 utilisateurs, le débit par utilisateur reste au-dessus de 10 t/s. Le comportement suit la courbe publiée pour Qwen3.6-35B-A3B (59 → 20 t/s par utilisateur de 1 à 8 slots) décalée vers le bas.À tester
- Comparer Vulkan/RADV et ROCm/HIP dans llama.cppVulkan/RADV est plus rapide en génération (+15 à +30 %) et ROCm/HIP plus rapide en prompt processing au-delà de quelques milliers de tokens ; pour les prompts RAG de la Box (4k à 16k tokens), la différence de temps de réponse total est inférieure à 20 % et la stabilité départage les deux.À tester
- Évaluer vLLM sur ROCm gfx1151En septembre 2026, l'image officielle vllm/vllm-openai-rocm démarre sur gfx1151 avec ROCm 7.x sans patch, sert un MoE de taille moyenne, et donne un TTFT p95 inférieur à celui de llama-server à 5 clients ; mais elle ne sert pas gpt-oss-120b en MXFP4 sans conversion, et réserve plus de mémoire que llama-server pour un même contexte.À tester
- Mesurer la consommation et le bruit en inférenceAu repos le système consomme 10 à 15 W ; en inférence gpt-oss-120b mono-utilisateur 100 à 130 W ; sous 4 slots 120 à 150 W. Le bruit reste sous 42 dBA à 1 m en charge avec le ventilateur Noctua, ce qui autorise une installation dans un bureau.À tester
- Mesurer la mémoire GPU allouable sur le Framework DesktopAvec BIOS 3.06, UMA à 512 Mo, noyau 6.18.4+ et ttm.pages_limit fixé via amd-ttm, le GPU peut allouer au moins 100 Go de façon stable ; gpt-oss-120b MXFP4 se charge avec 32k tokens de contexte pour 4 slots.À tester
- Stabilité sous charge continue pendant 24 heuresAvec BIOS 3.06, noyau 6.18.4+, firmware 2026010+, veille désactivée, amdgpu.gpu_recovery=1 et 100 Go de GTT, llama-server (backend retenu) sert 4 utilisateurs simulés en continu pendant 24 h sans reset GPU, sans erreur amdgpu dans dmesg et sans redémarrage du service.À tester
Sources
- 1Framework Desktop — fiche technique (onglet Specs)Constructeur / éditeurFiabilité hauteFramework Computer Inc. · publié 2026-09-16 (consultation) · consulté le 16 sept. 2026 · fiche source
- 2Framework Desktop DIY — configurateur (boutique US, USD HT)Constructeur / éditeurFiabilité hauteFramework Computer Inc. · publié 2026-09-16 (consultation) · consulté le 16 sept. 2026 · fiche source
- 3Framework Desktop DIY — configurateur (boutique France, EUR TTC)Constructeur / éditeurFiabilité hauteFramework Computer Inc. · publié 2026-09-16 (consultation) · consulté le 16 sept. 2026 · fiche source
- 4Using a Framework Desktop for local AI (blog Framework)Constructeur / éditeurFiabilité moyenneFramework Computer Inc. · Nirav Patel · publié 2025-07-07 (màj 2025-12-02) · consulté le 16 sept. 2026 · fiche source
- 5AMD Ryzen AI Max+ 395 — page produitConstructeur / éditeurFiabilité hauteAMD · publié s.d. · consulté le 16 sept. 2026 · fiche source
- 6AMD Ryzen AI MAX+ 395 Processor: Breakthrough AI Performance (blog AMD)Constructeur / éditeurFiabilité moyenneAMD · publié 2025 · consulté le 16 sept. 2026 · fiche source
- 7Framework Desktop — onglet Linux (distributions supportées)Constructeur / éditeurFiabilité hauteFramework Computer Inc. · publié 2026-09-16 (consultation) · consulté le 16 sept. 2026 · fiche source
- 8Framework Desktop AMD Ryzen AI Max 300 — BIOS & Drivers (notes de version)Documentation officielleFiabilité hauteFramework Computer Inc. · publié 2026-08-03 (BIOS 3.06) · consulté le 16 sept. 2026 · fiche source
- 9Framework Desktop Ryzen AI MAX 300 BIOS 3.05 Release STABLE (forum)ForumFiabilité moyenneFramework Community · publié 2026-04-02 · consulté le 16 sept. 2026 · fiche source
- 10Linux + ROCm: January 2026 Stable Configurations Update (forum, kyuz0)ForumFiabilité moyenneFramework Community · kyuz0 · publié 2026-01-18 · consulté le 16 sept. 2026 · fiche source
- 11Framework Desktop Crashes (forum)ForumFiabilité moyenneFramework Community · publié 2026-03 et suite · consulté le 16 sept. 2026 · fiche source
- 12Strix Halo / gfx1151: gfx ring timeout under mundane GL load (forum)ForumFiabilité moyenneFramework Community · publié 2026-05-01 · consulté le 16 sept. 2026 · fiche source
- 13Kernel bugzilla 221073 — xHCI host controller dies on resume from s2idle (Strix Halo, Framework Desktop)AutreFiabilité moyenneLinux kernel bugzilla (miroir liste linux-usb) · publié 2026-02 · consulté le 16 sept. 2026 · fiche source
- 14ROCm 10.0.0 — compatibility matrixDocumentation officielleFiabilité hauteAMD · publié 2026-08-19 · consulté le 16 sept. 2026 · fiche source
- 15ROCm Core SDK 7.13.0 release notes (technology preview)Documentation officielleFiabilité hauteAMD · publié 2026-05-15 · consulté le 16 sept. 2026 · fiche source
- 16ROCm 10.0.0 release notesDocumentation officielleFiabilité hauteAMD · publié 2026-08-26 · consulté le 16 sept. 2026 · fiche source
- 17AMD Strix Halo / RDNA3.5 system optimization (ROCm 10.0)Documentation officielleFiabilité hauteAMD · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 18ROCm/ROCm issue #5339 — Confusing rocm support for gfx1151GitHubFiabilité moyenneGitHub ROCm (tracker officiel) · publié 2025-09-16 · consulté le 16 sept. 2026 · fiche source
- 19Upgrading ROCm 7.0 to 7.2 on AMD Strix Halo (gfx1151)BlogFiabilité moyenneTinyComputers.io · publié 2026-02 · consulté le 16 sept. 2026 · fiche source
- 20AMD Strix Halo (Ryzen AI Max+ 395) GPU Performance (llm-tracker)BenchmarkFiabilité hautellm-tracker.info · lhl · publié 2025-05-17 · consulté le 16 sept. 2026 · fiche source
- 21Increasing the VRAM allocation on AMD AI APUs under Linux (Jeff Geerling)BlogFiabilité moyennejeffgeerling.com · Jeff Geerling · publié 2025-08-08 · consulté le 16 sept. 2026 · fiche source
- 22strix-halo-guide (README + BENCHMARKS.md)GitHubFiabilité moyenneGitHub (communauté) · hogeheer499 · publié 2026-03 → 2026-08-30 · consulté le 16 sept. 2026 · fiche source
- 23Pushing AMD Strix Halo to 120GB Unified VRAM under Linux (Zypher Systems)BlogFiabilité faibleZypher Systems · publié s.d. · consulté le 16 sept. 2026 · fiche source
- 24amd-strix-halo-toolboxes (README)GitHubFiabilité moyenneGitHub (communauté) · kyuz0 · publié 2025–2026 · consulté le 16 sept. 2026 · fiche source
- 25strix-halo-llm-perf (visorcraft)BenchmarkFiabilité moyenneGitHub (communauté) · visorcraft · publié 2026-02-16 (màj) · consulté le 16 sept. 2026 · fiche source
- 26Strix Halo (Ryzen AI Max+ 395) LLM Benchmark Results (Level1Techs, lhl)BenchmarkFiabilité moyenneLevel1Techs Forums · lhl · publié 2025-07-22 (màj 2025-08-31) · consulté le 16 sept. 2026 · fiche source
- 27llama.cpp: Vulkan vs ROCm on Strix Halo (Soothill)BenchmarkFiabilité moyennesoothill.io · Darren Soothill · publié 2026-08-03 · consulté le 16 sept. 2026 · fiche source
- 28Strix Halo Wiki — llama.cpp Performance (kyuz0)BlogFiabilité moyennestrixhalo.wiki · kyuz0 · publié 2025–2026 · consulté le 16 sept. 2026 · fiche source
- 29llama.cpp discussion #20856 — Known-Good Strix Halo ROCm + llama.cpp StackGitHubFiabilité moyenneGitHub ggml-org (communauté) · realugbun · publié 2026-03-22 (màj 2026-07-23) · consulté le 16 sept. 2026 · fiche source
- 30Local LLM Speed Test: GPT-OSS, Qwen3.6 and Hermes on 128GB Unified Memory (MindStudio)BenchmarkFiabilité moyenneMindStudio · publié 2026-07-21 · consulté le 16 sept. 2026 · fiche source
- 31AMD Ryzen AI Max+ 395 (Strix Halo) for Local LLMs in 2026 (runaihome)BlogFiabilité faiblerunaihome · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 32Strix Halo Tokens Per Second 2026 (DataHardware)Article techniqueFiabilité faibleDataHardware · publié 2026-07-05 (màj 2026-09-13) · consulté le 16 sept. 2026 · fiche source
- 33The 2026 Strix Halo Ultimate Benchmark Suite (dev.to)BenchmarkFiabilité moyennedev.to · Agustin Sacco · publié 2026-05-31 · consulté le 16 sept. 2026 · fiche source
- 34A Deep Dive Into The Power & Thermals For The Framework Desktop (Phoronix)BenchmarkFiabilité hautePhoronix · Michael Larabel · publié 2025-08-18 · consulté le 16 sept. 2026 · fiche source
- 35Framework Desktop Review: A Solid AMD Strix Halo (ServeTheHome, p. 5)BenchmarkFiabilité hauteServeTheHome · Patrick Kennedy · publié 2025-11-26 · consulté le 16 sept. 2026 · fiche source
- 36More Ryzen AI Max+ 395 mini PCs with 128GB are now available (Liliputing)Article techniqueFiabilité moyenneLiliputing · Brad Linder · publié 2026-03-23 · consulté le 16 sept. 2026 · fiche source
- 37Ryzen AI Max+ 395 Mini PCs Compared: Real Prices (ComputingForGeeks)Article techniqueFiabilité faibleComputingForGeeks · publié 2026-08-11 · consulté le 16 sept. 2026 · fiche source
- 38Running vLLM on Strix Halo (epheo)BlogFiabilité faibleblog.epheo.eu · epheo · publié 2026-02-15 · consulté le 16 sept. 2026 · fiche source