Retenir le Framework Desktop Ryzen AI Max+ 395 / 128 Go comme machine candidate
Machine de référence pour le prototype et le POC ; le choix sera confirmé ou infirmé par nos benchmarks.
- Identifiant
- ADR-002
- Statut
- Acceptée
- Date
- 16 septembre 2026
- Décision
- Le Framework Desktop (Ryzen AI Max+ 395, 128 Go) est la machine candidate pour le prototype. La décision d'en faire la base du produit sera prise après benchmarks (ADR à venir).
- Options étudiées
- Framework Desktop 128 Go
- Mini-PC Strix Halo (GMKtec, HP, Beelink)
- Mac Studio
- NVIDIA DGX Spark
- PC + RTX 5090
- Station RTX PRO 6000
Contexte
Le projet a besoin d'une machine capable de faire tourner un modèle de qualité (classe gpt-oss-120b ou Qwen3 235B-A22B quantifié) avec une marge pour le KV cache de plusieurs utilisateurs, dans un format silencieux et compact installable dans un bureau, à un prix compatible avec une PME.
La caractéristique décisive est la mémoire adressable par le GPU : 128 Go de mémoire unifiée permettent de charger des modèles impossibles sur une carte graphique grand public (32 Go sur RTX 5090).
Options étudiées
Voir la comparaison détaillée. En résumé :
- Framework Desktop 128 Go : mémoire unifiée 128 Go, bande passante annoncée 256 Go/s, Linux officiellement supporté, entreprise transparente sur les pièces, prix constaté 3 889 € TTC au 16 septembre 2026 (en hausse par rapport à 2025) et rupture de stock.
- Mini-PC Strix Halo : même puce, prix similaires ou supérieurs, support Linux et qualité variables.
- Mac Studio : bande passante très supérieure (M5 Max/Ultra), mais macOS et changement complet de pile.
- DGX Spark : CUDA, bande passante comparable (273 Go/s), prix supérieur, écosystème NVIDIA.
- RTX 5090 / RTX PRO 6000 : génération beaucoup plus rapide mais 32 Go (insuffisant pour un gros modèle) ou prix hors cible (96 Go).
Décision
Le Framework Desktop 128 Go est la machine candidate. Elle sera commandée pour le prototype. La décision de l'imposer comme base du produit est suspendue aux résultats des benchmarks : capacité multi-utilisateurs réelle, stabilité 24 h/24, mémoire GPU réellement allouable.
Pourquoi
- Seule famille de machines qui combine 128 Go adressables par le GPU, Linux officiel et prix inférieur à 5 000 €.
- Les benchmarks publiés (indépendants et communautaires) montrent une génération autour de 50 tok/s pour gpt-oss-120b, ce qui est suffisant pour un usage assistant si la charge multi-utilisateurs se confirme.
- L'écosystème (llama.cpp Vulkan/ROCm, Ollama, Lemonade) progresse vite et AMD supporte désormais officiellement gfx1151 dans ROCm.
Conséquences
- La génération est bornée par la bande passante mémoire (256 Go/s) : les modèles denses de 70 Md tournent autour de 5 tok/s (benchmarks indépendants), ce qui les rend inutilisables ; la Box s'appuiera sur des modèles MoE.
- Les risques identifiés doivent être testés avant tout engagement client : stabilité sous charge GPU (Q-012), plafond de mémoire GPU allouable (Q-011), prix et disponibilité volatils.
- Le dossier maintient une veille sur les alternatives (Mac Studio, DGX Spark, futures générations AMD).