Vue d'ensemble
Centre de commande Box IA
Serveur d'IA privé pour PME · dernière mise à jour du dossier le 16 septembre 2026
État général du projet
Mis à jour le 16 septembre 2026
Confirmée
Phase actuelle : recherche. L'architecture cible est définie, la machine candidate est identifiée, aucun benchmark n'a encore été réalisé par nous.
- Machine candidate : Framework Desktop Ryzen AI Max+ 395 / 128 Go (non encore commandée).
- Cas d'usage de référence : cabinet d'avocats 5 à 10 personnes.
- Prochaine étape : commander la machine et dérouler le protocole de benchmarks.
7 question(s) ouverte(s) de priorité haute.voir
Aucun benchmark réalisé par nous n'est encore enregistré : toutes les performances restent des estimations.voir
À reprendre
Sujets sur lesquels le travail est en cours (frontmatter focus: true)
Stabilité et problèmes connusLinux · Inventaire sourcé des problèmes de fiabilité rapportés sur Strix Halo et Framework Desktop sous Linux (crashs GPU, VGPR, MES ring timeout, xHCI/s2idle, USB-C, BIOS, NIC Beelink) avec leur état et les contournements.16 sept. 2026Multi-utilisateurs : servir 5 à 10 personnes sur une seule machineMulti-utilisateurs · Pourquoi une machine à 256 Go/s est bornée en génération, ce que le batching et les MoE y changent, ce que les mesures publiées disent, et ce qu'il reste à mesurer avant de promettre un nombre d'utilisateurs.16 sept. 2026Préparer un Proof of ConceptPOC · Objectifs, périmètre, checklist complète, scénario de permissions, critères de succès mesurables, rôles, risques et questionnaire utilisateur pour le POC de la Box IA sur un jeu de documents fictif.16 sept. 2026Coûts et pricingCoûts & pricing · Coût réel d'une Box (CAPEX, OPEX, TCO 3 ans) à partir des prix constatés et des consommations mesurées par des tiers, puis méthode de marge et scénarios de prix pour un cabinet de 8 personnes ; tout prix est une hypothèse.16 sept. 2026Permissions et confidentialité dans le RAGRAG · Comment garantir qu'un utilisateur ne récupère jamais un passage d'un dossier auquel il n'a pas accès : ACL par chunk, filtre côté serveur, double barrière application + moteur, audit et tests.16 sept. 2026Roadmap : de la recherche à la commercialisationRoadmap · Huit phases, de la recherche documentaire en cours jusqu'à la commercialisation, avec livrables, critères de sortie et risques ; les dates sont des hypothèses.16 sept. 2026Framework Desktop (Ryzen AI Max+ 395, 128 Go)Matériel · Machine candidate de la Box IA : APU AMD Strix Halo avec 128 Go de mémoire unifiée, compacte et silencieuse, mais dont le support ROCm n'est officiel que depuis août 2026 et dont la stabilité sous forte charge GPU reste à démontrer.16 sept. 2026gpt-oss-120bModèle · MoE OpenAI de 117 Md (5,1 Md actifs) sous Apache 2.0 : le candidat principal de la Box, mesuré entre 30 et 56 t/s sur Strix Halo selon le runtime.16 sept. 2026Mistral Small 4 (119B-A6B, 2603)Modèle · MoE de Mistral AI (119 Md, 6 Md actifs), Apache 2.0, vision et raisonnement, contexte 256k : concurrent européen direct de gpt-oss-120b, sans mesure Strix Halo trouvée.16 sept. 2026Qwen3.5 et suivants (3.6, 3.8)Modèle · Famille Qwen la plus récente (février à août 2026) : hybrides Gated DeltaNet + MoE, 201 langues, Apache 2.0 ; le 35B-A3B est le modèle des seules mesures multi-slots publiées sur Strix Halo.16 sept. 2026Cabinet d'avocats de 5 à 10 personnesCas d'usage · Cas d'usage de référence : un assistant IA local qui recherche, résume et rédige sur les dossiers du cabinet, dans le respect strict du secret professionnel et du cloisonnement par dossier.16 sept. 2026pgvector vs Qdrant : rappel et latence de la recherche filtrée par ACLExpérimentation · Mesurer la perte de rappel et la latence d'une recherche vectorielle filtrée par dossier_id (10 %, 30 %, 100 % de portée) avec pgvector HNSW (sans et avec iterative_scan, RLS) et Qdrant (payload is_tenant, JWT payload).16 sept. 2026Test de fuite de permissions du RAG (« l'avocat B ne voit jamais A »)Expérimentation · Corpus fictif à canaris, batterie de questions par utilisateur, vérification des chunks récupérés, des réponses et du journal, avec et sans barrière applicative.16 sept. 2026Combien d'utilisateurs simultanés la Box peut-elle réellement servir ?Question · 1 à 3 actifs simultanés est l'hypothèse de départ ; il faut mesurer la dégradation réelle (tok/s par utilisateur, TTFT) de 1 à 10 utilisateurs, modèle par modèle.16 sept. 2026La plateforme Strix Halo est-elle assez stable pour un serveur 24 h/24 ?Question · Des blocages sous charge GPU et des problèmes de reprise sont rapportés depuis mars 2026 ; un test d'endurance sur notre machine est indispensable avant tout client.16 sept. 2026
À vérifier
Informations incertaines ou dont la revérification est due
Architecture Box v1Architecture · Hypothèse non confirmée16 sept. 2026Cartographie des flux de donnéesArchitecture · Hypothèse non confirmée16 sept. 2026Architecture générale de la Box IAArchitecture · Hypothèse non confirmée16 sept. 2026Utilisateurs Windows / macOS / LinuxArchitecture · Hypothèse non confirmée16 sept. 2026Sauvegardes : stratégie complèteSauvegardes · Hypothèse non confirmée16 sept. 2026Comparaisons matériellesComparaisons · Information à vérifier16 sept. 2026Documents : stockage, connecteurs, synchronisationDocuments · Hypothèse non confirmée16 sept. 2026Règlement IA (AI Act) et Omnibus 2026 : ce qui s'applique à la BoxRGPD · Information à vérifier16 sept. 2026
Questions ouvertes
- Q-001Combien d'utilisateurs simultanés la Box peut-elle réellement servir ?Haute
- Q-002Quel runtime d'inférence est le plus performant sur AMD Strix Halo ?Haute
- Q-004pgvector ou Qdrant pour la base vectorielle ?Haute
- Q-008Vulkan (RADV) ou ROCm (HIP) pour llama.cpp sur Strix Halo ?Haute
- Q-009Quel modèle principal pour le cabinet d'avocats ?Haute
- Q-011Combien de mémoire GPU peut-on réellement allouer sur 128 Go ?Haute
Décisions récentes
- ADR-001Utiliser Linux comme système du serveur IAAcceptée
- ADR-002Retenir le Framework Desktop Ryzen AI Max+ 395 / 128 Go comme machine candidateAcceptée
- ADR-003Appliquer les permissions documentaires avant ou pendant la recherche RAG, jamais aprèsAcceptée
- ADR-004Démarrer avec llama.cpp (llama-server) comme runtime d'inférenceAcceptée
- ADR-005Utiliser Open WebUI comme interface du prototype, avec un RAG externe pour les permissionsAcceptée
Prochains tests
- Benchmark gpt-oss-120b à 1 utilisateur : Vulkan vs ROCm, contexte court et longÀ tester
- Montée en charge de 1 à 10 utilisateurs : gpt-oss-120b et Qwen3-30B-A3BÀ tester
- Comparer la qualité en français des modèles candidatsÀ tester
- Comparer Vulkan/RADV et ROCm/HIP dans llama.cppÀ tester
- Mesurer la mémoire GPU allouable sur le Framework DesktopÀ tester
Tests et benchmarks récents
- gpt-oss-120b MXFP4 — llama.cpp ROCm 7.2.0 (fork Lychee b8182) — 51,1 t/s (Pellegrini)51.1 tok/s
- DeepSeek-R1-Distill-Qwen-32B Q4_K_M — llama.cpp HIP — 11,2 t/s (praveentechworld)11.2 tok/s
- Llama 3.3 70B Q4_K_M — llama.cpp HIP ROCm 6.3+ — 5,1 t/s, contexte 64k (praveentechworld)5.1 tok/s
- Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 1 — 59,2 t/s, TTFT 117 ms (hogeheer)59.2 tok/s
Dernières modifications
Architecture Box v1Architecture · Composition candidate de la première Box : Framework Desktop sous Linux, Docker Compose, llama-server, Open WebUI, PostgreSQL, Caddy, restic et monitoring, avec un budget mémoire explicite.16 sept. 2026Cartographie des flux de donnéesArchitecture · Où résident les données de la Box, qui y accède, comment elles sont chiffrées et combien de temps elles sont conservées : documents, index, requêtes, réponses, journaux, sauvegardes et télémaintenance.16 sept. 2026Architecture générale de la Box IAArchitecture · Vue simple et vue complète de la Box : couches, composants candidats, principes d'architecture et flux d'une requête, du navigateur à la réponse citée.16 sept. 2026Utilisateurs Windows / macOS / LinuxArchitecture · Ce que voit et ce que doit configurer un poste client pour utiliser la Box : navigateur, DNS interne, certificat TLS, ouverture des documents sources, accessibilité et points à tester par système.16 sept. 2026Sauvegardes : stratégie complèteSauvegardes · RAID contre sauvegarde, SSD en miroir, snapshots, sauvegarde locale sur NAS et hors site chiffrée, règle 3-2-1, périmètre sauvegardé, RPO/RTO, tests de restauration et plan de reprise.16 sept. 2026Le laboratoire : lire et alimenter les benchmarksBenchmarks · Ce que la collection benchmarks enregistre, comment lire une fiche (TTFT, tok/s, pp, p50/p95), d'où viennent les données (nôtres ou publiées), comment en ajouter une et quelles séries de comparaison sont prévues.16 sept. 2026Méthodologie de benchmark reproductibleBenchmarks · Protocole du laboratoire : llama-bench, llama-batched-bench, vllm bench serve et autres outils de charge, métriques standard, prompts de référence, grille 1/2/3/5/10 utilisateurs, conditions à consigner et pièges.16 sept. 2026Comparaisons matériellesComparaisons · Lecture guidée du tableau comparatif des machines : bande passante, mémoire adressable, prix par Go de mémoire GPU, consommation, écosystème logiciel, bruit et disponibilité, avec l'origine de chaque donnée et une conclusion prudente sur le choix du Framework Desktop.16 sept. 2026
Notes à trier
- Le guide CNB « Déontologie et IA » (avril 2026) recommande un LLM sur le SI du cabinetjuridique · 16 sept. 2026
- Les modèles denses 70B tournent à ~5 tok/s sur Strix Halomodeles · 16 sept. 2026
- Le prix du Framework Desktop 128 Go a presque doublé depuis 2025hardware · 16 sept. 2026
- ROCm 10.0 supporte officiellement gfx1151rocm · 16 sept. 2026
Dernières recherches
- Campagne de recherche : Framework Desktop et plateforme Strix Halo16 sept. 2026
- Campagne de recherche : moteurs d'inférence, modèles et multi-utilisateurs16 sept. 2026
- Campagne de recherche : CNIL, RGPD, CNB, AI Act16 sept. 2026
- Campagne de recherche : RAG, permissions, interfaces et identité16 sept. 2026
Dernières sources
- artificialintelligenceact.eu — texte consolidé du règlement IA (art. 3, 4, 26, 50, annexe III) et calendrierFuture of Life Institute (site de suivi, non officiel) · consulté le 16 sept. 2026
- DGX Spark vs Mac Studio & Halo: Benchmarks & Alternatives (AIMultiple)AIMultiple · consulté le 16 sept. 2026
- AMD Ryzen AI MAX+ 395 Processor: Breakthrough AI Performance (blog AMD)AMD · consulté le 16 sept. 2026
- AMD — binaires llama.cpp validés pour ROCm 7.1.1 (Radeon/Ryzen)AMD · consulté le 16 sept. 2026
- AMD Ryzen AI Max+ 395 — page produitAMD · consulté le 16 sept. 2026
Changelog
- 16 septembre 2026Version initiale : architecture du site, contenu de départ, six décisions, douze questions ouvertes.