Aller au contenu
Vue d'ensemble

Centre de commande Box IA

Serveur d'IA privé pour PME · dernière mise à jour du dossier le 16 septembre 2026

État général du projet

Mis à jour le 16 septembre 2026

Confirmée

Phase actuelle : recherche. L'architecture cible est définie, la machine candidate est identifiée, aucun benchmark n'a encore été réalisé par nous.

  • Machine candidate : Framework Desktop Ryzen AI Max+ 395 / 128 Go (non encore commandée).
  • Cas d'usage de référence : cabinet d'avocats 5 à 10 personnes.
  • Prochaine étape : commander la machine et dérouler le protocole de benchmarks.
7 question(s) ouverte(s) de priorité haute.voir
Aucun benchmark réalisé par nous n'est encore enregistré : toutes les performances restent des estimations.voir

À reprendre

Sujets sur lesquels le travail est en cours (frontmatter focus: true)

Stabilité et problèmes connusLinux · Inventaire sourcé des problèmes de fiabilité rapportés sur Strix Halo et Framework Desktop sous Linux (crashs GPU, VGPR, MES ring timeout, xHCI/s2idle, USB-C, BIOS, NIC Beelink) avec leur état et les contournements.Multi-utilisateurs : servir 5 à 10 personnes sur une seule machineMulti-utilisateurs · Pourquoi une machine à 256 Go/s est bornée en génération, ce que le batching et les MoE y changent, ce que les mesures publiées disent, et ce qu'il reste à mesurer avant de promettre un nombre d'utilisateurs.Préparer un Proof of ConceptPOC · Objectifs, périmètre, checklist complète, scénario de permissions, critères de succès mesurables, rôles, risques et questionnaire utilisateur pour le POC de la Box IA sur un jeu de documents fictif.Coûts et pricingCoûts & pricing · Coût réel d'une Box (CAPEX, OPEX, TCO 3 ans) à partir des prix constatés et des consommations mesurées par des tiers, puis méthode de marge et scénarios de prix pour un cabinet de 8 personnes ; tout prix est une hypothèse.Permissions et confidentialité dans le RAGRAG · Comment garantir qu'un utilisateur ne récupère jamais un passage d'un dossier auquel il n'a pas accès : ACL par chunk, filtre côté serveur, double barrière application + moteur, audit et tests.Roadmap : de la recherche à la commercialisationRoadmap · Huit phases, de la recherche documentaire en cours jusqu'à la commercialisation, avec livrables, critères de sortie et risques ; les dates sont des hypothèses.Framework Desktop (Ryzen AI Max+ 395, 128 Go)Matériel · Machine candidate de la Box IA : APU AMD Strix Halo avec 128 Go de mémoire unifiée, compacte et silencieuse, mais dont le support ROCm n'est officiel que depuis août 2026 et dont la stabilité sous forte charge GPU reste à démontrer.gpt-oss-120bModèle · MoE OpenAI de 117 Md (5,1 Md actifs) sous Apache 2.0 : le candidat principal de la Box, mesuré entre 30 et 56 t/s sur Strix Halo selon le runtime.Mistral Small 4 (119B-A6B, 2603)Modèle · MoE de Mistral AI (119 Md, 6 Md actifs), Apache 2.0, vision et raisonnement, contexte 256k : concurrent européen direct de gpt-oss-120b, sans mesure Strix Halo trouvée.Qwen3.5 et suivants (3.6, 3.8)Modèle · Famille Qwen la plus récente (février à août 2026) : hybrides Gated DeltaNet + MoE, 201 langues, Apache 2.0 ; le 35B-A3B est le modèle des seules mesures multi-slots publiées sur Strix Halo.Cabinet d'avocats de 5 à 10 personnesCas d'usage · Cas d'usage de référence : un assistant IA local qui recherche, résume et rédige sur les dossiers du cabinet, dans le respect strict du secret professionnel et du cloisonnement par dossier.pgvector vs Qdrant : rappel et latence de la recherche filtrée par ACLExpérimentation · Mesurer la perte de rappel et la latence d'une recherche vectorielle filtrée par dossier_id (10 %, 30 %, 100 % de portée) avec pgvector HNSW (sans et avec iterative_scan, RLS) et Qdrant (payload is_tenant, JWT payload).Test de fuite de permissions du RAG (« l'avocat B ne voit jamais A »)Expérimentation · Corpus fictif à canaris, batterie de questions par utilisateur, vérification des chunks récupérés, des réponses et du journal, avec et sans barrière applicative.Combien d'utilisateurs simultanés la Box peut-elle réellement servir ?Question · 1 à 3 actifs simultanés est l'hypothèse de départ ; il faut mesurer la dégradation réelle (tok/s par utilisateur, TTFT) de 1 à 10 utilisateurs, modèle par modèle.La plateforme Strix Halo est-elle assez stable pour un serveur 24 h/24 ?Question · Des blocages sous charge GPU et des problèmes de reprise sont rapportés depuis mars 2026 ; un test d'endurance sur notre machine est indispensable avant tout client.

Dernières modifications

Architecture Box v1Architecture · Composition candidate de la première Box : Framework Desktop sous Linux, Docker Compose, llama-server, Open WebUI, PostgreSQL, Caddy, restic et monitoring, avec un budget mémoire explicite.Cartographie des flux de donnéesArchitecture · Où résident les données de la Box, qui y accède, comment elles sont chiffrées et combien de temps elles sont conservées : documents, index, requêtes, réponses, journaux, sauvegardes et télémaintenance.Architecture générale de la Box IAArchitecture · Vue simple et vue complète de la Box : couches, composants candidats, principes d'architecture et flux d'une requête, du navigateur à la réponse citée.Utilisateurs Windows / macOS / LinuxArchitecture · Ce que voit et ce que doit configurer un poste client pour utiliser la Box : navigateur, DNS interne, certificat TLS, ouverture des documents sources, accessibilité et points à tester par système.Sauvegardes : stratégie complèteSauvegardes · RAID contre sauvegarde, SSD en miroir, snapshots, sauvegarde locale sur NAS et hors site chiffrée, règle 3-2-1, périmètre sauvegardé, RPO/RTO, tests de restauration et plan de reprise.Le laboratoire : lire et alimenter les benchmarksBenchmarks · Ce que la collection benchmarks enregistre, comment lire une fiche (TTFT, tok/s, pp, p50/p95), d'où viennent les données (nôtres ou publiées), comment en ajouter une et quelles séries de comparaison sont prévues.Méthodologie de benchmark reproductibleBenchmarks · Protocole du laboratoire : llama-bench, llama-batched-bench, vllm bench serve et autres outils de charge, métriques standard, prompts de référence, grille 1/2/3/5/10 utilisateurs, conditions à consigner et pièges.Comparaisons matériellesComparaisons · Lecture guidée du tableau comparatif des machines : bande passante, mémoire adressable, prix par Go de mémoire GPU, consommation, écosystème logiciel, bruit et disponibilité, avec l'origine de chaque donnée et une conclusion prudente sur le choix du Framework Desktop.

Changelog

  • 16 septembre 2026Version initiale : architecture du site, contenu de départ, six décisions, douze questions ouvertes.