Aller au contenu
Vue d'ensemble

Activité et historique

Changelog rédigé à la main, dernières modifications détectées dans le contenu, et informations à vérifier.

Changelog

16 septembre 2026 · 0.1

Version initiale : architecture du site, contenu de départ, six décisions, douze questions ouvertes.

  • Création du site (Next.js, Markdown + frontmatter validé, recherche globale, palette Ctrl+K, mode sombre).
  • Ajout de la fiche Framework Desktop Ryzen AI Max+ 395 / 128 Go et des machines de comparaison.
  • Ajout de l'architecture générale et de l'architecture Box v1.
  • Ajout des chapitres Linux, inférence, multi-utilisateurs, RAG (dont permissions), documents, interface, identité.
  • Ajout des chapitres sécurité, réseau, sauvegardes, monitoring, RGPD et secteur avocats.
  • Ajout du cas d'usage cabinet d'avocats, des personas, des offres (noms temporaires), des coûts et du POC.
  • Six décisions (ADR-001 à ADR-006), douze questions ouvertes (Q-001 à Q-012), premières expérimentations planifiées.
  • Bibliothèque de sources issue des campagnes de recherche du 16 septembre 2026.

À vérifier 100

Architecture Box v1Architecture · Hypothèse non confirméeCartographie des flux de donnéesArchitecture · Hypothèse non confirméeArchitecture générale de la Box IAArchitecture · Hypothèse non confirméeUtilisateurs Windows / macOS / LinuxArchitecture · Hypothèse non confirméeSauvegardes : stratégie complèteSauvegardes · Hypothèse non confirméeComparaisons matériellesComparaisons · Information à vérifierDocuments : stockage, connecteurs, synchronisationDocuments · Hypothèse non confirméeRèglement IA (AI Act) et Omnibus 2026 : ce qui s'applique à la BoxRGPD · Information à vérifierAIPD : quand elle est obligatoire et comment la conduireRGPD · Information à vérifierSecteur réglementé : cabinets d'avocatsRGPD · Information à vérifierDroits des personnes et effacement dans un RAGRGPD · Information à vérifierRGPD et confidentialité : vue d'ensembleRGPD · Information à vérifierFiche de registre type : assistant IA interne avec RAGRGPD · Information à vérifierSous-traitance : le prestataire de la BoxRGPD · Information à vérifierIdentité : comptes, groupes, SSO, MFAIdentité · Hypothèse non confirméeReverse proxy, TLS et accès distantIdentité · Hypothèse non confirméeInférence : panorama des moteursInférence · Information à vérifierllama.cpp et llama-serverInférence · Information à vérifierOllama, LM Studio, Lemonade : les moteurs « faciles »Inférence · Information à vérifiervLLM et SGLang sur Strix HaloInférence · Information à vérifierAlternatives : AnythingLLM, Onyx, RAGFlow, Dify, Kotaemon, Lobe Chat, Khoj, MstyInterface IA · Information à vérifierInterface IA : comparatif et choix initialInterface IA · Hypothèse non confirméeLibreChat : ficheInterface IA · Information à vérifierOpen WebUI : fiche détailléeInterface IA · Hypothèse non confirméeLinux : vue d'ensembleLinux · Information à vérifierInstallation reproductibleLinux · Hypothèse non confirméeMémoire GPU allouable sous LinuxLinux · Information à vérifierROCm et Vulkan sur gfx1151Linux · Information à vérifierStabilité et problèmes connusLinux · Information à vérifierMonitoring : ce que l'on surveille et commentMonitoring · Hypothèse non confirméeDimensionner la Box pour un cabinetMulti-utilisateurs · Hypothèse non confirméeMulti-utilisateurs : servir 5 à 10 personnes sur une seule machineMulti-utilisateurs · Information à vérifierKV cache : calcul et dimensionnementMulti-utilisateurs · Information à vérifierRéseau : scénarios et recommandationsRéseau · Hypothèse non confirméePréparer un Proof of ConceptPOC · Hypothèse non confirméeCoûts et pricingCoûts & pricing · Hypothèse non confirméeModèle économiqueCoûts & pricing · Hypothèse non confirméeCatalogue de fonctionnalitésProduit · Hypothèse non confirméeProduit : Box IA Entreprise (nom temporaire)Produit · Hypothèse non confirméeTemplate de proposition commercialeProduit · Hypothèse non confirméeBase vectorielle : pgvector, Qdrant et alternativesRAG · Hypothèse non confirméeChunking et embeddingsRAG · Hypothèse non confirméeÉvaluer le RAGRAG · Hypothèse non confirméeRAG : vue d'ensembleRAG · Hypothèse non confirméeIngestion : parsing, OCR, métadonnées, synchronisationRAG · Hypothèse non confirméePermissions et confidentialité dans le RAGRAG · Hypothèse non confirméeRecherche, reranking et citationsRAG · Hypothèse non confirméeRoadmap : de la recherche à la commercialisationRoadmap · Hypothèse non confirméeAccès administrateur du prestataireSécurité · Hypothèse non confirméeDurcissement du systèmeSécurité · Hypothèse non confirméeIncidents de sécuritéSécurité · Hypothèse non confirméeModèle de menaceSécurité · Hypothèse non confirméeBeelink GTR9 Pro (Ryzen AI Max+ 395, 128 Go)Matériel · Information à vérifierFramework Desktop (Ryzen AI Max+ 395, 128 Go)Matériel · Information à vérifierGMKtec EVO-X2 (Ryzen AI Max+ 395, 128 Go)Matériel · Information à vérifierHP Z2 Mini G1a (Ryzen AI Max+ PRO 395, 128 Go)Matériel · Information à vérifierMac Studio M5 Max (2026)Matériel · Information à vérifierMac Studio M5 Ultra (2026)Matériel · Information à vérifierNVIDIA DGX Spark (GB10)Matériel · Information à vérifierNVIDIA GeForce RTX 5090Matériel · Information à vérifierNVIDIA RTX PRO 6000 Blackwell (96 Go)Matériel · Information à vérifierbge-m3 (embeddings)Modèle · Information à vérifierbge-reranker-v2-m3 (reranker)Modèle · Information à vérifierEuroLLM-22B (et 9B)Modèle · Information à vérifierGemma 3 27BModèle · Information à vérifierGLM-4.5 / 4.5-Air (et suite 4.6, 4.7, 5)Modèle · Information à vérifiergpt-oss-120bModèle · Information à vérifiergpt-oss-20bModèle · Information à vérifierLlama 3.3 70B InstructModèle · Information à vérifierLucie-7B (OpenLLM-France)Modèle · Information à vérifierMagistral Small 1.2 (24B, 2509)Modèle · Information à vérifierMistral Small 3.2 (24B, 2506)Modèle · Information à vérifierMistral Small 4 (119B-A6B, 2603)Modèle · Information à vérifiermultilingual-e5-large (embeddings)Modèle · Information à vérifiernomic-embed-text-v2-moe (embeddings)Modèle · Information à vérifierQwen3-235B-A22B (Instruct-2507)Modèle · Information à vérifierQwen3-30B-A3B (Instruct-2507)Modèle · Information à vérifierQwen3-32BModèle · Information à vérifierQwen3.5 et suivants (3.6, 3.8)Modèle · Information à vérifierQwen3-Embedding (0.6B / 4B / 8B)Modèle · Information à vérifierQwen3-Reranker (0.6B / 4B / 8B)Modèle · Information à vérifierCabinet d'avocats de 5 à 10 personnesCas d'usage · Hypothèse non confirméegpt-oss-120b Q4_K_M — llama-server ROCm — 53,4 t/s (visorcraft)Benchmark · Information à vérifierQwen3-235B-A22B Q3_K_M — llama.cpp ROCm — 17,2 t/s, pp 101 t/s (visorcraft)Benchmark · Information à vérifiergpt-oss-120b — LM Studio (runtime ROCm llama.cpp) — environ 30 t/s (MindStudio)Benchmark · Information à vérifierQwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 1 — 59,2 t/s, TTFT 117 ms (hogeheer)Benchmark · Information à vérifierQwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 16 — 10,4 t/s par utilisateur, 166 agrégés (hogeheer)Benchmark · Information à vérifierQwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 4 — 32,7 t/s par utilisateur, 130,8 agrégés (hogeheer)Benchmark · Information à vérifierQwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 8 — 20,3 t/s par utilisateur, 162 agrégés (hogeheer)Benchmark · Information à vérifierDeepSeek-R1-Distill-Qwen-32B Q4_K_M — llama.cpp HIP — 11,2 t/s (praveentechworld)Benchmark · Information à vérifierLlama 3.3 70B Q4_K_M — llama.cpp HIP ROCm 6.3+ — 5,1 t/s, contexte 64k (praveentechworld)Benchmark · Information à vérifiergpt-oss-120b MXFP4 — llama.cpp ROCm 7.2.0 (fork Lychee b8182) — 51,1 t/s (Pellegrini)Benchmark · Information à vérifierComparer les modèles d'embeddings sur du français juridiqueExpérimentation · Hypothèse non confirméeÉvaluer Docling sur un corpus juridique françaisExpérimentation · Hypothèse non confirméeBrancher le RAG de la Box sur Open WebUI (pipeline, endpoint, outil)Expérimentation · Hypothèse non confirméepgvector vs Qdrant : rappel et latence de la recherche filtrée par ACLExpérimentation · Hypothèse non confirméeTest de fuite de permissions du RAG (« l'avocat B ne voit jamais A »)Expérimentation · Hypothèse non confirméeCombien d'utilisateurs simultanés la Box peut-elle réellement servir ?Question · Information à vérifierQuel runtime d'inférence est le plus performant sur AMD Strix Halo ?Question · Information à vérifierQuelle quantification retenir pour le modèle principal ?Question · Information à vérifier

Dernières modifications (par date de mise à jour)

16 septembre 2026

40 entrée(s)

Architecture Box v1Architecture · Composition candidate de la première Box : Framework Desktop sous Linux, Docker Compose, llama-server, Open WebUI, PostgreSQL, Caddy, restic et monitoring, avec un budget mémoire explicite.Cartographie des flux de donnéesArchitecture · Où résident les données de la Box, qui y accède, comment elles sont chiffrées et combien de temps elles sont conservées : documents, index, requêtes, réponses, journaux, sauvegardes et télémaintenance.Architecture générale de la Box IAArchitecture · Vue simple et vue complète de la Box : couches, composants candidats, principes d'architecture et flux d'une requête, du navigateur à la réponse citée.Utilisateurs Windows / macOS / LinuxArchitecture · Ce que voit et ce que doit configurer un poste client pour utiliser la Box : navigateur, DNS interne, certificat TLS, ouverture des documents sources, accessibilité et points à tester par système.Sauvegardes : stratégie complèteSauvegardes · RAID contre sauvegarde, SSD en miroir, snapshots, sauvegarde locale sur NAS et hors site chiffrée, règle 3-2-1, périmètre sauvegardé, RPO/RTO, tests de restauration et plan de reprise.Le laboratoire : lire et alimenter les benchmarksBenchmarks · Ce que la collection benchmarks enregistre, comment lire une fiche (TTFT, tok/s, pp, p50/p95), d'où viennent les données (nôtres ou publiées), comment en ajouter une et quelles séries de comparaison sont prévues.Méthodologie de benchmark reproductibleBenchmarks · Protocole du laboratoire : llama-bench, llama-batched-bench, vllm bench serve et autres outils de charge, métriques standard, prompts de référence, grille 1/2/3/5/10 utilisateurs, conditions à consigner et pièges.Comparaisons matériellesComparaisons · Lecture guidée du tableau comparatif des machines : bande passante, mémoire adressable, prix par Go de mémoire GPU, consommation, écosystème logiciel, bruit et disponibilité, avec l'origine de chaque donnée et une conclusion prudente sur le choix du Framework Desktop.État général du projet · Synthèse à jour de l'état du projet, affichée sur le dashboard.Documents : stockage, connecteurs, synchronisationDocuments · Où vivent les documents du cabinet (serveur, NAS, SMB, SharePoint, Drive, Nextcloud, import manuel), comment la Box les lit et surtout comment elle en lit les permissions.Règlement IA (AI Act) et Omnibus 2026 : ce qui s'applique à la BoxRGPD · Calendrier après le règlement 2026/1744, qualification de la Box (déployeur, usage général, non haut risque à notre lecture), obligations pratiques et points à suivre.AIPD : quand elle est obligatoire et comment la conduireRGPD · Critères de l'article 35 et du G29, liste CNIL 2018, analyse pour un cabinet d'avocats (fortement recommandée), canevas d'AIPD et outil PIA.Autres secteurs réglementés : canevas d'étudeRGPD · Ce qu'il faudra étudier avant de proposer la Box à des experts-comptables, professionnels de santé, agents immobiliers, bureaux d'études ou sociétés de conseil.Secteur réglementé : cabinets d'avocatsRGPD · Secret professionnel, conservation des dossiers, positions du CNB et des ordres sur l'IA, et correspondance exigence déontologique → réponse technique de la Box.Droits des personnes et effacement dans un RAGRGPD · Accès, rectification, effacement et opposition appliqués à un assistant IA local : où vivent les données, comment les supprimer partout, quelle preuve conserver.RGPD et confidentialité : vue d'ensembleRGPD · Ce qu'une IA locale change (et ne change pas) au regard du RGPD, les rôles, les articles clés, la localisation des données et la checklist de conformité de la Box IA.Fiche de registre type : assistant IA interne avec RAGRGPD · Fiche prête à copier dans le registre des activités de traitement du cabinet (modèle CNIL), pour le traitement « assistant IA local + RAG ».Sous-traitance : le prestataire de la BoxRGPD · Le prestataire qui installe et maintient la Box est sous-traitant (art. 28) : clauses obligatoires, télémaintenance encadrée, sauvegarde hors site, trame de clauses.Identité : comptes, groupes, SSO, MFAIdentité · Comment les utilisateurs de la Box sont identifiés (SSO OIDC via Entra ID, Google Workspace, Authentik ou Keycloak), authentifiés (MFA, passkeys) et comment leurs groupes deviennent des rôles Box puis des ACL RAG.Reverse proxy, TLS et accès distantIdentité · Comment exposer l'interface de la Box aux postes du cabinet et aux collaborateurs distants : reverse proxy (Caddy, Traefik, Nginx Proxy Manager), TLS interne (CA privée ou Let's Encrypt), VPN (WireGuard, Tailscale, Headscale, NetBird), et pourquoi éviter Cloudflare Tunnel.Inférence : panorama des moteursInférence · Comparaison des moteurs de serving (llama-server, Ollama, LM Studio, vLLM, SGLang, Lemonade) pour un Strix Halo sous Linux, et recommandation initiale prudente : llama-server d'abord, vLLM à évaluer.llama.cpp et llama-serverInférence · Le moteur de départ de la Box : slots, contexte partagé, KV cache quantifié, flash attention, métriques Prometheus, images Docker ROCm/Vulkan et flags connus pour gfx1151.Ollama, LM Studio, Lemonade : les moteurs « faciles »Inférence · Trois surcouches de llama.cpp orientées simplicité : variables de parallélisme d'Ollama, requêtes concurrentes de LM Studio, Lemonade porté par AMD ; limites pour un serveur multi-utilisateurs.vLLM et SGLang sur Strix HaloInférence · État du support gfx1151 (doc officielle vs images communautaires), avantages pour le multi-utilisateurs, coûts en mémoire et complexité, et critères pour basculer depuis llama-server.Alternatives : AnythingLLM, Onyx, RAGFlow, Dify, Kotaemon, Lobe Chat, Khoj, MstyInterface IA · Quand envisager chaque alternative à Open WebUI et LibreChat, et pourquoi aucune n'est retenue pour le POC : licences conditionnelles, permissions payantes, empreinte lourde ou périmètre inadapté.Interface IA : comparatif et choix initialInterface IA · Comparaison des interfaces de chat auto-hébergées (Open WebUI, LibreChat, AnythingLLM, Onyx, Lobe Chat, Dify, RAGFlow, Kotaemon, Khoj, Msty) sur la licence, le RAG, les permissions, le SSO et la maturité ; Open WebUI retenu pour le POC sous conditions.LibreChat : ficheInterface IA · Interface MIT avec ACL par ressource (Viewer/Editor/Owner), rôles custom, groupes Entra ID synchronisés via Graph, RAG API séparée sur pgvector ; plan B crédible à Open WebUI.Open WebUI : fiche détailléeInterface IA · Modèle de permissions (admin/user/pending, groupes, knowledge privées, permissions additives sans deny), variables d'environnement clés, défauts du RAG intégré, branchement d'un RAG externe, CVE 2026 et limites pour un cabinet.Linux : vue d'ensembleLinux · Rôle du système serveur de la Box, choix de distribution (Fedora, Ubuntu, Debian, Bazzite) face au support Framework et à la matrice ROCm, noyau requis, pilotes, conteneurs, mises à jour et rollback, administration distante.Installation reproductibleLinux · Canevas d'installation du serveur Linux de la Box, du BIOS aux conteneurs, présenté étape par étape avec, pour chacune, l'indication de ce qui est sourcé et de ce qui reste à valider sur la machine.Mémoire GPU allouable sous LinuxLinux · Comment dépasser les 64 Go de GTT par défaut sur Strix Halo (UMA BIOS, ttm.pages_limit, amd-ttm), avec les plafonds observés (108 et 120 Go), les paramètres contradictoires et la procédure de mesure à réaliser.ROCm et Vulkan sur gfx1151Linux · État du support ROCm pour le GPU Strix Halo (gfx1151), officiel depuis ROCm 7.13 preview et 10.0 stable, et comparaison Vulkan/RADV contre ROCm/HIP pour llama.cpp, avec des sources contradictoires.Stabilité et problèmes connusLinux · Inventaire sourcé des problèmes de fiabilité rapportés sur Strix Halo et Framework Desktop sous Linux (crashs GPU, VGPR, MES ring timeout, xHCI/s2idle, USB-C, BIOS, NIC Beelink) avec leur état et les contournements.Monitoring : ce que l'on surveille et commentMonitoring · Métriques système, GPU, inférence et applicatives ; pile proposée (node_exporter, amd-smi, llama-server --metrics, Prometheus, Grafana, Uptime Kuma) et alternatives simples ; seuils d'alerte et tableau de bord type.Page « Santé de la Box »Monitoring · Maquette de la page de santé destinée au référent client et au prestataire : voyants vert/orange/rouge, signification de chaque voyant et actions associées.Dimensionner la Box pour un cabinetMulti-utilisateurs · Méthode pour passer d'un profil d'usage (requêtes courtes, analyses de dossiers longs) à un choix de modèle, de slots et de contexte, avec trois scénarios et la liste de ce qu'il faudra mesurer.Multi-utilisateurs : servir 5 à 10 personnes sur une seule machineMulti-utilisateurs · Pourquoi une machine à 256 Go/s est bornée en génération, ce que le batching et les MoE y changent, ce que les mesures publiées disent, et ce qu'il reste à mesurer avant de promettre un nombre d'utilisateurs.KV cache : calcul et dimensionnementMulti-utilisateurs · Formule du KV cache, effet de GQA et MLA, quantification q8_0/q4_0, tableau d'estimations pour gpt-oss-120b, Qwen3-30B-A3B et Llama 70B à 8k/32k/128k, et impact du nombre de slots sur la mémoire.Réseau : scénarios et recommandationsRéseau · Six scénarios de raccordement de la Box (LAN seul, Wi-Fi, VLAN, télétravail VPN, accès externe via reverse proxy et IdP, multi-sites), leurs risques, les recommandations réseau et le tableau des ports.Préparer un Proof of ConceptPOC · Objectifs, périmètre, checklist complète, scénario de permissions, critères de succès mesurables, rôles, risques et questionnaire utilisateur pour le POC de la Box IA sur un jeu de documents fictif.