Lab
Expérimentations
Journal de tests : hypothèse, procédure, résultat.
À tester
20 test(s)
Benchmark gpt-oss-120b à 1 utilisateur : Vulkan vs ROCm, contexte court et longHypothèse : Sur le Framework Desktop, gpt-oss-120b MXFP4 atteint au moins 50 t/s en tg128 avec l'un des deux backends, et le prefill pp512 dépasse 500 t/s ; la génération baisse de moins de 20 % à 32k de profondeur.Prochaine action : Réceptionner la machine, installer la stack Linux/ROCm documentée, figer un build llama.cpp.HauteOctobre 2026Comparer la qualité en français des modèles candidatsHypothèse : gpt-oss-120b et Mistral Small 4 produisent un français juridique jugé acceptable par un avocat dans plus de 80 % des cas ; Qwen3-30B-A3B est nettement en retrait sur la rédaction mais équivalent sur la synthèse avec passages fournis ; les modèles de 7 à 22 Md (Lucie, EuroLLM) ne suffisent pas pour l'assistant principal. Le taux d'hallucination de citations est le critère discriminant.Prochaine action : Rédiger la grille d'évaluation et recruter un relecteur juriste ; dépend du jeu de tâches FR partagé avec les benchmarks de charge.HauteNovembre 2026Comparer Vulkan/RADV et ROCm/HIP dans llama.cppHypothèse : Vulkan/RADV est plus rapide en génération (+15 à +30 %) et ROCm/HIP plus rapide en prompt processing au-delà de quelques milliers de tokens ; pour les prompts RAG de la Box (4k à 16k tokens), la différence de temps de réponse total est inférieure à 20 % et la stabilité départage les deux.Prochaine action : Attend la machine et l'expérimentation mémoire GPU ; préparer les scripts de mesure et les prompts RAG représentatifs.HauteOctobre 2026Faire valider l'analyse juridique de la section RGPD par un avocatHypothèse : Les interprétations de la section RGPD (base légale 6.1.f, AIPD fortement recommandée, prestataire sous-traitant, RAG non assimilé à un entraînement, assistant interne non haut risque, HDS non applicable) seront confirmées pour l'essentiel ; les corrections porteront sur la formulation des arguments commerciaux et le contenu des clauses.Prochaine action : Rédiger le questionnaire à partir des callouts « À valider » ; identifier deux avocats à consulter et demander un devis.HauteNovembre 2026 (avant la première offre commerciale)Mesurer la mémoire GPU allouable sur le Framework DesktopHypothèse : Avec BIOS 3.06, UMA à 512 Mo, noyau 6.18.4+ et ttm.pages_limit fixé via amd-ttm, le GPU peut allouer au moins 100 Go de façon stable ; gpt-oss-120b MXFP4 se charge avec 32k tokens de contexte pour 4 slots.Prochaine action : Recevoir la machine, mettre le BIOS à jour, installer la distribution retenue (Q-007) ou Fedora 43 par défaut.HauteOctobre 2026Montée en charge de 1 à 10 utilisateurs : gpt-oss-120b et Qwen3-30B-A3BHypothèse : Avec llama-server -np 8 --kv-unified et KV q8_0, gpt-oss-120b sert 3 utilisateurs simultanés à plus de 25 t/s chacun avec un TTFT p95 inférieur à 3 s sur prompts courts ; à 10 utilisateurs, le débit par utilisateur reste au-dessus de 10 t/s. Le comportement suit la courbe publiée pour Qwen3.6-35B-A3B (59 → 20 t/s par utilisateur de 1 à 8 slots) décalée vers le bas.Prochaine action : Constituer le jeu de prompts FR de référence (anonymisé) ; dépend du benchmark 1 utilisateur pour le choix du backend.HauteNovembre 2026pgvector vs Qdrant : rappel et latence de la recherche filtrée par ACLHypothèse : Avec hnsw.iterative_scan activé, pgvector conserve au moins 90 % du rappel non filtré pour un utilisateur ayant accès à 10 % des dossiers, à une latence inférieure à 200 ms ; Qdrant y parvient sans réglage grâce au filtrage intégré à HNSW. Dans les deux cas, la barrière moteur (RLS, JWT payload) ne renvoie aucun point hors portée.HauteOctobre 2026Redémarrage à distance avec disque chiffré LUKS2 et TPM2Hypothèse : Avec systemd-cryptenroll et un enrôlement TPM2 lié aux PCR du démarrage sécurisé, la Box redémarre sans saisie de mot de passe après un redémarrage ordinaire, refuse le déverrouillage automatique après une modification du chargeur ou de la désactivation de Secure Boot, et redevient déverrouillable avec la clé de récupération.HauteOctobre 2026Rédiger l'AIPD du cabinet pilote avec l'outil PIA de la CNILHypothèse : L'architecture de la Box (sur site, permissions avant recherche, chiffrement à clé détenue par le cabinet, journalisation 6 à 12 mois, télémaintenance encadrée) permet de conclure une AIPD sans risque résiduel élevé, donc sans consultation préalable de la CNIL (art. 36).Prochaine action : Choisir le cabinet pilote et désigner son référent RGPD ; préparer la fiche de registre remplie.HauteOctobre 2026 (pilote)Stabilité sous charge continue pendant 24 heuresHypothèse : Avec BIOS 3.06, noyau 6.18.4+, firmware 2026010+, veille désactivée, amdgpu.gpu_recovery=1 et 100 Go de GTT, llama-server (backend retenu) sert 4 utilisateurs simulés en continu pendant 24 h sans reset GPU, sans erreur amdgpu dans dmesg et sans redémarrage du service.Prochaine action : Préparer le générateur de charge et le script de journalisation ; acheter un wattmètre à enregistrement.HauteNovembre 2026Test de fuite de permissions du RAG (« l'avocat B ne voit jamais A »)Hypothèse : Avec un filtre dossier_id calculé côté serveur et imposé par le moteur (RLS PostgreSQL ou JWT Qdrant), aucun chunk ni aucune réponse ne contient un canari hors de la portée de l'utilisateur, même lorsque la barrière applicative est désactivée.HauteOctobre 2026Test de restauration complète sur machine viergeHypothèse : Une Box complète (système, configuration, base d'utilisateurs et permissions, index, journaux) peut être reconstruite sur une machine vierge en moins d'un jour ouvré à partir de la sauvegarde hors site chiffrée et des clés sous séquestre, sans intervention sur la Box d'origine.HauteNovembre 2026Brancher le RAG de la Box sur Open WebUI (pipeline, endpoint, outil)Hypothèse : Un endpoint OpenAI-compatible exposé par le service RAG de la Box, appelé par Open WebUI comme un modèle, transmet l'identité de l'utilisateur de façon vérifiable et affiche les citations (dossier, pièce, page, lien) sans dépendre du RAG intégré ni de ses knowledge bases.MoyenneNovembre 2026Comparer les modèles d'embeddings sur du français juridiqueHypothèse : Sur des questions juridiques en français, bge-m3 et multilingual-e5-large atteignent un recall@10 comparable ; le reranker bge-reranker-v2-m3 apporte un gain de MRR supérieur à celui du changement de modèle d'embeddings ; la recherche hybride (BM25 + vecteurs, RRF) bat chacune des deux recherches seules.MoyenneNovembre 2026Évaluer Docling sur un corpus juridique françaisHypothèse : Docling (MIT) avec Tesseract fra extrait correctement texte, structure et tableaux des documents juridiques français natifs, et atteint une qualité OCR acceptable sur des scans de qualité moyenne, à un débit compatible avec l'ingestion initiale d'un cabinet sur CPU.MoyenneOctobre 2026Évaluer vLLM sur ROCm gfx1151Hypothèse : En septembre 2026, l'image officielle vllm/vllm-openai-rocm démarre sur gfx1151 avec ROCm 7.x sans patch, sert un MoE de taille moyenne, et donne un TTFT p95 inférieur à celui de llama-server à 5 clients ; mais elle ne sert pas gpt-oss-120b en MXFP4 sans conversion, et réserve plus de mémoire que llama-server pour un même contexte.Prochaine action : Attendre la stack Linux/ROCm validée ; vérifier la version ROCm exigée par l'image courante.MoyenneDécembre 2026Exercice d'incident : ransomware sur un poste du cabinetHypothèse : Un ransomware exécuté sur un poste utilisateur ayant accès au partage documentaire ne peut ni chiffrer les données de la Box (montage en lecture seule), ni altérer les sauvegardes (dépôt en ajout seul ou hors de portée), et la procédure d'incident permet une reprise sous 2 jours ouvrés avec une notification CNIL préparée dans les 72 heures.MoyenneDécembre 2026Mesurer la consommation et le bruit en inférenceHypothèse : Au repos le système consomme 10 à 15 W ; en inférence gpt-oss-120b mono-utilisateur 100 à 130 W ; sous 4 slots 120 à 150 W. Le bruit reste sous 42 dBA à 1 m en charge avec le ventilateur Noctua, ce qui autorise une installation dans un bureau.Prochaine action : Acheter ou emprunter un wattmètre enregistreur et un sonomètre ; définir la pièce de mesure.MoyenneNovembre 2026Scan de vulnérabilités des images Docker de la BoxHypothèse : Les images officielles de la pile retenue ne contiennent aucune vulnérabilité critique exploitable dans le contexte de la Box (services non exposés, réseau interne), et un scan mensuel automatisé avec Trivy plus un SBOM par image permettent de suivre les correctifs sans effort excessif.MoyenneOctobre 2026Valider l'installation reproductibleHypothèse : Une personne compétente en administration Linux mais sans connaissance préalable du projet réinstalle la Box en moins d'une demi-journée à partir de la page Installation et du dépôt de configuration, et obtient le même résultat à la checklist de validation que l'installation initiale.Prochaine action : Terminer la première installation et ses mesures ; désigner la personne qui fera la seconde.MoyenneDécembre 2026
Ajouter un(e) expérimentation : créer un fichier dans content/experiments/ (voir README).