Knowledge
Glossaire
Définitions courtes et pratiques.
A
- ACL (liste de contrôle d'accès)Access Control List, droits par dossier, permissionsidentité
- Liste attachée à une ressource (dossier, fichier, base de connaissances) qui indique quels utilisateurs ou groupes peuvent la lire, la modifier ou l'administrer.
- ADR (Architecture Decision Record)décision d'architecture, registre des décisionsméthode
- Document court qui consigne une décision d'architecture, son contexte, les options étudiées, la raison du choix et ses conséquences, afin d'en garder la trace dans le temps.
- AI Act (règlement européen sur l'IA)règlement IA, RIA, Regulation on Artificial Intelligencejuridique
- Règlement de l'Union européenne qui classe les systèmes d'IA par niveau de risque et impose des obligations graduées aux fournisseurs et aux déployeurs, avec une entrée en application échelonnée.
- AIPD (analyse d'impact)DPIA, analyse d'impact relative à la protection des données, PIAjuridique
- Étude formalisée, exigée par l'article 35 du RGPD lorsqu'un traitement est susceptible d'engendrer un risque élevé pour les personnes, qui décrit le traitement, évalue les risques et les mesures pour y remédier.
- ANSSIAgence nationale de la sécurité des systèmes d'informationjuridique
- Autorité nationale française en matière de cybersécurité, qui publie des guides d'hygiène informatique, des recommandations de configuration et des référentiels de sécurité.
- Authentikidentité
- Fournisseur d'identité open source (cœur MIT) orienté auto-hébergement, gérant OIDC, SAML, LDAP, SCIM et proxy d'authentification, avec MFA et passkeys.
B
- Bande passante mémoirememory bandwidth, débit mémoirematériel
- Quantité de données que le processeur ou le GPU peut lire en mémoire par seconde, exprimée en gigaoctets par seconde ; elle borne la vitesse de génération d'un modèle de langage.
- Batchingtraitement par lots, batchinférence
- Regroupement de plusieurs requêtes ou de plusieurs tokens dans un même passage de calcul pour mieux utiliser le processeur graphique.
- BM25recherche lexicale, recherche plein texte, Okapi BM25RAG
- Algorithme classique de recherche par mots-clés qui note un document selon la fréquence des termes de la requête, pondérée par leur rareté dans la collection et la longueur du document.
- BOLA (Broken Object Level Authorization)IDOR, contrôle d'accès défaillant au niveau objetsécurité
- Vulnérabilité dans laquelle une application vérifie que l'utilisateur est authentifié mais pas qu'il a le droit d'accéder à l'objet précis demandé (document, conversation), permettant d'y accéder en modifiant un identifiant.
- Btrfsstockage
- Système de fichiers Linux intégré au noyau, avec sommes de contrôle, snapshots, compression et gestion de plusieurs disques (miroir).
C
- Caddyréseau
- Serveur web et reverse proxy open source (Apache 2.0) qui obtient et renouvelle automatiquement les certificats TLS, avec une configuration très courte.
- CAPEXdépenses d'investissement, capital expenditureproduit
- Dépenses d'investissement engagées une fois pour acquérir un bien durable, ici le serveur, ses disques, l'onduleur et l'installation initiale.
- Chiffrement au reposencryption at rest, chiffrement des données stockéessécurité
- Chiffrement des données telles qu'elles sont stockées sur disque, de sorte qu'un support volé ou mis au rebut soit illisible sans la clé.
- Chunking (découpage en passages)découpage, segmentation, chunkRAG
- Découpage d'un document en passages de taille bornée, avec un éventuel chevauchement, avant le calcul des embeddings et l'indexation.
- CNB (Conseil national des barreaux)Conseil national des barreauxjuridique
- Institution représentative de la profession d'avocat en France, qui édicte le règlement intérieur national et publie des guides, notamment sur l'usage de l'IA et la sécurité numérique des cabinets.
- CNILCommission nationale de l'informatique et des libertésjuridique
- Autorité administrative indépendante française chargée de veiller à la protection des données personnelles, qui publie des recommandations, dont des fiches pratiques sur l'IA.
- Contexte partagé (prompt cache)prompt caching, cache de préfixe, prefix cacheinférence
- Réutilisation, entre plusieurs requêtes, du KV cache déjà calculé pour un préfixe commun (consignes système, début de conversation), afin d'éviter de retraiter les mêmes tokens.
- Continuous batchingbatching continu, in-flight batchinginférence
- Technique de serveur d'inférence qui insère de nouvelles requêtes dans le lot en cours à chaque étape de génération, au lieu d'attendre que toutes les séquences du lot soient terminées.
D
- Docker et Docker Composeconteneur, container, Composeméthode
- Technologie de conteneurisation qui isole chaque service avec ses dépendances dans une image reproductible ; Docker Compose décrit et lance un ensemble de conteneurs, réseaux et volumes à partir d'un fichier unique.
- DoclingRAG
- Bibliothèque open source d'IBM Research pour convertir PDF, Word, PowerPoint, HTML et images en texte structuré (Markdown, JSON), avec analyse de mise en page, extraction des tableaux et OCR.
- Données sensiblescatégories particulières de données, article 9 RGPDjuridique
- Catégories particulières de données personnelles dont le traitement est en principe interdit sauf exceptions : santé, origine, opinions politiques ou religieuses, orientation sexuelle, données génétiques ou biométriques ; par extension, données d'infractions et de condamnations (article 10).
E
- Embedding (plongement vectoriel)plongement, vecteur sémantique, embeddingsRAG
- Représentation numérique d'un texte sous forme de vecteur de plusieurs centaines de dimensions, telle que deux textes de sens proche produisent des vecteurs proches.
F
- Fenêtre de contextecontext window, contexte, longueur de contexteinférence
- Nombre maximal de tokens qu'un modèle peut prendre en compte à la fois, prompt et réponse compris.
- Flash attentionFlashAttention, -fainférence
- Implémentation optimisée du calcul d'attention qui évite de matérialiser la matrice complète des scores en mémoire, réduisant l'empreinte mémoire et accélérant le traitement des longs contextes.
- Function calling (appel d'outils)tool calling, appel de fonctions, outilsmodèles
- Capacité d'un modèle à produire, au lieu d'une réponse en texte libre, un appel structuré à une fonction externe (recherche, calcul, requête) dont le résultat lui est ensuite renvoyé.
G
- GGUFformat GGUFmodèles
- Format de fichier de llama.cpp contenant les poids quantifiés d'un modèle et ses métadonnées (tokenizer, architecture, gabarit de conversation) dans un seul fichier.
- Grafanaméthode
- Outil open source de tableaux de bord qui visualise des métriques et des journaux provenant de sources comme Prometheus.
- GTT (Graphics Translation Table)TTM, mémoire partagée GPU, amdgpu.gttsizematériel
- Mécanisme du pilote graphique Linux (amdgpu, via TTM) qui permet au GPU d'adresser de la mémoire système au-delà de la réservation fixée dans le BIOS.
H
- Hallucinationconfabulation, réponse inventéemodèles
- Production par un modèle de langage d'une affirmation fausse ou inventée, présentée avec la même assurance qu'une information exacte.
- HIPHeterogeneous-compute Interface for Portabilitymatériel
- Interface de programmation GPU d'AMD, proche de CUDA, qui fait partie de ROCm et permet de compiler le même code pour GPU AMD et NVIDIA.
- HNSWHierarchical Navigable Small World, index vectoriel approchéRAG
- Structure d'index en graphe à plusieurs niveaux qui permet de retrouver rapidement les vecteurs les plus proches d'une requête, de manière approximative, dans de grandes collections.
I
- Injection de promptprompt injection, injection d'instructionssécurité
- Attaque consistant à glisser dans un contenu lu par le modèle (document, page web, e-mail) des instructions qui détournent son comportement, par exemple pour exfiltrer des données ou ignorer ses consignes.
K
- Keycloakidentité
- Fournisseur d'identité open source (Apache 2.0), projet incubé par la CNCF, gérant OIDC, SAML, fédération LDAP et Kerberos, MFA et rôles.
- KV cachecache clé-valeur, KV-cacheinférence
- Mémoire dans laquelle le modèle conserve, pour chaque token déjà traité, les clés et valeurs de l'attention afin de ne pas les recalculer à chaque nouveau token généré.
L
- LDAPannuaire LDAP, Active Directoryidentité
- Protocole d'interrogation d'annuaires d'entreprise (comptes, groupes), utilisé notamment par Active Directory de Microsoft.
- LibreChatproduit
- Interface de chat auto-hébergée sous licence MIT, multi-fournisseurs, avec contrôle d'accès par ressource (agents, fichiers, prompts) et un service RAG séparé basé sur pgvector.
- llama-serverllama.cpp server, serveur llama.cppinférence
- Serveur HTTP de llama.cpp qui charge un modèle GGUF et expose une API compatible OpenAI (chat, complétions, embeddings, reranking) avec traitement parallèle par slots.
- llama.cppggml, llamacppinférence
- Bibliothèque et outils open source en C/C++ pour exécuter des modèles de langage quantifiés au format GGUF sur CPU et GPU, avec des backends CUDA, Vulkan, ROCm et Metal.
- LLM (grand modèle de langage)Large Language Model, grand modèle de langage, modèle de langagemodèles
- Réseau de neurones entraîné sur de très grands volumes de texte pour prédire le token suivant, capable de comprendre et de produire du langage naturel.
- LUKSLinux Unified Key Setup, dm-crypt, chiffrement de disquesécurité
- Standard de chiffrement de disque sous Linux, qui chiffre une partition ou un volume entier et gère plusieurs clés de déverrouillage.
M
- Mémoire unifiéeunified memory, UMA, mémoire partagée CPU/GPUmatériel
- Architecture dans laquelle le processeur et le processeur graphique partagent la même mémoire physique, ce qui permet au GPU d'utiliser une grande partie de la RAM du système pour charger un modèle.
- MFA (authentification multifacteur)2FA, authentification à deux facteurs, double authentificationidentité
- Méthode d'authentification qui exige au moins deux preuves indépendantes (mot de passe, code d'application, clé physique, empreinte) pour accéder à un compte.
- Microsoft Entra IDAzure AD, Azure Active Directory, Entraidentité
- Service d'annuaire et d'identité cloud de Microsoft (anciennement Azure AD), fournisseur d'identité OIDC et SAML des comptes Microsoft 365.
- MoE (mélange d'experts)Mixture of Experts, mélange d'experts, modèle sparsemodèles
- Architecture de modèle dans laquelle chaque token n'active qu'une petite partie des paramètres (quelques « experts » choisis par un routeur), ce qui réduit le calcul et la lecture mémoire par token.
- Multi-tenantmulti-locataire, cloisonnement par tenantsécurité
- Organisation d'un système où plusieurs groupes d'utilisateurs (tenants) partagent la même infrastructure tout en étant strictement cloisonnés dans leurs données.
- MXFP4FP4 à micro-échelle, microscaling FP4modèles
- Format numérique à 4 bits en virgule flottante avec facteurs d'échelle partagés par blocs, utilisé notamment par les modèles gpt-oss pour leurs couches d'experts.
N
- NASNetwork Attached Storage, serveur de stockage réseaustockage
- Boîtier de stockage en réseau qui expose des partages de fichiers (SMB, NFS) et sert souvent de cible de sauvegarde ou de serveur de documents dans une petite structure.
- Nextcloudstockage
- Plateforme open source (AGPL) de partage et de synchronisation de fichiers auto-hébergée, avec clients Windows, macOS, Linux et mobiles, gestion des droits par dossier et accès WebDAV.
- NPUNeural Processing Unit, XDNA, unité de traitement neuronalmatériel
- Accélérateur spécialisé pour les réseaux de neurones, intégré au processeur, conçu pour des inférences à faible consommation plutôt que pour les grands modèles de langage.
O
- OCR (reconnaissance optique de caractères)reconnaissance de caractères, océrisationRAG
- Conversion d'une image de texte (document scanné, photo, PDF image) en texte exploitable par une machine.
- OIDC (OpenID Connect)OpenID Connect, OAuth2identité
- Protocole d'authentification bâti sur OAuth 2.0 qui permet à une application de déléguer la connexion à un fournisseur d'identité et de recevoir en retour l'identité et les groupes de l'utilisateur sous forme de jetons signés.
- Ollamainférence
- Outil qui emballe llama.cpp avec un gestionnaire de modèles et une API simple, pour installer et lancer un modèle local en une commande.
- Onduleur (UPS)UPS, alimentation sans interruptionmatériel
- Équipement qui alimente le serveur sur batterie en cas de coupure électrique et lui signale la panne pour qu'il s'arrête proprement.
- Open WebUIOpenWebUIproduit
- Interface web de chat auto-hébergée, type ChatGPT, qui se connecte à des runtimes locaux via l'API OpenAI et intègre gestion des utilisateurs, groupes, bases de connaissances et RAG.
- OPEXdépenses d'exploitation, operational expenditureproduit
- Dépenses récurrentes de fonctionnement : électricité, maintenance, support, mises à jour, sauvegardes hors site, éventuelles licences.
P
- Paramètres actifsactive parameters, paramètres activésmodèles
- Nombre de paramètres effectivement utilisés pour traiter un token dans un modèle à mélange d'experts, par opposition au nombre total de paramètres stockés.
- Passkeyclé d'accès, WebAuthn, FIDO2identité
- Identifiant cryptographique stocké sur l'appareil ou dans un gestionnaire de mots de passe, qui remplace le mot de passe par une signature validée localement (empreinte, code de l'appareil), résistant au phishing.
- pgvectorRAG
- Extension PostgreSQL qui ajoute un type de colonne vecteur, des opérateurs de distance et des index (HNSW, IVFFlat) pour la recherche de similarité dans la base relationnelle.
- POC (preuve de concept)Proof of Concept, pilote, démonstrateurméthode
- Réalisation limitée, dans un cadre défini, destinée à vérifier qu'une solution fonctionne et répond au besoin avant tout engagement d'envergure.
- Prometheusméthode
- Système open source de collecte et de stockage de métriques en séries temporelles, qui interroge périodiquement des « exporters » exposés par les services supervisés.
Q
- QdrantRAG
- Base de données vectorielle open source (Apache 2.0) écrite en Rust, avec filtrage par métadonnées intégré à l'index HNSW et un mode multi-tenant.
- Quantificationquantization, quantisation, Q4, Q8modèles
- Réduction de la précision numérique des poids d'un modèle (par exemple de 16 bits à 4 bits) pour diminuer sa taille en mémoire et accélérer l'inférence, au prix d'une perte de qualité généralement faible.
R
- RADVMesa RADV, pilote Vulkan Mesamatériel
- Pilote Vulkan open source pour GPU AMD inclus dans Mesa, livré par défaut avec les distributions Linux.
- RAG (génération augmentée par récupération)Retrieval-Augmented Generation, génération augmentée par récupérationRAG
- Technique qui retrouve les passages pertinents dans une base documentaire puis les fournit au modèle de langage pour qu'il réponde à partir de sources réelles et citables.
- RAIDmiroir, RAID 1stockage
- Technique qui regroupe plusieurs disques pour la redondance ou la performance ; le RAID 1 (miroir) écrit les mêmes données sur deux disques afin de survivre à la panne de l'un d'eux.
- RBAC (contrôle d'accès par rôles)Role-Based Access Control, rôlesidentité
- Modèle de contrôle d'accès dans lequel les droits sont attachés à des rôles (administrateur, utilisateur, lecteur) et les utilisateurs reçoivent des rôles plutôt que des droits individuels.
- Recherche hybridehybrid searchRAG
- Combinaison d'une recherche lexicale (BM25) et d'une recherche sémantique (embeddings), dont les résultats sont fusionnés pour tirer parti des deux approches.
- Registre des activités de traitementregistre RGPD, article 30juridique
- Document tenu par le responsable de traitement qui recense chaque traitement de données personnelles avec sa finalité, les catégories de données et de personnes, les destinataires, les durées de conservation et les mesures de sécurité.
- Règle de sauvegarde 3-2-13-2-1, stratégie 3-2-1stockage
- Principe qui recommande de conserver trois copies des données, sur deux supports différents, dont une hors site.
- Rerankerreclasseur, cross-encoder, rerankingRAG
- Modèle qui réévalue la pertinence de chaque passage candidat par rapport à la question, en lisant les deux ensemble, pour reclasser les résultats de la recherche initiale.
- Reverse proxyproxy inverse, mandataire inverseréseau
- Serveur placé devant une ou plusieurs applications web, qui reçoit toutes les connexions des clients, termine le chiffrement TLS et transmet les requêtes au bon service interne.
- RGPDGDPR, Règlement général sur la protection des donnéesjuridique
- Règlement européen encadrant le traitement des données personnelles : principes, bases légales, droits des personnes, obligations de sécurité, registre et analyse d'impact.
- ROCmRadeon Open Computematériel
- Pile logicielle open source d'AMD pour le calcul sur GPU (pilotes, bibliothèques, compilateur HIP), équivalent de CUDA chez NVIDIA.
- Row-level security (RLS)sécurité au niveau des lignes, RLSsécurité
- Mécanisme de PostgreSQL qui applique automatiquement une politique de filtrage à chaque requête, de sorte qu'un utilisateur ou un rôle ne voit que les lignes qu'il est autorisé à lire.
- RPO (perte de données maximale admissible)Recovery Point Objectiveméthode
- Quantité maximale de données, exprimée en durée, que l'on accepte de perdre en cas d'incident ; elle fixe la fréquence des sauvegardes.
- RRF (Reciprocal Rank Fusion)fusion de rangs réciproquesRAG
- Méthode de fusion de plusieurs listes de résultats qui attribue à chaque document un score fondé sur l'inverse de son rang dans chaque liste, sans avoir à comparer des scores hétérogènes.
- RTO (délai de rétablissement)Recovery Time Objectiveméthode
- Durée maximale acceptable entre un incident et le retour en service ; elle dimensionne les procédures de restauration et les pièces de rechange.
S
- SAMLSAML 2.0, Security Assertion Markup Languageidentité
- Protocole d'authentification fédérée plus ancien qu'OIDC, fondé sur des assertions XML signées, encore répandu dans les logiciels d'entreprise.
- Secret des affairestrade secret, information confidentiellejuridique
- Protection juridique des informations qui ont une valeur commerciale parce qu'elles sont secrètes et font l'objet de mesures de protection raisonnables de la part de leur détenteur.
- Secret professionnel de l'avocatsecret professionnel, confidentialité des échangesjuridique
- Obligation, d'ordre public, qui interdit à l'avocat de révéler ce qu'il a appris dans l'exercice de sa profession et qui couvre les consultations, correspondances et pièces des dossiers.
- Secure Bootdémarrage sécurisé, UEFI Secure Bootsécurité
- Fonction du firmware UEFI qui n'autorise au démarrage que des composants (chargeur, noyau) signés par une autorité de confiance, empêchant l'exécution d'un système modifié.
- SharePoint / OneDriveMicrosoft 365, OneDrivestockage
- Services de stockage et de collaboration documentaire de Microsoft 365, accessibles par l'API Microsoft Graph qui expose fichiers, métadonnées et permissions.
- SLA (accord de niveau de service)Service Level Agreement, engagement de serviceproduit
- Engagement contractuel sur la qualité d'un service : disponibilité, délais d'intervention et de rétablissement, pénalités éventuelles.
- Slot (llama-server)emplacement, -np, parallel slotsinférence
- Dans llama-server, emplacement de traitement capable de servir une conversation à la fois ; le nombre de slots fixe le nombre de requêtes traitées en parallèle et partage la fenêtre de contexte totale entre elles.
- SMB / CIFSServer Message Block, partage Windows, CIFS, Sambastockage
- Protocole de partage de fichiers en réseau utilisé par Windows et implémenté sous Linux par Samba, qui transporte les fichiers et leurs permissions (ACL).
- Snapshot (instantané)instantané, clichéstockage
- Copie figée de l'état d'un système de fichiers ou d'un volume à un instant donné, créée quasi instantanément et permettant de revenir en arrière ou de sauvegarder un état cohérent.
- Sous-traitant (RGPD)processor, article 28juridique
- Au sens du RGPD, personne ou organisme qui traite des données personnelles pour le compte du responsable de traitement, lié à lui par un contrat fixant l'objet, la durée, les instructions et les mesures de sécurité.
- SSO (authentification unique)Single Sign-On, authentification uniqueidentité
- Mécanisme permettant à un utilisateur de s'authentifier une fois auprès d'un fournisseur d'identité et d'accéder ensuite à plusieurs applications sans ressaisir ses identifiants.
- Strix HaloRyzen AI Max, Ryzen AI Max+ 395, gfx1151matériel
- Nom de code de la famille de processeurs AMD Ryzen AI Max, qui réunit sur une même puce des cœurs Zen 5, un GPU intégré RDNA 3.5 de grande taille (Radeon 8060S) et un NPU, avec jusqu'à 128 Go de mémoire unifiée LPDDR5X.
T
- Tailscaletailnetréseau
- Service de réseau privé maillé basé sur WireGuard, où les appareils s'authentifient auprès d'un serveur de coordination puis communiquent directement entre eux de manière chiffrée.
- TDPThermal Design Power, enveloppe thermique, cTDPmatériel
- Puissance thermique de conception d'un processeur, en watts, que le système de refroidissement doit dissiper ; souvent configurable (cTDP) dans une plage définie par le fabricant.
- Tesseracttesseract-ocrRAG
- Moteur d'OCR open source (Apache 2.0) maintenu depuis Google, fonctionnant sur CPU, avec des modèles de langue dont le français.
- TLS (Transport Layer Security)HTTPS, SSL, certificatsécurité
- Protocole de chiffrement des communications réseau qui protège la confidentialité et l'intégrité des échanges entre le navigateur et le serveur, et authentifie le serveur par un certificat.
- Tokenjeton, tokensinférence
- Unité de texte manipulée par un modèle de langage, correspondant à un mot, un fragment de mot ou un signe de ponctuation.
- Tokens par secondet/s, tok/s, vitesse de génération, tginférence
- Vitesse à laquelle un modèle produit sa réponse, exprimée en nombre de tokens générés par seconde pour un utilisateur donné.
- Traitement du prompt (prompt processing)prefill, pp, pp512inférence
- Phase d'inférence pendant laquelle le modèle ingère l'ensemble du prompt avant de produire le premier token, mesurée en tokens traités par seconde.
- TTFT (temps jusqu'au premier token)time to first token, latence du premier tokeninférence
- Délai entre l'envoi d'une requête et l'apparition du premier token de la réponse, qui correspond essentiellement au traitement du prompt.
- TTM (time to market)délai de mise sur le marchéproduit
- Durée entre le début d'un projet et la disponibilité commerciale du produit.
V
- VLANréseau local virtuel, segmentation réseauréseau
- Segmentation logique d'un réseau physique en plusieurs réseaux isolés, permettant par exemple de séparer les serveurs, les postes de travail et les équipements invités.
- vLLMinférence
- Serveur d'inférence haute performance conçu pour les GPU de datacenter, avec continuous batching natif et gestion paginée du KV cache (PagedAttention).
- VPNréseau privé virtuel, Virtual Private Networkréseau
- Tunnel chiffré qui relie un appareil distant au réseau interne comme s'il y était physiquement connecté, sans exposer les services sur Internet.
- VRAMmémoire vidéo, mémoire graphiquematériel
- Mémoire dédiée au processeur graphique, dans laquelle doivent résider les poids du modèle et le KV cache pour une inférence rapide sur GPU.
- Vulkanbackend Vulkanmatériel
- API graphique et de calcul multiplateforme, ouverte, utilisée par llama.cpp comme backend GPU indépendant du fabricant, disponible sur AMD via les pilotes Mesa.
W
- WireGuardréseau
- Protocole et implémentation de VPN modernes, intégrés au noyau Linux, réputés pour leur simplicité, leur performance et une base de code réduite.
Z
- ZFSOpenZFSstockage
- Système de fichiers et gestionnaire de volumes intégrés, offrant sommes de contrôle de bout en bout, snapshots instantanés, compression et miroirs, développé pour l'intégrité des données.
Ajouter un(e) terme : créer un fichier dans content/glossary/ (voir README).