Aller au contenu
Monitoring

Monitoring : ce que l'on surveille et comment

Métriques système, GPU, inférence et applicatives ; pile proposée (node_exporter, amd-smi, llama-server --metrics, Prometheus, Grafana, Uptime Kuma) et alternatives simples ; seuils d'alerte et tableau de bord type.

Hypothèse#monitoring#securite#sauvegarde#llama-cpp#amdPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026À revérifier le 15 déc. 2026

L'essentiel

  • Le monitoring sert trois objectifs : détecter les pannes avant les utilisateurs, détecter les incidents de sécurité, et mesurer ce que la Box fait réellement (utilisateurs, débit en tokens, temps de réponse) pour dimensionner les offres.
  • Pile proposée : node_exporter + exportateur GPU AMD + llama-server --metrics collectés par Prometheus, visualisés dans Grafana, alertes par Alertmanager ; Uptime Kuma pour la disponibilité vue de l'extérieur du LAN.
  • Alternative simple pour un prestataire seul : Netdata ou Cockpit, sans Prometheus.
  • Les seuils d'alerte sont des hypothèses de départ, à ajuster après un mois de fonctionnement.
  • Aucun de ces outils n'est publié sur le LAN : accès via VPN seulement.

Ce que l'on surveille

FamilleMétriquePourquoiSource de la donnée
CPUCharge, utilisation par cœur, throttlingSaturation lors du parsing ou de l'OCRnode_exporter
GPUUtilisation, fréquence, puissance, mémoire allouée (VRAM / GTT)Le LLM vit sur le GPU ; une mémoire pleine = erreurs de chargementamd-smi / rocm-smi / amdgpu_top ; exportateur Prometheus à choisir
Mémoire unifiéeUtilisation totale, part GPU, swapSur la machine candidate, mémoire partagée entre CPU et GPU : le dépassement provoque swap ou plantagenode_exporter + exportateur GPU
TempératuresCPU/APU, SSD, ventilateurMachine compacte dans un bureau : le throttling fait chuter le débit ; fiabiliténode_exporter (hwmon), smartctl
StockageEspace libre par volume, état du miroir, SMART, erreurs BtrfsDisque plein = base corrompue ; disque dégradé = risque de pertenode_exporter, mdadm/btrfs, smartmontools
RéseauDébit entrant/sortant, connexions sortantes inhabituelles, état du VPNDétection d'exfiltration ou de télémétrie ; panne d'accès distantnode_exporter, pare-feu
InférenceRequêtes, tokens de prompt traités, tokens générés, débit moyen (tokens/s), slots occupés, file d'attenteCapacité réelle multi-utilisateurs ; dimensionnementllama-server --metrics
Temps de réponseTTFT, durée totale par requête, p50/p95Expérience utilisateur ; détection de dégradationreverse proxy + métriques du runtime
Erreurs5xx du reverse proxy, échecs du runtime, erreurs d'indexationPanne partielle invisible pour l'adminJournaux, reverse proxy
UtilisateursConnexions, échecs d'authentification, sessions actives, utilisateurs distincts par jourSécurité (force brute) et usage réel (q-001)IdP, interface
ServicesChaque container « up », redémarrages, versionService tombéDocker, Uptime Kuma
SauvegardesDernière sauvegarde réussie, durée, taille, résultat du checkLa sauvegarde échoue silencieusement sinonScript de sauvegarde vers Prometheus (textfile)
SécuritéConnexions SSH, sessions admin ouvertes, ouverture du VPN prestataire, modifications de configurationTraçabilitéjournald, scripts
TempsDérive NTPJournaux exploitablesnode_exporter

Outils

OutilRôleFaits vérifiésStatut
node_exporterMétriques système (cpu, meminfo, hwmon, filesystem, diskstats, netdev par défaut), port 9100, Apache 2.02Retenu
amd-smi / rocm-smi / amdgpu_topLecture de l'état du GPU AMD (utilisation, mémoire, température, puissance)Outils AMD et communautaire ; l'exportateur Prometheus associé reste à choisir (à sourcer)À tester sur la machine
llama-server --metricsEndpoint /metrics Prometheus : tokens de prompt traités, débit moyen, tokens générés ; /health (503 pendant le chargement, 200 prêt) ; /slots pour l'état des slots3Retenu si llama-server est le runtime
PrometheusCollecte en mode pull, stockage de séries temporelles, Alertmanager pour les alertes, Apache 2.01Retenu
GrafanaTableaux de bordNon re-vérifié iciRetenu
AlertmanagerRoutage des alertes (mail, messagerie)Composant Prometheus 1Retenu
Uptime KumaSupervision de disponibilité (HTTP, TCP, DNS, ping, Docker…), 90+ canaux de notification, MIT4Retenu, hébergé chez le prestataire pour voir la Box « de l'extérieur » via VPN
NetdataSupervision tout-en-un, installation en une commande, alertes intégréesNon vérifié iciAlternative simple
CockpitInterface web d'administration Linux (services, journaux, stockage, mises à jour)Non vérifié iciAlternative simple pour le prestataire

Seuils d'alerte proposés

Tous ces seuils sont des hypothèses de départ Hypothèse.

AlerteSeuil orangeSeuil rougeAction attendue
Espace disque (volume données)80 %90 %Nettoyage, extension, revue de la rétention
Espace disque (système)75 %85 %Purge des images et journaux
Miroir SSDDégradéIntervention sous 5 jours
SMARTAttribut en pré-échecErreurs non corrigéesRemplacement
Température APU85 °C soutenue 10 min95 °CVérifier ventilation, poussière ; seuils à confirmer avec les données constructeur (à sourcer)
Température SSD65 °C75 °CIdem
Mémoire libre (hors GPU)moins de 8 Gomoins de 4 Go ou swap actifRevoir la répartition mémoire GPU/CPU
Service down1 échec3 échecs consécutifs (1 min)Redémarrage automatique puis intervention
SauvegardeAbsente depuis 26 hAbsente depuis 50 h ou check en erreurIntervention
Échecs d'authentification10 en 10 min sur un compte50 en 10 minBlocage, vérification
Connexion SSH hors fenêtre de maintenanceToute connexionVérification avec la main courante
VPN prestataire ouvertPlus de 8 hPlus de 24 hFermeture, vérification
Temps de réponse p95 (prompt court)2 fois la référence mesurée4 foisVérifier charge, throttling
File d'attente llama-serverRequêtes en attente plus de 30 sPlus de 2 minCapacité insuffisante : voir Multi-utilisateurs
Dérive NTP1 s10 sVérifier la synchronisation
Erreurs 5xx1 % des requêtes5 %Journaux

Tableau de bord type

ZonePanneaux
En-têteÉtat global (vert/orange/rouge), dernière sauvegarde, version des composants, uptime
UtilisationUtilisateurs actifs (jour, semaine), requêtes par heure, tokens générés par jour, dossiers les plus consultés (agrégé, sans contenu)
PerformanceTTFT p50/p95, tokens/s moyen, slots occupés, file d'attente
RessourcesCPU, GPU, mémoire unifiée (part GPU/CPU), températures, puissance
StockageEspace par volume, état du miroir, SMART, croissance de l'index
SécuritéÉchecs d'authentification, sessions admin, ouvertures VPN prestataire, connexions sortantes par destination
SauvegardesHistorique 30 jours (succès/échec), durée, taille, dernier check

Les panneaux de la zone « Utilisation » ne montrent jamais le contenu des questions : uniquement des comptages.

Où tournent ces outils

Tout tourne sur la Box (containers dédiés, réseau interne, publication sur l'interface VPN seulement), sauf Uptime Kuma, hébergé chez le prestataire pour détecter une Box injoignable. Les alertes partent par mail ou messagerie vers le prestataire, et une sélection (disque, sauvegarde, service) vers le référent client. Rétention Prometheus : 90 jours (hypothèse).

Questions ouvertes

Ce qu'il reste à tester

Sources

  1. 1Prometheus — Overview (documentation officielle)Documentation officielleFiabilité hautePrometheus (CNCF) · publié 2026 · consulté le 16 sept. 2026 · fiche source
  2. 2prometheus/node_exporter — dépôt officielGitHubFiabilité hautePrometheus (CNCF) · publié 2026 · consulté le 16 sept. 2026 · fiche source
  3. 3llama.cpp — tools/server README (llama-server)GitHubFiabilité hauteggml-org / llama.cpp · publié 2026 · consulté le 16 sept. 2026 · fiche source
  4. 4Uptime Kuma — dépôt officielGitHubFiabilité hautelouislam / Uptime Kuma · publié 2026 · consulté le 16 sept. 2026 · fiche source
content/docs/monitoring/index.md1278 mots