llama.cpp — tools/server README (llama-server)
Documentation du serveur HTTP de llama.cpp : endpoints /health, /metrics, /slots, option --api-key.
- Organisation
- ggml-org / llama.cpp
- Type
- GitHub
- Fiabilité
- Fiabilité haute
- Publié
- 2026
- Consulté le
- 16 septembre 2026
- Sujets
- monitoring, llama-cpp, inference
Citée par 1 page(s)
Ce que dit la source
--metrics active un endpoint /metrics compatible Prometheus (tokens de prompt traités, débit moyen en tokens/s, tokens générés). /health renvoie 503 pendant le chargement du modèle, 200 quand il est prêt. /slots expose l'état des slots parallèles (désactivable par --no-slots). --api-key protège l'API par une ou plusieurs clés. --slot-save-path permet de sauvegarder et restaurer le cache de prompt d'un slot.
Ce qu'on en retient
Métriques d'inférence de la Box sans instrumentation supplémentaire ; /health sert de sonde de disponibilité ; l'API reste sur le réseau interne, clé requise.
Limites
Les noms exacts des métriques et leur stabilité entre versions ne sont pas garantis ; à relever sur la version déployée.