Aller au contenu
Source

llama.cpp — tools/server README (llama-server)

Documentation du serveur HTTP de llama.cpp : endpoints /health, /metrics, /slots, option --api-key.

ConfirméePublié le 16 sept. 2026Mis à jour le 16 sept. 2026À revérifier le 15 déc. 2026
Organisation
ggml-org / llama.cpp
Type
GitHub
Fiabilité
Fiabilité haute
Publié
2026
Consulté le
16 septembre 2026
Sujets
monitoring, llama-cpp, inference

Citée par 1 page(s)

Ce que dit la source

--metrics active un endpoint /metrics compatible Prometheus (tokens de prompt traités, débit moyen en tokens/s, tokens générés). /health renvoie 503 pendant le chargement du modèle, 200 quand il est prêt. /slots expose l'état des slots parallèles (désactivable par --no-slots). --api-key protège l'API par une ou plusieurs clés. --slot-save-path permet de sauvegarder et restaurer le cache de prompt d'un slot.

Ce qu'on en retient

Métriques d'inférence de la Box sans instrumentation supplémentaire ; /health sert de sonde de disponibilité ; l'API reste sur le réseau interne, clé requise.

Limites

Les noms exacts des métriques et leur stabilité entre versions ne sont pas garantis ; à relever sur la version déployée.

content/sources/llama-cpp-server-readme.md114 mots