Aller au contenu
Terme

llama-server

Serveur HTTP de llama.cpp qui charge un modèle GGUF et expose une API compatible OpenAI (chat, complétions, embeddings, reranking) avec traitement parallèle par slots.

Confirmée#llama-cpp#multi-utilisateursPublié le 16 sept. 2026Mis à jour le 16 sept. 2026

Serveur HTTP de llama.cpp qui charge un modèle GGUF et expose une API compatible OpenAI (chat, complétions, embeddings, reranking) avec traitement parallèle par slots.

inférenceAussi : llama.cpp server, serveur llama.cpp

llama-server est le processus qui, dans la Box v1, sert le modèle de chat et, dans une seconde instance, les embeddings et le reranking. Ses options principales : le modèle, la taille de contexte, le nombre de slots, flash attention, la quantification du KV cache, le backend GPU.

Il expose des métriques pour Prometheus. Voir Box v1.

content/glossary/llama-server.md61 mots