Terme
llama-server
Serveur HTTP de llama.cpp qui charge un modèle GGUF et expose une API compatible OpenAI (chat, complétions, embeddings, reranking) avec traitement parallèle par slots.
Serveur HTTP de llama.cpp qui charge un modèle GGUF et expose une API compatible OpenAI (chat, complétions, embeddings, reranking) avec traitement parallèle par slots.
inférenceAussi : llama.cpp server, serveur llama.cpp
llama-server est le processus qui, dans la Box v1, sert le modèle de chat et, dans une seconde instance, les embeddings et le reranking. Ses options principales : le modèle, la taille de contexte, le nombre de slots, flash attention, la quantification du KV cache, le backend GPU.
Il expose des métriques pour Prometheus. Voir Box v1.