Aller au contenu
Source

llama.cpp — README de llama-server (tools/server)

Documentation de référence de llama-server : options -np, -c, --kv-unified, -cb, --cache-type-k/v, -fa, --metrics, --slots ; endpoints /v1/chat/comple.

Confirmée#llama-cpp#multi-utilisateurs#kv-cachePublié le 16 sept. 2026Mis à jour le 16 sept. 2026
Organisation
ggml-org
Type
GitHub
Fiabilité
Fiabilité haute
Publié
2026 (master)
Consulté le
16 septembre 2026
Sujets
llama-cpp, multi-utilisateurs, kv-cache

Citée par 9 page(s)

Méthodologie de benchmark reproductibleBenchmarks · Protocole du laboratoire : llama-bench, llama-batched-bench, vllm bench serve et autres outils de charge, métriques standard, prompts de référence, grille 1/2/3/5/10 utilisateurs, conditions à consigner et pièges.Inférence : panorama des moteursInférence · Comparaison des moteurs de serving (llama-server, Ollama, LM Studio, vLLM, SGLang, Lemonade) pour un Strix Halo sous Linux, et recommandation initiale prudente : llama-server d'abord, vLLM à évaluer.llama.cpp et llama-serverInférence · Le moteur de départ de la Box : slots, contexte partagé, KV cache quantifié, flash attention, métriques Prometheus, images Docker ROCm/Vulkan et flags connus pour gfx1151.Dimensionner la Box pour un cabinetMulti-utilisateurs · Méthode pour passer d'un profil d'usage (requêtes courtes, analyses de dossiers longs) à un choix de modèle, de slots et de contexte, avec trois scénarios et la liste de ce qu'il faudra mesurer.Multi-utilisateurs : servir 5 à 10 personnes sur une seule machineMulti-utilisateurs · Pourquoi une machine à 256 Go/s est bornée en génération, ce que le batching et les MoE y changent, ce que les mesures publiées disent, et ce qu'il reste à mesurer avant de promettre un nombre d'utilisateurs.KV cache : calcul et dimensionnementMulti-utilisateurs · Formule du KV cache, effet de GQA et MLA, quantification q8_0/q4_0, tableau d'estimations pour gpt-oss-120b, Qwen3-30B-A3B et Llama 70B à 8k/32k/128k, et impact du nombre de slots sur la mémoire.bge-m3 (embeddings)Modèle · Embedding multilingue BAAI de 568 M de paramètres, dimension 1024, contexte 8192, MIT : le candidat par défaut pour le RAG de la Box.bge-reranker-v2-m3 (reranker)Modèle · Reranker multilingue BAAI construit sur bge-m3, Apache 2.0 : le candidat par défaut pour réordonner les passages avant le LLM.Montée en charge de 1 à 10 utilisateurs : gpt-oss-120b et Qwen3-30B-A3BExpérimentation · Mesurer le débit par utilisateur, l'agrégé et le TTFT p95 à 1, 2, 3, 5 et 10 clients simultanés avec des prompts français courts, RAG et dossiers, pour remplir la matrice de capacité.

Ce que dit la source

Documentation de référence de llama-server : options -np, -c, --kv-unified, -cb, --cache-type-k/v, -fa, --metrics, --slots ; endpoints /v1/chat/completions, /v1/embeddings, /rerank, /health, /slots, /metrics ; images Docker ghcr.io/ggml-org/llama.cpp:server, server-rocm, server-vulkan.

Ce qu'on en retient

Source primaire pour les slots, le batching continu et le KV cache de llama-server. Aucune option de priorité de file d'attente n'y est documentée.

Limites

Document vivant (branche master) : les valeurs par défaut changent d'une version à l'autre. Vérifier avec la version déployée.

content/sources/ggml-llama-server-readme.md82 mots