Source
Ollama — FAQ officielle
Variables OLLAMA_NUM_PARALLEL (défaut 1), OLLAMA_MAX_LOADED_MODELS (3 par GPU), OLLAMA_MAX_QUEUE (512), OLLAMA_CONTEXT_LENGTH (4096 par défaut), OLLAM.
- Organisation
- Ollama
- Type
- Documentation officielle
- Fiabilité
- Fiabilité haute
- Publié
- 2026
- Consulté le
- 16 septembre 2026
- Sujets
- ollama, multi-utilisateurs, kv-cache
Citée par 3 page(s)
Inférence : panorama des moteursInférence · Comparaison des moteurs de serving (llama-server, Ollama, LM Studio, vLLM, SGLang, Lemonade) pour un Strix Halo sous Linux, et recommandation initiale prudente : llama-server d'abord, vLLM à évaluer.Ollama, LM Studio, Lemonade : les moteurs « faciles »Inférence · Trois surcouches de llama.cpp orientées simplicité : variables de parallélisme d'Ollama, requêtes concurrentes de LM Studio, Lemonade porté par AMD ; limites pour un serveur multi-utilisateurs.KV cache : calcul et dimensionnementMulti-utilisateurs · Formule du KV cache, effet de GQA et MLA, quantification q8_0/q4_0, tableau d'estimations pour gpt-oss-120b, Qwen3-30B-A3B et Llama 70B à 8k/32k/128k, et impact du nombre de slots sur la mémoire.
Ce que dit la source
Variables OLLAMA_NUM_PARALLEL (défaut 1), OLLAMA_MAX_LOADED_MODELS (3 par GPU), OLLAMA_MAX_QUEUE (512), OLLAMA_CONTEXT_LENGTH (4096 par défaut), OLLAMA_KV_CACHE_TYPE (q8_0 environ moitié de f16, q4_0 environ quart), OLLAMA_FLASH_ATTENTION. Les requêtes en attente sont traitées dans l'ordre.
Ce qu'on en retient
Ollama sait paralléliser, mais sert par défaut une requête à la fois et n'a pas de priorité de file.
Limites
Pas d'endpoint de métriques Prometheus documenté.