Aller au contenu
Source

Ollama — FAQ officielle

Variables OLLAMA_NUM_PARALLEL (défaut 1), OLLAMA_MAX_LOADED_MODELS (3 par GPU), OLLAMA_MAX_QUEUE (512), OLLAMA_CONTEXT_LENGTH (4096 par défaut), OLLAM.

Confirmée#ollama#multi-utilisateurs#kv-cachePublié le 16 sept. 2026Mis à jour le 16 sept. 2026
Organisation
Ollama
Type
Documentation officielle
Fiabilité
Fiabilité haute
Publié
2026
Consulté le
16 septembre 2026
Sujets
ollama, multi-utilisateurs, kv-cache

Citée par 3 page(s)

Ce que dit la source

Variables OLLAMA_NUM_PARALLEL (défaut 1), OLLAMA_MAX_LOADED_MODELS (3 par GPU), OLLAMA_MAX_QUEUE (512), OLLAMA_CONTEXT_LENGTH (4096 par défaut), OLLAMA_KV_CACHE_TYPE (q8_0 environ moitié de f16, q4_0 environ quart), OLLAMA_FLASH_ATTENTION. Les requêtes en attente sont traitées dans l'ordre.

Ce qu'on en retient

Ollama sait paralléliser, mais sert par défaut une requête à la fois et n'a pas de priorité de file.

Limites

Pas d'endpoint de métriques Prometheus documenté.

content/sources/ollama-faq.md67 mots