Slot (llama-server)
Dans llama-server, emplacement de traitement capable de servir une conversation à la fois ; le nombre de slots fixe le nombre de requêtes traitées en parallèle et partage la fenêtre de contexte totale entre elles.
Dans llama-server, emplacement de traitement capable de servir une conversation à la fois ; le nombre de slots fixe le nombre de requêtes traitées en parallèle et partage la fenêtre de contexte totale entre elles.
L'option -np N de llama-server crée N slots. Le contexte total -c est divisé entre eux : quatre slots avec un contexte total de 131 072 tokens donnent 32 768 tokens par slot.
Chaque slot a son propre KV cache, donc plus de slots signifie plus de mémoire réservée et une vitesse par utilisateur plus faible quand tous sont actifs. Le dimensionnement des slots répond à la question du nombre d'utilisateurs simultanés (Q-001).