Contexte partagé (prompt cache)
Réutilisation, entre plusieurs requêtes, du KV cache déjà calculé pour un préfixe commun (consignes système, début de conversation), afin d'éviter de retraiter les mêmes tokens.
Réutilisation, entre plusieurs requêtes, du KV cache déjà calculé pour un préfixe commun (consignes système, début de conversation), afin d'éviter de retraiter les mêmes tokens.
Quand toutes les requêtes commencent par les mêmes consignes système, le serveur peut calculer leur KV cache une fois et le réutiliser. Le TTFT des tours suivants d'une conversation en profite aussi, puisque l'historique n'est pas retraité.
llama-server gère un cache de prompt par slot ; l'affectation d'un utilisateur au même slot d'un tour à l'autre conditionne son efficacité. Point à mesurer sur la Box.