Aller au contenu
Terme

Contexte partagé (prompt cache)

Réutilisation, entre plusieurs requêtes, du KV cache déjà calculé pour un préfixe commun (consignes système, début de conversation), afin d'éviter de retraiter les mêmes tokens.

Confirmée#kv-cache#multi-utilisateursPublié le 16 sept. 2026Mis à jour le 16 sept. 2026

Réutilisation, entre plusieurs requêtes, du KV cache déjà calculé pour un préfixe commun (consignes système, début de conversation), afin d'éviter de retraiter les mêmes tokens.

inférenceAussi : prompt caching, cache de préfixe, prefix cache

Quand toutes les requêtes commencent par les mêmes consignes système, le serveur peut calculer leur KV cache une fois et le réutiliser. Le TTFT des tours suivants d'une conversation en profite aussi, puisque l'historique n'est pas retraité.

llama-server gère un cache de prompt par slot ; l'affectation d'un utilisateur au même slot d'un tour à l'autre conditionne son efficacité. Point à mesurer sur la Box.

content/glossary/contexte-partage.md65 mots