Aller au contenu
Terme

KV cache

Mémoire dans laquelle le modèle conserve, pour chaque token déjà traité, les clés et valeurs de l'attention afin de ne pas les recalculer à chaque nouveau token généré.

Confirmée#kv-cache#multi-utilisateursPublié le 16 sept. 2026Mis à jour le 16 sept. 2026

Mémoire dans laquelle le modèle conserve, pour chaque token déjà traité, les clés et valeurs de l'attention afin de ne pas les recalculer à chaque nouveau token généré.

inférenceAussi : cache clé-valeur, KV-cache

Sans KV cache, générer chaque token imposerait de retraiter tout le contexte. Le cache rend la génération rapide, mais sa taille croît linéairement avec le nombre de tokens en contexte et avec le nombre de conversations servies en parallèle.

Sur une machine à mémoire unifiée, le KV cache se paie sur les mêmes 128 Go que les poids du modèle : c'est le second poste du budget mémoire. Son empreinte par token dépend fortement de l'architecture du modèle (attention groupée, fenêtre glissante). Il peut être quantifié (q8_0) pour diviser son empreinte.

Voir Multi-utilisateurs et Box v1.

content/glossary/kv-cache.md96 mots