KV cache
Mémoire dans laquelle le modèle conserve, pour chaque token déjà traité, les clés et valeurs de l'attention afin de ne pas les recalculer à chaque nouveau token généré.
Mémoire dans laquelle le modèle conserve, pour chaque token déjà traité, les clés et valeurs de l'attention afin de ne pas les recalculer à chaque nouveau token généré.
Sans KV cache, générer chaque token imposerait de retraiter tout le contexte. Le cache rend la génération rapide, mais sa taille croît linéairement avec le nombre de tokens en contexte et avec le nombre de conversations servies en parallèle.
Sur une machine à mémoire unifiée, le KV cache se paie sur les mêmes 128 Go que les poids du modèle : c'est le second poste du budget mémoire. Son empreinte par token dépend fortement de l'architecture du modèle (attention groupée, fenêtre glissante). Il peut être quantifié (q8_0) pour diviser son empreinte.
Voir Multi-utilisateurs et Box v1.