Aller au contenu
Source

NVIDIA — Mastering LLM Techniques: Inference Optimization

Formule du KV cache par token = 2 × couches × (têtes × dim_tête) × octets ; exemple Llama 2 7B 4096 tokens environ 2 Go ; prefill = matrice-matrice (c.

Confirmée#kv-cache#multi-utilisateursPublié le 16 sept. 2026Mis à jour le 16 sept. 2026
Organisation
NVIDIA
Auteur
S. Verma, N. Vaidya
Type
Article technique
Fiabilité
Fiabilité haute
Publié
2023-11-17
Consulté le
16 septembre 2026
Sujets
kv-cache, multi-utilisateurs

Citée par 2 page(s)

Ce que dit la source

Formule du KV cache par token = 2 × couches × (têtes × dim_tête) × octets ; exemple Llama 2 7B 4096 tokens environ 2 Go ; prefill = matrice-matrice (compute-bound), décodage = matrice-vecteur (memory-bound) ; in-flight batching ; GQA/MQA réduisent le KV cache.

Ce qu'on en retient

Base théorique des pages KV cache et multi-utilisateurs.

Limites

Exemples sur GPU NVIDIA.

content/sources/nvidia-llm-inference-optimization.md66 mots