Source
NVIDIA — Mastering LLM Techniques: Inference Optimization
Formule du KV cache par token = 2 × couches × (têtes × dim_tête) × octets ; exemple Llama 2 7B 4096 tokens environ 2 Go ; prefill = matrice-matrice (c.
- Organisation
- NVIDIA
- Auteur
- S. Verma, N. Vaidya
- Type
- Article technique
- Fiabilité
- Fiabilité haute
- Publié
- 2023-11-17
- Consulté le
- 16 septembre 2026
- Sujets
- kv-cache, multi-utilisateurs
Citée par 2 page(s)
Multi-utilisateurs : servir 5 à 10 personnes sur une seule machineMulti-utilisateurs · Pourquoi une machine à 256 Go/s est bornée en génération, ce que le batching et les MoE y changent, ce que les mesures publiées disent, et ce qu'il reste à mesurer avant de promettre un nombre d'utilisateurs.KV cache : calcul et dimensionnementMulti-utilisateurs · Formule du KV cache, effet de GQA et MLA, quantification q8_0/q4_0, tableau d'estimations pour gpt-oss-120b, Qwen3-30B-A3B et Llama 70B à 8k/32k/128k, et impact du nombre de slots sur la mémoire.
Ce que dit la source
Formule du KV cache par token = 2 × couches × (têtes × dim_tête) × octets ; exemple Llama 2 7B 4096 tokens environ 2 Go ; prefill = matrice-matrice (compute-bound), décodage = matrice-vecteur (memory-bound) ; in-flight batching ; GQA/MQA réduisent le KV cache.
Ce qu'on en retient
Base théorique des pages KV cache et multi-utilisateurs.
Limites
Exemples sur GPU NVIDIA.