Aller au contenu
Tag

#kv-cache

21 entrée(s) portent ce tag.

Sources

7

Databricks — LLM Inference Performance Engineering: Best PracticesSource · Définitions TTFT, TPOT, latence = TTFT + TPOT × tokens ; débit = tokens de sortie par seconde tous utilisateurs ; MBU = bande passante atteinte / band.DeepSeek-V2 — Multi-head Latent Attention (arXiv 2405.04434)Source · MLA compresse le KV cache en un vecteur latent ; réduction de 93,3 % du KV cache par rapport à DeepSeek 67B.llama.cpp — README de llama-batched-benchSource · Outil de mesure multi-séquences : options -npp, -ntg, -npl, -pps ; deux modes (prompt partagé ou non) ; colonnes PP, TG, B, N_KV, T_PP, S_PP, T_TG, S_.llama.cpp — README de llama-server (tools/server)Source · Documentation de référence de llama-server : options -np, -c, --kv-unified, -cb, --cache-type-k/v, -fa, --metrics, --slots ; endpoints /v1/chat/comple.Hugging Face — Welcome GPT OSSSource · Architecture gpt-oss-120b : 36 couches, 64 têtes Q / 8 têtes KV, dim tête 64, attention alternée dense / fenêtre glissante 128, RoPE 128K.NVIDIA — Mastering LLM Techniques: Inference OptimizationSource · Formule du KV cache par token = 2 × couches × (têtes × dim_tête) × octets ; exemple Llama 2 7B 4096 tokens environ 2 Go ; prefill = matrice-matrice (c.Ollama — FAQ officielleSource · Variables OLLAMA_NUM_PARALLEL (défaut 1), OLLAMA_MAX_LOADED_MODELS (3 par GPU), OLLAMA_MAX_QUEUE (512), OLLAMA_CONTEXT_LENGTH (4096 par défaut), OLLAM.