Source
DeepSeek-V2 — Multi-head Latent Attention (arXiv 2405.04434)
MLA compresse le KV cache en un vecteur latent ; réduction de 93,3 % du KV cache par rapport à DeepSeek 67B.
- Organisation
- DeepSeek-AI
- Type
- Étude
- Fiabilité
- Fiabilité haute
- Publié
- 2024-05
- Consulté le
- 16 septembre 2026
- Sujets
- kv-cache, deepseek
Citée par 2 page(s)
KV cache : calcul et dimensionnementMulti-utilisateurs · Formule du KV cache, effet de GQA et MLA, quantification q8_0/q4_0, tableau d'estimations pour gpt-oss-120b, Qwen3-30B-A3B et Llama 70B à 8k/32k/128k, et impact du nombre de slots sur la mémoire.DeepSeek R1 (et distillations)Modèle · MoE de 671 Md sous MIT : impraticable sur 128 Go à taille complète ; seules les distillations 32B et 70B sont exécutables (11,2 t/s mesurés pour Distill-Qwen-32B).
Ce que dit la source
MLA compresse le KV cache en un vecteur latent ; réduction de 93,3 % du KV cache par rapport à DeepSeek 67B.
Ce qu'on en retient
Les modèles à MLA ont un KV cache très réduit : le calcul standard ne s'applique pas.