Aller au contenu
Source

DeepSeek-V2 — Multi-head Latent Attention (arXiv 2405.04434)

MLA compresse le KV cache en un vecteur latent ; réduction de 93,3 % du KV cache par rapport à DeepSeek 67B.

Confirmée#kv-cache#deepseekPublié le 16 sept. 2026Mis à jour le 16 sept. 2026
Organisation
DeepSeek-AI
Type
Étude
Fiabilité
Fiabilité haute
Publié
2024-05
Consulté le
16 septembre 2026
Sujets
kv-cache, deepseek

Citée par 2 page(s)

Ce que dit la source

MLA compresse le KV cache en un vecteur latent ; réduction de 93,3 % du KV cache par rapport à DeepSeek 67B.

Ce qu'on en retient

Les modèles à MLA ont un KV cache très réduit : le calcul standard ne s'applique pas.

content/sources/deepseek-v2-mla-paper.md48 mots