Aller au contenu
Terme

Flash attention

Implémentation optimisée du calcul d'attention qui évite de matérialiser la matrice complète des scores en mémoire, réduisant l'empreinte mémoire et accélérant le traitement des longs contextes.

Confirmée#llama-cpp#kv-cachePublié le 16 sept. 2026Mis à jour le 16 sept. 2026

Implémentation optimisée du calcul d'attention qui évite de matérialiser la matrice complète des scores en mémoire, réduisant l'empreinte mémoire et accélérant le traitement des longs contextes.

inférenceAussi : FlashAttention, -fa

Dans llama.cpp, l'option -fa active flash attention. Elle est aussi nécessaire pour quantifier le KV cache. Plusieurs guides communautaires sur Strix Halo recommandent de l'activer pour la stabilité et la performance ; le support dépend du backend (Vulkan, ROCm) et de sa version.

Voir Inférence.

content/glossary/flash-attention.md47 mots