Terme
Flash attention
Implémentation optimisée du calcul d'attention qui évite de matérialiser la matrice complète des scores en mémoire, réduisant l'empreinte mémoire et accélérant le traitement des longs contextes.
Implémentation optimisée du calcul d'attention qui évite de matérialiser la matrice complète des scores en mémoire, réduisant l'empreinte mémoire et accélérant le traitement des longs contextes.
inférenceAussi : FlashAttention, -fa
Dans llama.cpp, l'option -fa active flash attention. Elle est aussi nécessaire pour quantifier le KV cache. Plusieurs guides communautaires sur Strix Halo recommandent de l'activer pour la stabilité et la performance ; le support dépend du backend (Vulkan, ROCm) et de sa version.
Voir Inférence.