MoE (mélange d'experts)
Architecture de modèle dans laquelle chaque token n'active qu'une petite partie des paramètres (quelques « experts » choisis par un routeur), ce qui réduit le calcul et la lecture mémoire par token.
Architecture de modèle dans laquelle chaque token n'active qu'une petite partie des paramètres (quelques « experts » choisis par un routeur), ce qui réduit le calcul et la lecture mémoire par token.
Un modèle MoE stocke tous ses experts en mémoire mais n'en utilise que quelques-uns par token. Il combine la connaissance d'un grand modèle avec la vitesse d'un petit.
C'est l'architecture la mieux adaptée à une machine comme le Framework Desktop : beaucoup de mémoire mais une bande passante limitée. Un MoE de plus de 100 milliards de paramètres avec quelques milliards de paramètres actifs génère bien plus vite qu'un modèle dense de 70 milliards.