Aller au contenu
Modèle

Llama 4 Scout (109B-A17B)

MoE multimodal Meta de 109 Md (17 Md actifs), 19 à 20 t/s mesurés sur Strix Halo, mais licence excluant les entités domiciliées dans l'UE : écarté pour la Box.

Confirmée#llama#llama-cpp#strix-halo#rgpdPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026À revérifier le 15 déc. 2026

Fiche modèle

Fournisseur
Meta
Famille
Llama 4
Paramètres
109 Md (17 Md actifs)
Architecture
Mixture of Experts
Contexte
10 000k tokens
Licence
Llama 4 Community License (clause UE)
Sortie
5 avril 2025
Mémoire Q4Estimation
≈ 60 Go
Appel d'outils
Oui
Raisonnement
Non
Français
Bon
Quantifications
Q4_K_XL
Hugging Face
fiche modèle

Pourquoi ce modèle nous intéresse (et pourquoi il est écarté)

Techniquement, Scout est un bon candidat : MoE 109 Md / 17 Md actifs, 16 experts, multimodal, 12 langues dont le français, contexte annoncé de 10 millions de tokens 1. Mesuré à 19,3 t/s en Q4_K_XL (HIP) sur Framework Desktop 2.

Caractéristiques

MoE 109 Md total, 17 Md actifs, 16 experts ; Maverick (400 Md, 128 experts) est hors de portée de 128 Go. Contexte 10 M (Scout) : valeur annoncée par Meta, jamais testée ici ; le champ contextK du frontmatter reprend cette annonce.

Licence et usage commercial

Voir le callout ci-dessus. Seuil de 700 M d'utilisateurs mensuels par ailleurs, comme Llama 3.

Français

Explicitement supporté (12 langues).

Performances publiées sur Strix Halo

19,3 t/s en Q4_K_XL, HIP, llama.cpp b5863, juillet 2025 2. La recherche matérielle relève aussi 20,2 t/s tg / 102,6 pp512 en Vulkan (mai 2025, même auteur).

Mémoire et contexte

Environ 60 Go en Q4 (estimation, non sourcée). KV cache : paramètres d'architecture non relevés.

Limites

Licence bloquante pour l'UE. Aucune autre analyse n'a été poussée.

À tester

Rien tant que la licence n'évolue pas. Surveiller la clause UE lors de la revérification.

content/models/llama-4-scout.md279 mots