Aller au contenu
Note

Les modèles denses 70B tournent à ~5 tok/s sur Strix Halo

Trois sources indépendantes 2025-2026 convergent : Llama 3.3 70B Q4_K_M ≈ 4,7 à 5,1 tok/s. Trop lent pour un assistant interactif.

Confirmée#llama#benchmark#strix-halo#multi-utilisateursPublié le 16 sept. 2026Mis à jour le 16 sept. 2026
Statut
Triée
Catégorie
modeles

Conséquence : la Box s'appuie sur des MoE (gpt-oss-120b ≈ 50 tok/s, Qwen3-30B-A3B ≈ 85 tok/s) plutôt que sur des denses de 70 Md. Le calcul bande passante / poids actifs explique l'écart.

content/notes/2026-09-16-llama-70b-dense-inutilisable.md33 mots