Note
Les modèles denses 70B tournent à ~5 tok/s sur Strix Halo
Trois sources indépendantes 2025-2026 convergent : Llama 3.3 70B Q4_K_M ≈ 4,7 à 5,1 tok/s. Trop lent pour un assistant interactif.
Confirmée#llama#benchmark#strix-halo#multi-utilisateursPublié le 16 sept. 2026Mis à jour le 16 sept. 2026
- Statut
- Triée
- Catégorie
- modeles
Conséquence : la Box s'appuie sur des MoE (gpt-oss-120b ≈ 50 tok/s, Qwen3-30B-A3B ≈ 85 tok/s) plutôt que sur des denses de 70 Md. Le calcul bande passante / poids actifs explique l'écart.