Aller au contenu
Modèle

Llama 3.3 70B Instruct

Dense Meta de 70 Md, français officiellement supporté, 42,5 Go en Q4 : la référence « gros modèle dense », bornée à environ 5 t/s par la bande passante de Strix Halo.

À vérifier#llama#llama-cpp#strix-halo#benchmark#kv-cachePublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026À revérifier le 15 déc. 2026

Fiche modèle

Fournisseur
Meta
Famille
Llama 3
Paramètres
70 Md
Architecture
Dense
Contexte
128k tokens
Licence
Llama 3.3 Community License
Sortie
6 décembre 2024
Mémoire Q4Estimation
≈ 43 Go
Mémoire Q8Estimation
≈ 75 Go
Appel d'outils
Oui
Raisonnement
Non
Français
Bon
Quantifications
Q4_K_M, Q5_K_M, Q6_K, Q8_0
Usage recommandé
référence qualité dense, traitements par lots hors ligne
Hugging Face
fiche modèle

L'essentiel

  • Dense 70 Md, 80 couches, 8 têtes KV (GQA), contexte 128k ; le français fait partie des huit langues officiellement supportées 1.
  • 42,5 Go en Q4_K_M 2 : tient en mémoire, mais chaque token lit ces 42,5 Go.
  • Génération mesurée à 4,7 à 5,1 t/s sur Strix Halo, quel que soit le backend : c'est la bande passante qui borne.
  • Rôle dans le dossier : référence pour comprendre pourquoi un dense de 70 Md est inadapté au multi-utilisateurs interactif sur cette machine.

Pourquoi ce modèle nous intéresse

Il illustre la limite fondamentale de la machine candidate. À 212 Go/s mesurés 6, lire 42,5 Go de poids par token donne un plafond d'environ 5,0 t/s (estimation) ; les mesures publiées sont exactement là. Un utilisateur attend donc environ 3 minutes pour une réponse de 800 tokens ; à trois utilisateurs simultanés, le débit agrégé peut monter (les poids sont lus une fois par pas pour tous les slots), mais le débit par utilisateur ne dépassera pas ce plafond. C'est le contre-exemple des MoE.

Il reste intéressant comme référence de qualité en français, et pour des traitements par lots nocturnes (résumés de dossiers) où la latence n'importe pas.

Caractéristiques

CaractéristiqueValeur
Paramètres70 Md dense
Couches / têtes KV / dim. tête80 / 8 / 128
Contexte128k
Languesanglais, allemand, français, italien, portugais, hindi, espagnol, thaï
Outilstool calling via le chat template

Licence et usage commercial

Llama 3.3 Community License 1 : licence propre à Meta, pas une licence open source au sens strict. Usage commercial autorisé sous un seuil de 700 millions d'utilisateurs mensuels, avec obligations d'attribution et politique d'usage acceptable. Contrairement à Llama 4, aucune exclusion de l'Union européenne n'a été relevée pour Llama 3.3 dans cette recherche ; à confirmer par lecture du texte de licence avant tout déploiement commercial.

Français

Explicitement supporté 1. Qualité juridique française non mesurée.

Performances publiées sur Strix Halo

Génération (t/s)Prompt pp512 (t/s)ConditionsType
5,0 (tg128)94,7Shisa V2 70B (fine-tune de Llama 3.3 70B) Q4_K_M, llama.cpp b5863, Framework Desktop, juillet 2025 3indépendant
5,1Llama 3.3 70B Q4_K_M, HIP ROCm 6.3+, contexte 64k, septembre 2026 4communauté
4,7 à 4,922 à 80Llama 3.1 70B Q4_K_M, Ollama Vulkan RADV, Beelink GTR9 Pro 5communauté

Trois sources, trois stacks, même résultat : la génération est bornée par la mémoire. Aucune mesure multi-utilisateurs trouvée pour un 70B dense sur Strix Halo.

Mémoire et contexte

  • Poids : Q4_K_M 42,52 Go ; Q5_K_M 49,95 ; Q6_K 57,89 ; Q8_0 74,98 Go 2.
  • KV cache (estimation) : 2 × 80 × 8 × 128 × 2 = 327 680 octets par token en f16 ; environ 2,7 Go à 8k, 10,7 Go à 32k, 42,9 Go à 128k par slot. En q8_0 : 5,4 Go à 32k. Trois slots à 32k en q8_0 : environ 16 Go, en plus des 42,5 Go de poids.

Limites

  • 5 t/s par utilisateur : trop lent pour un usage conversationnel.
  • Prompt processing de l'ordre de 95 t/s : un dossier de 20 000 tokens demande plus de 3 minutes de TTFT (estimation).
  • Licence restrictive à relire.

À tester

Uniquement comme référence de qualité : comparaison en aveugle contre gpt-oss-120b sur 10 questions juridiques françaises ; mesure llama-bench pour confirmer le plafond sur notre machine.

Sources

  1. 1meta-llama/Llama-3.3-70B-Instruct — fiche modèleDocumentation officielleFiabilité hauteMeta · publié 2024-12-06 · consulté le 16 sept. 2026 · fiche source
  2. 2bartowski/Llama-3.3-70B-Instruct-GGUFAutreFiabilité moyennebartowski · publié 2024-12 · consulté le 16 sept. 2026 · fiche source
  3. 3Strix Halo (Ryzen AI Max+ 395) LLM Benchmark Results (Level1Techs, lhl)BenchmarkFiabilité moyenneLevel1Techs Forums · lhl · publié 2025-07-22 (màj 2025-08-31) · consulté le 16 sept. 2026 · fiche source
  4. 4praveentechworld — AMD Strix Halo Local LLM Benchmarks: 128GB Unified Memory GuideBlogFiabilité faiblepraveentechworld.com · Praveen · publié 2026-09-09 · consulté le 16 sept. 2026 · fiche source
  5. 5strix-halo-guide (README + BENCHMARKS.md)GitHubFiabilité moyenneGitHub (communauté) · hogeheer499 · publié 2026-03 → 2026-08-30 · consulté le 16 sept. 2026 · fiche source
  6. 6AMD Strix Halo (Ryzen AI Max+ 395) GPU Performance (llm-tracker)BenchmarkFiabilité hautellm-tracker.info · lhl · publié 2025-05-17 · consulté le 16 sept. 2026 · fiche source
content/models/llama-3-3-70b.md575 mots