Llama 3.3 70B Instruct
Dense Meta de 70 Md, français officiellement supporté, 42,5 Go en Q4 : la référence « gros modèle dense », bornée à environ 5 t/s par la bande passante de Strix Halo.
Fiche modèle
- Fournisseur
- Meta
- Famille
- Llama 3
- Paramètres
- 70 Md
- Architecture
- Dense
- Contexte
- 128k tokens
- Licence
- Llama 3.3 Community License
- Sortie
- 6 décembre 2024
- Mémoire Q4Estimation
- ≈ 43 Go
- Mémoire Q8Estimation
- ≈ 75 Go
- Appel d'outils
- Oui
- Raisonnement
- Non
- Français
- Bon
- Quantifications
- Q4_K_M, Q5_K_M, Q6_K, Q8_0
- Usage recommandé
- référence qualité dense, traitements par lots hors ligne
- Hugging Face
- fiche modèle
L'essentiel
- Dense 70 Md, 80 couches, 8 têtes KV (GQA), contexte 128k ; le français fait partie des huit langues officiellement supportées 1.
- 42,5 Go en Q4_K_M 2 : tient en mémoire, mais chaque token lit ces 42,5 Go.
- Génération mesurée à 4,7 à 5,1 t/s sur Strix Halo, quel que soit le backend : c'est la bande passante qui borne.
- Rôle dans le dossier : référence pour comprendre pourquoi un dense de 70 Md est inadapté au multi-utilisateurs interactif sur cette machine.
Pourquoi ce modèle nous intéresse
Il illustre la limite fondamentale de la machine candidate. À 212 Go/s mesurés 6, lire 42,5 Go de poids par token donne un plafond d'environ 5,0 t/s (estimation) ; les mesures publiées sont exactement là. Un utilisateur attend donc environ 3 minutes pour une réponse de 800 tokens ; à trois utilisateurs simultanés, le débit agrégé peut monter (les poids sont lus une fois par pas pour tous les slots), mais le débit par utilisateur ne dépassera pas ce plafond. C'est le contre-exemple des MoE.
Il reste intéressant comme référence de qualité en français, et pour des traitements par lots nocturnes (résumés de dossiers) où la latence n'importe pas.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Paramètres | 70 Md dense |
| Couches / têtes KV / dim. tête | 80 / 8 / 128 |
| Contexte | 128k |
| Langues | anglais, allemand, français, italien, portugais, hindi, espagnol, thaï |
| Outils | tool calling via le chat template |
Licence et usage commercial
Llama 3.3 Community License 1 : licence propre à Meta, pas une licence open source au sens strict. Usage commercial autorisé sous un seuil de 700 millions d'utilisateurs mensuels, avec obligations d'attribution et politique d'usage acceptable. Contrairement à Llama 4, aucune exclusion de l'Union européenne n'a été relevée pour Llama 3.3 dans cette recherche ; à confirmer par lecture du texte de licence avant tout déploiement commercial.
Français
Explicitement supporté 1. Qualité juridique française non mesurée.
Performances publiées sur Strix Halo
| Génération (t/s) | Prompt pp512 (t/s) | Conditions | Type |
|---|---|---|---|
| 5,0 (tg128) | 94,7 | Shisa V2 70B (fine-tune de Llama 3.3 70B) Q4_K_M, llama.cpp b5863, Framework Desktop, juillet 2025 3 | indépendant |
| 5,1 | — | Llama 3.3 70B Q4_K_M, HIP ROCm 6.3+, contexte 64k, septembre 2026 4 | communauté |
| 4,7 à 4,9 | 22 à 80 | Llama 3.1 70B Q4_K_M, Ollama Vulkan RADV, Beelink GTR9 Pro 5 | communauté |
Trois sources, trois stacks, même résultat : la génération est bornée par la mémoire. Aucune mesure multi-utilisateurs trouvée pour un 70B dense sur Strix Halo.
Mémoire et contexte
- Poids : Q4_K_M 42,52 Go ; Q5_K_M 49,95 ; Q6_K 57,89 ; Q8_0 74,98 Go 2.
- KV cache (estimation) : 2 × 80 × 8 × 128 × 2 = 327 680 octets par token en f16 ; environ 2,7 Go à 8k, 10,7 Go à 32k, 42,9 Go à 128k par slot. En q8_0 : 5,4 Go à 32k. Trois slots à 32k en q8_0 : environ 16 Go, en plus des 42,5 Go de poids.
Limites
- 5 t/s par utilisateur : trop lent pour un usage conversationnel.
- Prompt processing de l'ordre de 95 t/s : un dossier de 20 000 tokens demande plus de 3 minutes de TTFT (estimation).
- Licence restrictive à relire.
À tester
Uniquement comme référence de qualité : comparaison en aveugle contre gpt-oss-120b sur 10 questions juridiques françaises ; mesure llama-bench pour confirmer le plafond sur notre machine.
Sources
- 1meta-llama/Llama-3.3-70B-Instruct — fiche modèleDocumentation officielleFiabilité hauteMeta · publié 2024-12-06 · consulté le 16 sept. 2026 · fiche source
- 2bartowski/Llama-3.3-70B-Instruct-GGUFAutreFiabilité moyennebartowski · publié 2024-12 · consulté le 16 sept. 2026 · fiche source
- 3Strix Halo (Ryzen AI Max+ 395) LLM Benchmark Results (Level1Techs, lhl)BenchmarkFiabilité moyenneLevel1Techs Forums · lhl · publié 2025-07-22 (màj 2025-08-31) · consulté le 16 sept. 2026 · fiche source
- 4praveentechworld — AMD Strix Halo Local LLM Benchmarks: 128GB Unified Memory GuideBlogFiabilité faiblepraveentechworld.com · Praveen · publié 2026-09-09 · consulté le 16 sept. 2026 · fiche source
- 5strix-halo-guide (README + BENCHMARKS.md)GitHubFiabilité moyenneGitHub (communauté) · hogeheer499 · publié 2026-03 → 2026-08-30 · consulté le 16 sept. 2026 · fiche source
- 6AMD Strix Halo (Ryzen AI Max+ 395) GPU Performance (llm-tracker)BenchmarkFiabilité hautellm-tracker.info · lhl · publié 2025-05-17 · consulté le 16 sept. 2026 · fiche source