Tag
#llama
10 entrée(s) portent ce tag.
Modèles
2
Llama 3.3 70B InstructModèle · Dense Meta de 70 Md, français officiellement supporté, 42,5 Go en Q4 : la référence « gros modèle dense », bornée à environ 5 t/s par la bande passante de Strix Halo.16 sept. 2026Llama 4 Scout (109B-A17B)Modèle · MoE multimodal Meta de 109 Md (17 Md actifs), 19 à 20 t/s mesurés sur Strix Halo, mais licence excluant les entités domiciliées dans l'UE : écarté pour la Box.16 sept. 2026
Benchmarks
2
Llama 3.3 70B (Shisa V2) Q4_K_M — llama.cpp b5863 — 5,0 t/s (lhl, Framework Desktop)Benchmark · Un dense de 70 Md en Q4 sur le Framework Desktop : 5,0 t/s en génération et 94,7 t/s en prompt, exactement au plafond de bande passante.16 sept. 2026Llama 3.3 70B Q4_K_M — llama.cpp HIP ROCm 6.3+ — 5,1 t/s, contexte 64k (praveentechworld)Benchmark · Llama 3.3 70B Q4_K_M (42,5 Go) sous ROCm avec un contexte de 64k : 5,1 t/s, confirmant le plafond de bande passante un an après la première mesure.16 sept. 2026
Sources
4
bartowski/Llama-3.3-70B-Instruct-GGUFSource · Tailles GGUF : Q4_K_M 42,52 Go, Q5_K_M 49,95 Go, Q6_K 57,89 Go, Q8_0 74,98 Go.16 sept. 2026meta-llama/Llama-3.3-70B-Instruct — fiche modèleSource · Dense 70 Md, 80 couches, 8 têtes KV (GQA), contexte 128k, Llama 3.3 Community License (seuil 700 M d'utilisateurs mensuels), tool calling ; langues :.16 sept. 2026meta-llama/Llama-4-Scout-17B-16E-Instruct — fiche modèleSource · MoE multimodal 109 Md / 17 Md actifs, 16 experts, contexte 10 M, 12 langues dont le français, Llama 4 Community License ; clause excluant les personne.16 sept. 2026praveentechworld — AMD Strix Halo Local LLM Benchmarks: 128GB Unified Memory GuideSource · Bande passante effective environ 213 Go/s (« 75 à 80 % » d'un théorique annoncé à 273 Go/s) ; Llama 3.3 70B Q4_K_M (42,5 Go) 5,1 t/s en HIP ROCm 6.3+.16 sept. 2026