Source
meta-llama/Llama-3.3-70B-Instruct — fiche modèle
Dense 70 Md, 80 couches, 8 têtes KV (GQA), contexte 128k, Llama 3.3 Community License (seuil 700 M d'utilisateurs mensuels), tool calling ; langues :.
- Organisation
- Meta
- Type
- Documentation officielle
- Fiabilité
- Fiabilité haute
- Publié
- 2024-12-06
- Consulté le
- 16 septembre 2026
- Sujets
- llama
Citée par 3 page(s)
KV cache : calcul et dimensionnementMulti-utilisateurs · Formule du KV cache, effet de GQA et MLA, quantification q8_0/q4_0, tableau d'estimations pour gpt-oss-120b, Qwen3-30B-A3B et Llama 70B à 8k/32k/128k, et impact du nombre de slots sur la mémoire.Llama 3.3 70B InstructModèle · Dense Meta de 70 Md, français officiellement supporté, 42,5 Go en Q4 : la référence « gros modèle dense », bornée à environ 5 t/s par la bande passante de Strix Halo.Comparer la qualité en français des modèles candidatsExpérimentation · Évaluer en aveugle gpt-oss-120b, Qwen3-30B-A3B, Mistral Small 3.2 / 4, Gemma 3 27B, Llama 3.3 70B et les modèles européens sur des tâches juridiques françaises : rédaction, synthèse, citation fidèle, refus d'inventer.
Ce que dit la source
Dense 70 Md, 80 couches, 8 têtes KV (GQA), contexte 128k, Llama 3.3 Community License (seuil 700 M d'utilisateurs mensuels), tool calling ; langues : anglais, allemand, français, italien, portugais, hindi, espagnol, thaï.
Ce qu'on en retient
Français explicitement supporté ; licence restrictive mais praticable pour une PME.