Source
bartowski/Llama-3.3-70B-Instruct-GGUF
Tailles GGUF : Q4_K_M 42,52 Go, Q5_K_M 49,95 Go, Q6_K 57,89 Go, Q8_0 74,98 Go.
- Organisation
- bartowski
- Type
- Autre
- Fiabilité
- Fiabilité moyenne
- Publié
- 2024-12
- Consulté le
- 16 septembre 2026
- Sujets
- llama, gguf
Citée par 3 page(s)
Multi-utilisateurs : servir 5 à 10 personnes sur une seule machineMulti-utilisateurs · Pourquoi une machine à 256 Go/s est bornée en génération, ce que le batching et les MoE y changent, ce que les mesures publiées disent, et ce qu'il reste à mesurer avant de promettre un nombre d'utilisateurs.KV cache : calcul et dimensionnementMulti-utilisateurs · Formule du KV cache, effet de GQA et MLA, quantification q8_0/q4_0, tableau d'estimations pour gpt-oss-120b, Qwen3-30B-A3B et Llama 70B à 8k/32k/128k, et impact du nombre de slots sur la mémoire.Llama 3.3 70B InstructModèle · Dense Meta de 70 Md, français officiellement supporté, 42,5 Go en Q4 : la référence « gros modèle dense », bornée à environ 5 t/s par la bande passante de Strix Halo.
Ce que dit la source
Tailles GGUF : Q4_K_M 42,52 Go, Q5_K_M 49,95 Go, Q6_K 57,89 Go, Q8_0 74,98 Go.
Ce qu'on en retient
Empreinte mémoire d'un 70B dense en Q4 : 42,5 Go, soit environ 5 t/s à 212 Go/s.
Limites
Dépôt tiers.