Source
unsloth/Qwen3-30B-A3B-Instruct-2507-GGUF
Tailles GGUF : Q4_K_M 18,6 Go, UD-Q4_K_XL 17,7 Go, Q6_K 25,1 Go, Q8_0 32,5 Go.
- Organisation
- Unsloth
- Type
- Autre
- Fiabilité
- Fiabilité moyenne
- Publié
- 2025
- Consulté le
- 16 septembre 2026
- Sujets
- qwen, gguf
Citée par 2 page(s)
KV cache : calcul et dimensionnementMulti-utilisateurs · Formule du KV cache, effet de GQA et MLA, quantification q8_0/q4_0, tableau d'estimations pour gpt-oss-120b, Qwen3-30B-A3B et Llama 70B à 8k/32k/128k, et impact du nombre de slots sur la mémoire.Qwen3-30B-A3B (Instruct-2507)Modèle · MoE Alibaba de 30,5 Md (3,3 Md actifs), Apache 2.0, 18,6 Go en Q4 : le candidat « rapide » de la Box, mesuré entre 72 et 98 t/s sur Strix Halo.
Ce que dit la source
Tailles GGUF : Q4_K_M 18,6 Go, UD-Q4_K_XL 17,7 Go, Q6_K 25,1 Go, Q8_0 32,5 Go.
Ce qu'on en retient
Empreinte mémoire de référence pour la fiche Qwen3-30B-A3B.
Limites
Dépôt tiers.