Qwen3-32B
Dense Alibaba de 32,8 Md, Apache 2.0, contexte 32k natif : référence dense de taille moyenne, plus lente qu'un MoE mais avec un mode raisonnement.
Fiche modèle
- Fournisseur
- Alibaba Qwen
- Famille
- Qwen3
- Paramètres
- 32,8 Md
- Architecture
- Dense
- Contexte
- 32k tokens
- Licence
- Apache 2.0
- Sortie
- 29 avril 2025
- Mémoire Q4Estimation
- ≈ 20 Go
- Mémoire Q8Estimation
- ≈ 35 Go
- Appel d'outils
- Oui
- Raisonnement
- Optionnel
- Français
- Correct
- Quantifications
- Q4_K_M, Q8_0
- Usage recommandé
- raisonnement sur documents courts, comparaison dense vs MoE
- Hugging Face
- fiche modèle
Pourquoi ce modèle nous intéresse
Modèle dense de 32,8 Md avec modes thinking / non-thinking, Apache 2.0, plus de 100 langues 1. Il sert de référence « dense de taille moyenne » face aux MoE : même ordre de mémoire que Qwen3-30B-A3B, mais dix fois plus de paramètres actifs, donc une génération bien plus lente et, en principe, une meilleure qualité par token.
Caractéristiques
64 couches, GQA 64/8, contexte 32 768 natif (131 072 avec YaRN), outils 1. Date de sortie : avril 2025 (jour du frontmatter conventionnel).
Licence et usage commercial
Apache 2.0.
Français
Plus de 100 langues annoncées ; pas de score français isolé.
Performances publiées sur Strix Halo
Non trouvé pour Qwen3-32B lui-même. Points de repère pour un dense de 27 à 32 Md en Q4 : DeepSeek-R1-Distill-Qwen-32B Q4_K_M (19,8 Go) 11,2 t/s 2 ; Qwen 3.6 27B dense Q4_K_XL 11,8 t/s (20,0 avec MTP) 3. Estimation cohérente : 212 Go/s ÷ 20 Go ≈ 10 t/s.
Mémoire et contexte
- Poids : environ 20 Go en Q4, 35 Go en Q8 (estimation, non sourcée).
- KV cache (estimation) : 2 × 64 × 8 × 128 × 2 = 262 144 octets par token en f16 ; environ 2,1 Go à 8k, 8,6 Go à 32k par slot. Trois fois plus que Qwen3-30B-A3B.
Limites
Contexte natif 32k (extension YaRN à vérifier sous llama.cpp) ; génération lente pour un usage multi-utilisateurs ; supplanté dans sa famille par Qwen3.5-27B.
À tester
Comparaison qualité / vitesse contre Qwen3-30B-A3B sur les mêmes prompts ; mode thinking en français.
Sources
- 1Qwen/Qwen3-32B — fiche modèleDocumentation officielleFiabilité hauteAlibaba Qwen · publié 2025-04 · consulté le 16 sept. 2026 · fiche source
- 2praveentechworld — AMD Strix Halo Local LLM Benchmarks: 128GB Unified Memory GuideBlogFiabilité faiblepraveentechworld.com · Praveen · publié 2026-09-09 · consulté le 16 sept. 2026 · fiche source
- 3The 2026 Strix Halo Ultimate Benchmark Suite (dev.to)BenchmarkFiabilité moyennedev.to · Agustin Sacco · publié 2026-05-31 · consulté le 16 sept. 2026 · fiche source