Aller au contenu
Modèle

Qwen3-32B

Dense Alibaba de 32,8 Md, Apache 2.0, contexte 32k natif : référence dense de taille moyenne, plus lente qu'un MoE mais avec un mode raisonnement.

À vérifier#qwen#llama-cppPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026À revérifier le 15 déc. 2026

Fiche modèle

Fournisseur
Alibaba Qwen
Famille
Qwen3
Paramètres
32,8 Md
Architecture
Dense
Contexte
32k tokens
Licence
Apache 2.0
Sortie
29 avril 2025
Mémoire Q4Estimation
≈ 20 Go
Mémoire Q8Estimation
≈ 35 Go
Appel d'outils
Oui
Raisonnement
Optionnel
Français
Correct
Quantifications
Q4_K_M, Q8_0
Usage recommandé
raisonnement sur documents courts, comparaison dense vs MoE
Hugging Face
fiche modèle

Pourquoi ce modèle nous intéresse

Modèle dense de 32,8 Md avec modes thinking / non-thinking, Apache 2.0, plus de 100 langues 1. Il sert de référence « dense de taille moyenne » face aux MoE : même ordre de mémoire que Qwen3-30B-A3B, mais dix fois plus de paramètres actifs, donc une génération bien plus lente et, en principe, une meilleure qualité par token.

Caractéristiques

64 couches, GQA 64/8, contexte 32 768 natif (131 072 avec YaRN), outils 1. Date de sortie : avril 2025 (jour du frontmatter conventionnel).

Licence et usage commercial

Apache 2.0.

Français

Plus de 100 langues annoncées ; pas de score français isolé.

Performances publiées sur Strix Halo

Non trouvé pour Qwen3-32B lui-même. Points de repère pour un dense de 27 à 32 Md en Q4 : DeepSeek-R1-Distill-Qwen-32B Q4_K_M (19,8 Go) 11,2 t/s 2 ; Qwen 3.6 27B dense Q4_K_XL 11,8 t/s (20,0 avec MTP) 3. Estimation cohérente : 212 Go/s ÷ 20 Go ≈ 10 t/s.

Mémoire et contexte

  • Poids : environ 20 Go en Q4, 35 Go en Q8 (estimation, non sourcée).
  • KV cache (estimation) : 2 × 64 × 8 × 128 × 2 = 262 144 octets par token en f16 ; environ 2,1 Go à 8k, 8,6 Go à 32k par slot. Trois fois plus que Qwen3-30B-A3B.

Limites

Contexte natif 32k (extension YaRN à vérifier sous llama.cpp) ; génération lente pour un usage multi-utilisateurs ; supplanté dans sa famille par Qwen3.5-27B.

À tester

Comparaison qualité / vitesse contre Qwen3-30B-A3B sur les mêmes prompts ; mode thinking en français.

Sources

  1. 1Qwen/Qwen3-32B — fiche modèleDocumentation officielleFiabilité hauteAlibaba Qwen · publié 2025-04 · consulté le 16 sept. 2026 · fiche source
  2. 2praveentechworld — AMD Strix Halo Local LLM Benchmarks: 128GB Unified Memory GuideBlogFiabilité faiblepraveentechworld.com · Praveen · publié 2026-09-09 · consulté le 16 sept. 2026 · fiche source
  3. 3The 2026 Strix Halo Ultimate Benchmark Suite (dev.to)BenchmarkFiabilité moyennedev.to · Agustin Sacco · publié 2026-05-31 · consulté le 16 sept. 2026 · fiche source
content/models/qwen3-32b.md255 mots