Qwen3-235B-A22B (Instruct-2507)
Plus gros MoE Qwen3 (235 Md, 22 Md actifs) : trop grand pour 128 Go en Q4 ; praticable en Q3 avec 16 à 17 t/s mesurés, au prix d'une forte quantification.
Fiche modèle
- Fournisseur
- Alibaba Qwen
- Famille
- Qwen3
- Paramètres
- 235 Md (22 Md actifs)
- Architecture
- Mixture of Experts
- Contexte
- 256k tokens
- Licence
- Apache 2.0
- Sortie
- 1 juillet 2025
- Mémoire Q4Estimation
- ≈ 140 Go
- Appel d'outils
- Oui
- Raisonnement
- Non
- Français
- Correct
- Quantifications
- Q3_K_XL, Q3_K_M, IQ2
- Usage recommandé
- qualité maximale hors ligne (lots, nuit)
- Hugging Face
- fiche modèle
L'essentiel
- MoE 235 Md / 22 Md actifs, 94 couches, GQA 64/4, 128 experts (8 actifs), contexte 262 144 natif, Apache 2.0 1.
- Q4 estimé à environ 140 Go (235 Md × 0,55 octet, estimation) : ne tient pas dans 128 Go. Q3_K_XL ou Q3_K_M : praticable, 16 à 17 t/s mesurés.
- Intérêt : qualité potentiellement supérieure à gpt-oss-120b ; coût : quantification agressive et mémoire presque saturée.
Pourquoi ce modèle nous intéresse
C'est le plus gros modèle ouvert « presque » exécutable sur la machine candidate. Il pose la question de la quantification (Q-003) : vaut-il mieux un 235B en 3 bits ou un 120B en 4 bits natifs ? La réponse n'est pas connue pour nos usages. Il sert aussi de borne haute pour le test de mémoire allouable (Q-011).
Caractéristiques
94 couches, 4 têtes KV, dim. tête 128, 128 experts dont 8 actifs, contexte 262 144 natif et 1 010 000 étendu, outils via Qwen-Agent et MCP 1. La version Instruct-2507 n'a pas de mode thinking.
Licence et usage commercial
Apache 2.0. La date de sortie du frontmatter (1er juillet 2025) est conventionnelle : le suffixe 2507 indique juillet 2025, alors que le résumé automatique de la fiche HF indique « May 2025 » (contradiction signalée, non tranchée).
Français
Multilingue ; pas de score français isolé.
Performances publiées sur Strix Halo
| Génération (t/s) | Prompt pp512 (t/s) | Conditions | Type |
|---|---|---|---|
| 16,1 | — | Q3_K_XL, llama.cpp Vulkan, 2025 2 | indépendant |
| 17,2 | 101 | Q3_K_M, llama.cpp ROCm, février 2026 3 | indépendant |
Le prompt processing à environ 100 t/s est faible : un dossier de 20 000 tokens demanderait plus de 3 minutes avant le premier token (estimation).
Mémoire et contexte
- Poids : Q4 environ 140 Go (estimation, impossible) ; Q3 : taille exacte non relevée, compatible avec 128 Go d'après les mesures ci-dessus.
- KV cache (estimation) : 2 × 94 × 4 × 128 × 2 = 192 512 octets par token en f16, soit environ 1,6 Go à 8k et 6,3 Go à 32k par slot. Avec les poids Q3, la marge pour plusieurs slots longs est très réduite.
Limites
- Quantification 3 bits obligatoire : perte de qualité non mesurée sur nos tâches.
- Prompt processing lent : inadapté à l'analyse interactive de longs dossiers.
- Mémoire presque saturée : cohabitation impossible avec un second modèle de taille moyenne.
À tester
Comparaison qualité Q3 vs gpt-oss-120b sur des dossiers réels ; mémoire réellement allouable avec ce modèle chargé.
Sources
- 1Qwen/Qwen3-235B-A22B-Instruct-2507 — fiche modèleDocumentation officielleFiabilité hauteAlibaba Qwen · publié 2025-07 · consulté le 16 sept. 2026 · fiche source
- 2AMD Strix Halo (Ryzen AI Max+ 395) GPU Performance (llm-tracker)BenchmarkFiabilité hautellm-tracker.info · lhl · publié 2025-05-17 · consulté le 16 sept. 2026 · fiche source
- 3strix-halo-llm-perf (visorcraft)BenchmarkFiabilité moyenneGitHub (communauté) · visorcraft · publié 2026-02-16 (màj) · consulté le 16 sept. 2026 · fiche source