Aller au contenu
Modèle

Qwen3-235B-A22B (Instruct-2507)

Plus gros MoE Qwen3 (235 Md, 22 Md actifs) : trop grand pour 128 Go en Q4 ; praticable en Q3 avec 16 à 17 t/s mesurés, au prix d'une forte quantification.

À vérifier#qwen#llama-cpp#strix-halo#benchmarkPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026À revérifier le 15 déc. 2026

Fiche modèle

Fournisseur
Alibaba Qwen
Famille
Qwen3
Paramètres
235 Md (22 Md actifs)
Architecture
Mixture of Experts
Contexte
256k tokens
Licence
Apache 2.0
Sortie
1 juillet 2025
Mémoire Q4Estimation
≈ 140 Go
Appel d'outils
Oui
Raisonnement
Non
Français
Correct
Quantifications
Q3_K_XL, Q3_K_M, IQ2
Usage recommandé
qualité maximale hors ligne (lots, nuit)
Hugging Face
fiche modèle

L'essentiel

  • MoE 235 Md / 22 Md actifs, 94 couches, GQA 64/4, 128 experts (8 actifs), contexte 262 144 natif, Apache 2.0 1.
  • Q4 estimé à environ 140 Go (235 Md × 0,55 octet, estimation) : ne tient pas dans 128 Go. Q3_K_XL ou Q3_K_M : praticable, 16 à 17 t/s mesurés.
  • Intérêt : qualité potentiellement supérieure à gpt-oss-120b ; coût : quantification agressive et mémoire presque saturée.

Pourquoi ce modèle nous intéresse

C'est le plus gros modèle ouvert « presque » exécutable sur la machine candidate. Il pose la question de la quantification (Q-003) : vaut-il mieux un 235B en 3 bits ou un 120B en 4 bits natifs ? La réponse n'est pas connue pour nos usages. Il sert aussi de borne haute pour le test de mémoire allouable (Q-011).

Caractéristiques

94 couches, 4 têtes KV, dim. tête 128, 128 experts dont 8 actifs, contexte 262 144 natif et 1 010 000 étendu, outils via Qwen-Agent et MCP 1. La version Instruct-2507 n'a pas de mode thinking.

Licence et usage commercial

Apache 2.0. La date de sortie du frontmatter (1er juillet 2025) est conventionnelle : le suffixe 2507 indique juillet 2025, alors que le résumé automatique de la fiche HF indique « May 2025 » (contradiction signalée, non tranchée).

Français

Multilingue ; pas de score français isolé.

Performances publiées sur Strix Halo

Génération (t/s)Prompt pp512 (t/s)ConditionsType
16,1Q3_K_XL, llama.cpp Vulkan, 2025 2indépendant
17,2101Q3_K_M, llama.cpp ROCm, février 2026 3indépendant

Le prompt processing à environ 100 t/s est faible : un dossier de 20 000 tokens demanderait plus de 3 minutes avant le premier token (estimation).

Mémoire et contexte

  • Poids : Q4 environ 140 Go (estimation, impossible) ; Q3 : taille exacte non relevée, compatible avec 128 Go d'après les mesures ci-dessus.
  • KV cache (estimation) : 2 × 94 × 4 × 128 × 2 = 192 512 octets par token en f16, soit environ 1,6 Go à 8k et 6,3 Go à 32k par slot. Avec les poids Q3, la marge pour plusieurs slots longs est très réduite.

Limites

  • Quantification 3 bits obligatoire : perte de qualité non mesurée sur nos tâches.
  • Prompt processing lent : inadapté à l'analyse interactive de longs dossiers.
  • Mémoire presque saturée : cohabitation impossible avec un second modèle de taille moyenne.

À tester

Comparaison qualité Q3 vs gpt-oss-120b sur des dossiers réels ; mémoire réellement allouable avec ce modèle chargé.

Sources

  1. 1Qwen/Qwen3-235B-A22B-Instruct-2507 — fiche modèleDocumentation officielleFiabilité hauteAlibaba Qwen · publié 2025-07 · consulté le 16 sept. 2026 · fiche source
  2. 2AMD Strix Halo (Ryzen AI Max+ 395) GPU Performance (llm-tracker)BenchmarkFiabilité hautellm-tracker.info · lhl · publié 2025-05-17 · consulté le 16 sept. 2026 · fiche source
  3. 3strix-halo-llm-perf (visorcraft)BenchmarkFiabilité moyenneGitHub (communauté) · visorcraft · publié 2026-02-16 (màj) · consulté le 16 sept. 2026 · fiche source
content/models/qwen3-235b-a22b.md416 mots