Source
Qwen/Qwen3-235B-A22B-Instruct-2507 — fiche modèle
MoE 235 Md / 22 Md actifs, 94 couches, GQA 64/4, 128 experts (8 actifs), contexte 262 144 natif (1 010 000 étendu), Apache 2.0, outils via Qwen-Agent.
- Organisation
- Alibaba Qwen
- Type
- Documentation officielle
- Fiabilité
- Fiabilité haute
- Publié
- 2025-07
- Consulté le
- 16 septembre 2026
- Sujets
- qwen
Citée par 2 page(s)
KV cache : calcul et dimensionnementMulti-utilisateurs · Formule du KV cache, effet de GQA et MLA, quantification q8_0/q4_0, tableau d'estimations pour gpt-oss-120b, Qwen3-30B-A3B et Llama 70B à 8k/32k/128k, et impact du nombre de slots sur la mémoire.Qwen3-235B-A22B (Instruct-2507)Modèle · Plus gros MoE Qwen3 (235 Md, 22 Md actifs) : trop grand pour 128 Go en Q4 ; praticable en Q3 avec 16 à 17 t/s mesurés, au prix d'une forte quantification.
Ce que dit la source
MoE 235 Md / 22 Md actifs, 94 couches, GQA 64/4, 128 experts (8 actifs), contexte 262 144 natif (1 010 000 étendu), Apache 2.0, outils via Qwen-Agent et MCP.
Ce qu'on en retient
Trop grand pour 128 Go en Q4 ; envisageable en Q3 ou IQ2 avec perte.
Limites
Le résumé automatique HF indique « May 2025 » alors que le suffixe 2507 correspond à juillet 2025.