Qwen3-30B-A3B (Instruct-2507)
MoE Alibaba de 30,5 Md (3,3 Md actifs), Apache 2.0, 18,6 Go en Q4 : le candidat « rapide » de la Box, mesuré entre 72 et 98 t/s sur Strix Halo.
Fiche modèle
- Fournisseur
- Alibaba Qwen
- Famille
- Qwen3
- Paramètres
- 30,5 Md (3,3 Md actifs)
- Architecture
- Mixture of Experts
- Contexte
- 256k tokens
- Licence
- Apache 2.0
- Sortie
- 1 juillet 2025
- Mémoire Q4Estimation
- ≈ 19 Go
- Mémoire Q8Estimation
- ≈ 33 Go
- Appel d'outils
- Oui
- Raisonnement
- Non
- Français
- Correct
- Quantifications
- Q4_K_M, UD-Q4_K_XL, Q6_K, Q8_0
- Usage recommandé
- réponses rapides, multi-utilisateurs, reformulation de requêtes RAG
- Hugging Face
- fiche modèle
L'essentiel
- MoE 30,5 Md / 3,3 Md actifs, 48 couches, GQA 32/4, 128 experts dont 8 actifs, contexte 262 144 natif, Apache 2.0 1.
- 18,6 Go en Q4_K_M 2 : il laisse plus de 100 Go pour le KV cache, les embeddings et le reste.
- Mesuré entre 72 et 98 t/s en génération sur Strix Halo, avec un prompt processing de 600 à 1 390 t/s selon le backend.
- C'est le modèle le plus adapté aux scénarios multi-utilisateurs chargés, au prix d'une qualité inférieure aux modèles de 100 Md et plus (hypothèse à vérifier).
Pourquoi ce modèle nous intéresse
Avec 3,3 Md de paramètres actifs, la génération lit environ 2 Go de poids par token (estimation) : le plafond théorique à 212 Go/s dépasse 100 t/s, et les mesures publiées sont cohérentes (72 à 98 t/s). Son KV cache est le plus petit du catalogue (4 têtes KV, 48 couches) : c'est le modèle qui supporte le plus de slots à contexte long pour une mémoire donnée. Il est aussi le seul dont la montée en charge multi-clients a été chiffrée sur Strix Halo, via sa version 3.6-35B-A3B (voir Multi-utilisateurs).
La date de sortie indiquée dans le frontmatter (1er juillet 2025) est une convention : la fiche porte le suffixe 2507 (juillet 2025) sans jour précis 1.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Paramètres | 30,5 Md total, 3,3 Md actifs |
| Couches / têtes KV / dim. tête | 48 / 4 / 128 |
| Experts | 128, 8 actifs |
| Contexte | 262 144 natif |
| Outils | oui (function calling, Qwen-Agent) |
| Raisonnement | version Instruct sans mode thinking (la version Thinking-2507 existe séparément) |
Licence et usage commercial
Apache 2.0 1. Aucune restriction connue.
Français
Multilingue (évalué sur MMLU-ProX) ; aucun score français isolé publié 1. Appréciation « ok » du frontmatter = hypothèse, à confirmer par nos tests.
Performances publiées sur Strix Halo
| Génération (t/s) | Prompt pp512 (t/s) | Conditions | Type |
|---|---|---|---|
| 72,0 | 604,8 | Q4, llama.cpp b5863, Framework Desktop, juillet 2025 3 | indépendant |
| 86,1 | 1 142 | Q4_K_M, llama.cpp ROCm, février 2026 6 | indépendant |
| 97,7 (Vulkan) / 73,7 (ROCm) | 1 115 (Vulkan) / 1 345 (ROCm) | Qwen3-Coder-30B-A3B Q4_K_S, llama.cpp b10085/b10216, août 2026 4 | indépendant |
| 98,5 | 1 387,2 | Qwen3-Coder-30B-A3B Q4_K_S, Vulkan RADV b9179, Beelink GTR9 Pro 7 | communauté |
| 72 à 98 (fourchette) | — | ROCm 7.2.4 avec flags de build optimisés 5 | indépendant |
Les lignes « Coder » concernent une variante spécialisée de même architecture : ordre de grandeur transposable, pas une mesure de la version Instruct.
Mémoire et contexte
- Poids : Q4_K_M 18,6 Go ; UD-Q4_K_XL 17,7 ; Q6_K 25,1 ; Q8_0 32,5 Go 2. Le Q8_0 tient largement : c'est le seul candidat pour lequel on peut se passer de quantification agressive.
- KV cache (estimation) : 2 × 48 × 4 × 128 × 2 = 98 304 octets par token en f16, soit environ 0,8 Go à 8k, 3,2 Go à 32k, 12,9 Go à 128k par slot. 8 slots à 32k en f16 : environ 26 Go.
Limites
- Qualité attendue inférieure à gpt-oss-120b sur les tâches d'analyse longue (hypothèse ; à mesurer).
- Pas de mode raisonnement dans la version Instruct.
- Famille en évolution rapide : Qwen3.5 puis 3.6 et 3.8 (voir Qwen3.5 et suivants) ; la fiche 2507 peut être dépassée d'ici la mise en production.
À tester
- Montée en charge
-np 1, 2, 4, 8avecllama-batched-benchpuis charge HTTP réelle (expérimentation). - Qualité française et fidélité de citation face à gpt-oss-120b sur les mêmes dossiers.
- Q8_0 vs Q4_K_M : différence de qualité perceptible ou non.
Sources
- 1Qwen/Qwen3-30B-A3B-Instruct-2507 — fiche modèleDocumentation officielleFiabilité hauteAlibaba Qwen · publié 2025-07 · consulté le 16 sept. 2026 · fiche source
- 2unsloth/Qwen3-30B-A3B-Instruct-2507-GGUFAutreFiabilité moyenneUnsloth · publié 2025 · consulté le 16 sept. 2026 · fiche source
- 3Strix Halo (Ryzen AI Max+ 395) LLM Benchmark Results (Level1Techs, lhl)BenchmarkFiabilité moyenneLevel1Techs Forums · lhl · publié 2025-07-22 (màj 2025-08-31) · consulté le 16 sept. 2026 · fiche source
- 4llama.cpp: Vulkan vs ROCm on Strix Halo (Soothill)BenchmarkFiabilité moyennesoothill.io · Darren Soothill · publié 2026-08-03 · consulté le 16 sept. 2026 · fiche source
- 5I tuned llama.cpp on a Strix Halo mini-PC — why « Vulkan beats ROCm » is a myth (Medium)BlogFiabilité faibleMedium · Bkpaine · publié 2026-07 · consulté le 16 sept. 2026 · fiche source
- 6strix-halo-llm-perf (visorcraft)BenchmarkFiabilité moyenneGitHub (communauté) · visorcraft · publié 2026-02-16 (màj) · consulté le 16 sept. 2026 · fiche source
- 7strix-halo-guide (README + BENCHMARKS.md)GitHubFiabilité moyenneGitHub (communauté) · hogeheer499 · publié 2026-03 → 2026-08-30 · consulté le 16 sept. 2026 · fiche source