Aller au contenu
Modèle

Qwen3-30B-A3B (Instruct-2507)

MoE Alibaba de 30,5 Md (3,3 Md actifs), Apache 2.0, 18,6 Go en Q4 : le candidat « rapide » de la Box, mesuré entre 72 et 98 t/s sur Strix Halo.

À vérifier#qwen#llama-cpp#strix-halo#benchmark#multi-utilisateursPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026À revérifier le 15 déc. 2026

Fiche modèle

Fournisseur
Alibaba Qwen
Famille
Qwen3
Paramètres
30,5 Md (3,3 Md actifs)
Architecture
Mixture of Experts
Contexte
256k tokens
Licence
Apache 2.0
Sortie
1 juillet 2025
Mémoire Q4Estimation
≈ 19 Go
Mémoire Q8Estimation
≈ 33 Go
Appel d'outils
Oui
Raisonnement
Non
Français
Correct
Quantifications
Q4_K_M, UD-Q4_K_XL, Q6_K, Q8_0
Usage recommandé
réponses rapides, multi-utilisateurs, reformulation de requêtes RAG
Hugging Face
fiche modèle

L'essentiel

  • MoE 30,5 Md / 3,3 Md actifs, 48 couches, GQA 32/4, 128 experts dont 8 actifs, contexte 262 144 natif, Apache 2.0 1.
  • 18,6 Go en Q4_K_M 2 : il laisse plus de 100 Go pour le KV cache, les embeddings et le reste.
  • Mesuré entre 72 et 98 t/s en génération sur Strix Halo, avec un prompt processing de 600 à 1 390 t/s selon le backend.
  • C'est le modèle le plus adapté aux scénarios multi-utilisateurs chargés, au prix d'une qualité inférieure aux modèles de 100 Md et plus (hypothèse à vérifier).

Pourquoi ce modèle nous intéresse

Avec 3,3 Md de paramètres actifs, la génération lit environ 2 Go de poids par token (estimation) : le plafond théorique à 212 Go/s dépasse 100 t/s, et les mesures publiées sont cohérentes (72 à 98 t/s). Son KV cache est le plus petit du catalogue (4 têtes KV, 48 couches) : c'est le modèle qui supporte le plus de slots à contexte long pour une mémoire donnée. Il est aussi le seul dont la montée en charge multi-clients a été chiffrée sur Strix Halo, via sa version 3.6-35B-A3B (voir Multi-utilisateurs).

La date de sortie indiquée dans le frontmatter (1er juillet 2025) est une convention : la fiche porte le suffixe 2507 (juillet 2025) sans jour précis 1.

Caractéristiques

CaractéristiqueValeur
Paramètres30,5 Md total, 3,3 Md actifs
Couches / têtes KV / dim. tête48 / 4 / 128
Experts128, 8 actifs
Contexte262 144 natif
Outilsoui (function calling, Qwen-Agent)
Raisonnementversion Instruct sans mode thinking (la version Thinking-2507 existe séparément)

Licence et usage commercial

Apache 2.0 1. Aucune restriction connue.

Français

Multilingue (évalué sur MMLU-ProX) ; aucun score français isolé publié 1. Appréciation « ok » du frontmatter = hypothèse, à confirmer par nos tests.

Performances publiées sur Strix Halo

Génération (t/s)Prompt pp512 (t/s)ConditionsType
72,0604,8Q4, llama.cpp b5863, Framework Desktop, juillet 2025 3indépendant
86,11 142Q4_K_M, llama.cpp ROCm, février 2026 6indépendant
97,7 (Vulkan) / 73,7 (ROCm)1 115 (Vulkan) / 1 345 (ROCm)Qwen3-Coder-30B-A3B Q4_K_S, llama.cpp b10085/b10216, août 2026 4indépendant
98,51 387,2Qwen3-Coder-30B-A3B Q4_K_S, Vulkan RADV b9179, Beelink GTR9 Pro 7communauté
72 à 98 (fourchette)ROCm 7.2.4 avec flags de build optimisés 5indépendant

Les lignes « Coder » concernent une variante spécialisée de même architecture : ordre de grandeur transposable, pas une mesure de la version Instruct.

Mémoire et contexte

  • Poids : Q4_K_M 18,6 Go ; UD-Q4_K_XL 17,7 ; Q6_K 25,1 ; Q8_0 32,5 Go 2. Le Q8_0 tient largement : c'est le seul candidat pour lequel on peut se passer de quantification agressive.
  • KV cache (estimation) : 2 × 48 × 4 × 128 × 2 = 98 304 octets par token en f16, soit environ 0,8 Go à 8k, 3,2 Go à 32k, 12,9 Go à 128k par slot. 8 slots à 32k en f16 : environ 26 Go.

Limites

  • Qualité attendue inférieure à gpt-oss-120b sur les tâches d'analyse longue (hypothèse ; à mesurer).
  • Pas de mode raisonnement dans la version Instruct.
  • Famille en évolution rapide : Qwen3.5 puis 3.6 et 3.8 (voir Qwen3.5 et suivants) ; la fiche 2507 peut être dépassée d'ici la mise en production.

À tester

  • Montée en charge -np 1, 2, 4, 8 avec llama-batched-bench puis charge HTTP réelle (expérimentation).
  • Qualité française et fidélité de citation face à gpt-oss-120b sur les mêmes dossiers.
  • Q8_0 vs Q4_K_M : différence de qualité perceptible ou non.

Sources

  1. 1Qwen/Qwen3-30B-A3B-Instruct-2507 — fiche modèleDocumentation officielleFiabilité hauteAlibaba Qwen · publié 2025-07 · consulté le 16 sept. 2026 · fiche source
  2. 2unsloth/Qwen3-30B-A3B-Instruct-2507-GGUFAutreFiabilité moyenneUnsloth · publié 2025 · consulté le 16 sept. 2026 · fiche source
  3. 3Strix Halo (Ryzen AI Max+ 395) LLM Benchmark Results (Level1Techs, lhl)BenchmarkFiabilité moyenneLevel1Techs Forums · lhl · publié 2025-07-22 (màj 2025-08-31) · consulté le 16 sept. 2026 · fiche source
  4. 4llama.cpp: Vulkan vs ROCm on Strix Halo (Soothill)BenchmarkFiabilité moyennesoothill.io · Darren Soothill · publié 2026-08-03 · consulté le 16 sept. 2026 · fiche source
  5. 5I tuned llama.cpp on a Strix Halo mini-PC — why « Vulkan beats ROCm » is a myth (Medium)BlogFiabilité faibleMedium · Bkpaine · publié 2026-07 · consulté le 16 sept. 2026 · fiche source
  6. 6strix-halo-llm-perf (visorcraft)BenchmarkFiabilité moyenneGitHub (communauté) · visorcraft · publié 2026-02-16 (màj) · consulté le 16 sept. 2026 · fiche source
  7. 7strix-halo-guide (README + BENCHMARKS.md)GitHubFiabilité moyenneGitHub (communauté) · hogeheer499 · publié 2026-03 → 2026-08-30 · consulté le 16 sept. 2026 · fiche source
content/models/qwen3-30b-a3b.md649 mots