Source
Qwen/Qwen3-30B-A3B-Instruct-2507 — fiche modèle
MoE 30,5 Md / 3,3 Md actifs, 48 couches, GQA 32/4, 128 experts (8 actifs), contexte 262 144 natif, Apache 2.0, outils.
- Organisation
- Alibaba Qwen
- Type
- Documentation officielle
- Fiabilité
- Fiabilité haute
- Publié
- 2025-07
- Consulté le
- 16 septembre 2026
- Sujets
- qwen
Citée par 3 page(s)
Multi-utilisateurs : servir 5 à 10 personnes sur une seule machineMulti-utilisateurs · Pourquoi une machine à 256 Go/s est bornée en génération, ce que le batching et les MoE y changent, ce que les mesures publiées disent, et ce qu'il reste à mesurer avant de promettre un nombre d'utilisateurs.KV cache : calcul et dimensionnementMulti-utilisateurs · Formule du KV cache, effet de GQA et MLA, quantification q8_0/q4_0, tableau d'estimations pour gpt-oss-120b, Qwen3-30B-A3B et Llama 70B à 8k/32k/128k, et impact du nombre de slots sur la mémoire.Qwen3-30B-A3B (Instruct-2507)Modèle · MoE Alibaba de 30,5 Md (3,3 Md actifs), Apache 2.0, 18,6 Go en Q4 : le candidat « rapide » de la Box, mesuré entre 72 et 98 t/s sur Strix Halo.
Ce que dit la source
MoE 30,5 Md / 3,3 Md actifs, 48 couches, GQA 32/4, 128 experts (8 actifs), contexte 262 144 natif, Apache 2.0, outils.
Ce qu'on en retient
Candidat « rapide » : peu de paramètres actifs, KV cache réduit.
Limites
Pas de score français isolé.