Tag
#qwen
34 entrée(s) portent ce tag.
Modèles
6
Qwen3-235B-A22B (Instruct-2507)Modèle · Plus gros MoE Qwen3 (235 Md, 22 Md actifs) : trop grand pour 128 Go en Q4 ; praticable en Q3 avec 16 à 17 t/s mesurés, au prix d'une forte quantification.16 sept. 2026Qwen3-30B-A3B (Instruct-2507)Modèle · MoE Alibaba de 30,5 Md (3,3 Md actifs), Apache 2.0, 18,6 Go en Q4 : le candidat « rapide » de la Box, mesuré entre 72 et 98 t/s sur Strix Halo.16 sept. 2026Qwen3-32BModèle · Dense Alibaba de 32,8 Md, Apache 2.0, contexte 32k natif : référence dense de taille moyenne, plus lente qu'un MoE mais avec un mode raisonnement.16 sept. 2026Qwen3.5 et suivants (3.6, 3.8)Modèle · Famille Qwen la plus récente (février à août 2026) : hybrides Gated DeltaNet + MoE, 201 langues, Apache 2.0 ; le 35B-A3B est le modèle des seules mesures multi-slots publiées sur Strix Halo.16 sept. 2026Qwen3-Embedding (0.6B / 4B / 8B)Modèle · Famille d'embeddings Alibaba (juin 2025), contexte 32k, dimensions réglables jusqu'à 4096, plus de 100 langues, Apache 2.0 : le 8B est le plus puissant mais le plus lourd à servir.16 sept. 2026Qwen3-Reranker (0.6B / 4B / 8B)Modèle · Famille de rerankers Alibaba (juin 2025), contexte 32k, plus de 100 langues, Apache 2.0 : plus puissante que bge-reranker mais plus coûteuse par passage.16 sept. 2026
Benchmarks
10
Qwen3-30B-A3B Q4 — llama.cpp b5863 — 72,0 t/s (lhl, Framework Desktop)Benchmark · Premier point de la série Qwen3-30B-A3B sur le Framework Desktop : 72,0 t/s en génération et 604,8 t/s en prompt, mi-2025.16 sept. 2026Qwen3-235B-A22B Q3_K_M — llama.cpp ROCm — 17,2 t/s, pp 101 t/s (visorcraft)Benchmark · Le plus gros MoE Qwen3 en 3 bits sur Strix Halo : 17,2 t/s en génération mais seulement 101 t/s en prompt.16 sept. 2026Qwen3-Coder-30B-A3B Q4_K_S — llama.cpp ROCm — 73,7 t/s, pp 1 345 t/s (Soothill)Benchmark · Comparatif Vulkan vs ROCm de Soothill : côté ROCm, 73,7 t/s en génération mais 1 345 t/s en prompt, le meilleur prefill de la série.16 sept. 2026Qwen3-Coder-30B-A3B Q4_K_S — llama.cpp Vulkan — 97,7 t/s (Soothill)Benchmark · Comparatif Vulkan vs ROCm de Soothill : côté Vulkan, 97,7 t/s en génération et 1 115 t/s en prompt sur Qwen3-Coder-30B-A3B Q4_K_S.16 sept. 2026Qwen3.5-122B-A10B Q4_K_XL — llama.cpp b10333 ROCm 7.14 — 13,6 t/s, TTFT 1,78 s (Soothill)Benchmark · Côté llama.cpp du comparatif vLLM / SGLang / llama.cpp : 13,6 t/s à 1 client, 17,9 t/s agrégés à 2 clients, TTFT 1,775 s sur un MoE de 122 Md.16 sept. 2026Qwen3.5-122B-A10B GPTQ — vLLM 0.26.0 ROCm 7.14 — 10,3 t/s, TTFT 1,06 s (Soothill)Benchmark · Côté vLLM du comparatif : 10,3 t/s à 1 client, 16,2 t/s agrégés à 2 clients, TTFT 1,056 s ; plus lent en génération mais 40 % plus rapide au premier token que llama.cpp.16 sept. 2026Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 1 — 59,2 t/s, TTFT 117 ms (hogeheer)Benchmark · Point de référence à 1 slot de la seule courbe de montée en charge publiée sur Strix Halo : 59,2 t/s et 117 ms de TTFT.16 sept. 2026Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 16 — 10,4 t/s par utilisateur, 166 agrégés (hogeheer)Benchmark · À 16 slots, l'agrégé plafonne (166 t/s, +2,5 % par rapport à 8 slots) et chaque utilisateur tombe à 10,4 t/s avec 547 ms de TTFT.16 sept. 2026Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 4 — 32,7 t/s par utilisateur, 130,8 agrégés (hogeheer)Benchmark · À 4 slots, chaque utilisateur reçoit 32,7 t/s (130,8 t/s agrégés, 2,2 fois le mono) avec un TTFT de 237 ms.16 sept. 2026Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 8 — 20,3 t/s par utilisateur, 162 agrégés (hogeheer)Benchmark · À 8 slots, 20,3 t/s par utilisateur et 162 t/s agrégés (2,7 fois le mono), TTFT 307 ms : le point d'équilibre retenu par l'auteur.16 sept. 2026
Expérimentations
3
Montée en charge de 1 à 10 utilisateurs : gpt-oss-120b et Qwen3-30B-A3BExpérimentation · Mesurer le débit par utilisateur, l'agrégé et le TTFT p95 à 1, 2, 3, 5 et 10 clients simultanés avec des prompts français courts, RAG et dossiers, pour remplir la matrice de capacité.16 sept. 2026Comparer la qualité en français des modèles candidatsExpérimentation · Évaluer en aveugle gpt-oss-120b, Qwen3-30B-A3B, Mistral Small 3.2 / 4, Gemma 3 27B, Llama 3.3 70B et les modèles européens sur des tâches juridiques françaises : rédaction, synthèse, citation fidèle, refus d'inventer.16 sept. 2026Comparer Vulkan/RADV et ROCm/HIP dans llama.cppExpérimentation · Mesurer sur nos modèles cibles et nos longueurs de prompt RAG le débit de prompt processing et de génération des deux backends GPU de llama.cpp, pour trancher Q-008.16 sept. 2026
Questions
2
Quelle quantification retenir pour le modèle principal ?Question · Arbitrage entre qualité (Q8/MXFP4 natif), mémoire disponible pour le KV cache multi-utilisateur et vitesse.16 sept. 2026Quel modèle principal pour le cabinet d'avocats ?Question · gpt-oss-120b est le candidat par défaut (MoE, Apache 2.0, 61 Go) ; Qwen3 235B-A22B et les Mistral récents sont à comparer sur des tâches juridiques en français.16 sept. 2026
Sources
8
Qwen/Qwen3-235B-A22B-Instruct-2507 — fiche modèleSource · MoE 235 Md / 22 Md actifs, 94 couches, GQA 64/4, 128 experts (8 actifs), contexte 262 144 natif (1 010 000 étendu), Apache 2.0, outils via Qwen-Agent.16 sept. 2026Qwen/Qwen3-30B-A3B-Instruct-2507 — fiche modèleSource · MoE 30,5 Md / 3,3 Md actifs, 48 couches, GQA 32/4, 128 experts (8 actifs), contexte 262 144 natif, Apache 2.0, outils.16 sept. 2026Qwen/Qwen3-32B — fiche modèleSource · Dense 32,8 Md, 64 couches, GQA 64/8, contexte 32 768 natif (131 072 avec YaRN), Apache 2.0, plus de 100 langues, modes thinking / non-thinking.16 sept. 2026Qwen/Qwen3.5-122B-A10B — fiche modèleSource · Hybride Gated DeltaNet + MoE, 122 Md / 10 Md actifs, 48 couches, 256 experts (8+1), contexte 262 144 natif, Apache 2.0, « 201 languages and dialects ».16 sept. 2026Qwen/Qwen3.5-27B — fiche modèleSource · Dense 27 Md, 64 couches, GQA 24/4, contexte 262 144, Apache 2.0.16 sept. 2026Qwen/Qwen3.5-35B-A3B — fiche modèleSource · Hybride Gated DeltaNet + MoE, 35 Md / 3 Md actifs, 40 couches, contexte 262 144, Apache 2.0, 201 langues.16 sept. 2026QwenLM/Qwen3.8 — dépôt GitHubSource · Qwen3.8 : 27B dense et 2.4T-A95B, contexte 262 144, tool-call-parser qwen3_coder, 201 langues héritées de Qwen3.5.16 sept. 2026unsloth/Qwen3-30B-A3B-Instruct-2507-GGUFSource · Tailles GGUF : Q4_K_M 18,6 Go, UD-Q4_K_XL 17,7 Go, Q6_K 25,1 Go, Q8_0 32,5 Go.16 sept. 2026
Glossaire
4
Function calling (appel d'outils)Terme · Capacité d'un modèle à produire, au lieu d'une réponse en texte libre, un appel structuré à une fonction externe (recherche, calcul, requête) dont le résultat lui est ensuite renvoyé.16 sept. 2026LLM (grand modèle de langage)Terme · Réseau de neurones entraîné sur de très grands volumes de texte pour prédire le token suivant, capable de comprendre et de produire du langage naturel.16 sept. 2026MoE (mélange d'experts)Terme · Architecture de modèle dans laquelle chaque token n'active qu'une petite partie des paramètres (quelques « experts » choisis par un routeur), ce qui réduit le calcul et la lecture mémoire par token.16 sept. 2026Paramètres actifsTerme · Nombre de paramètres effectivement utilisés pour traiter un token dans un modèle à mélange d'experts, par opposition au nombre total de paramètres stockés.16 sept. 2026