Aller au contenu
Tag

#qwen

34 entrée(s) portent ce tag.

Benchmarks

10

Qwen3-30B-A3B Q4 — llama.cpp b5863 — 72,0 t/s (lhl, Framework Desktop)Benchmark · Premier point de la série Qwen3-30B-A3B sur le Framework Desktop : 72,0 t/s en génération et 604,8 t/s en prompt, mi-2025.Qwen3-235B-A22B Q3_K_M — llama.cpp ROCm — 17,2 t/s, pp 101 t/s (visorcraft)Benchmark · Le plus gros MoE Qwen3 en 3 bits sur Strix Halo : 17,2 t/s en génération mais seulement 101 t/s en prompt.Qwen3-Coder-30B-A3B Q4_K_S — llama.cpp ROCm — 73,7 t/s, pp 1 345 t/s (Soothill)Benchmark · Comparatif Vulkan vs ROCm de Soothill : côté ROCm, 73,7 t/s en génération mais 1 345 t/s en prompt, le meilleur prefill de la série.Qwen3-Coder-30B-A3B Q4_K_S — llama.cpp Vulkan — 97,7 t/s (Soothill)Benchmark · Comparatif Vulkan vs ROCm de Soothill : côté Vulkan, 97,7 t/s en génération et 1 115 t/s en prompt sur Qwen3-Coder-30B-A3B Q4_K_S.Qwen3.5-122B-A10B Q4_K_XL — llama.cpp b10333 ROCm 7.14 — 13,6 t/s, TTFT 1,78 s (Soothill)Benchmark · Côté llama.cpp du comparatif vLLM / SGLang / llama.cpp : 13,6 t/s à 1 client, 17,9 t/s agrégés à 2 clients, TTFT 1,775 s sur un MoE de 122 Md.Qwen3.5-122B-A10B GPTQ — vLLM 0.26.0 ROCm 7.14 — 10,3 t/s, TTFT 1,06 s (Soothill)Benchmark · Côté vLLM du comparatif : 10,3 t/s à 1 client, 16,2 t/s agrégés à 2 clients, TTFT 1,056 s ; plus lent en génération mais 40 % plus rapide au premier token que llama.cpp.Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 1 — 59,2 t/s, TTFT 117 ms (hogeheer)Benchmark · Point de référence à 1 slot de la seule courbe de montée en charge publiée sur Strix Halo : 59,2 t/s et 117 ms de TTFT.Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 16 — 10,4 t/s par utilisateur, 166 agrégés (hogeheer)Benchmark · À 16 slots, l'agrégé plafonne (166 t/s, +2,5 % par rapport à 8 slots) et chaque utilisateur tombe à 10,4 t/s avec 547 ms de TTFT.Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 4 — 32,7 t/s par utilisateur, 130,8 agrégés (hogeheer)Benchmark · À 4 slots, chaque utilisateur reçoit 32,7 t/s (130,8 t/s agrégés, 2,2 fois le mono) avec un TTFT de 237 ms.Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 8 — 20,3 t/s par utilisateur, 162 agrégés (hogeheer)Benchmark · À 8 slots, 20,3 t/s par utilisateur et 162 t/s agrégés (2,7 fois le mono), TTFT 307 ms : le point d'équilibre retenu par l'auteur.

Sources

8

Qwen/Qwen3-235B-A22B-Instruct-2507 — fiche modèleSource · MoE 235 Md / 22 Md actifs, 94 couches, GQA 64/4, 128 experts (8 actifs), contexte 262 144 natif (1 010 000 étendu), Apache 2.0, outils via Qwen-Agent.Qwen/Qwen3-30B-A3B-Instruct-2507 — fiche modèleSource · MoE 30,5 Md / 3,3 Md actifs, 48 couches, GQA 32/4, 128 experts (8 actifs), contexte 262 144 natif, Apache 2.0, outils.Qwen/Qwen3-32B — fiche modèleSource · Dense 32,8 Md, 64 couches, GQA 64/8, contexte 32 768 natif (131 072 avec YaRN), Apache 2.0, plus de 100 langues, modes thinking / non-thinking.Qwen/Qwen3.5-122B-A10B — fiche modèleSource · Hybride Gated DeltaNet + MoE, 122 Md / 10 Md actifs, 48 couches, 256 experts (8+1), contexte 262 144 natif, Apache 2.0, « 201 languages and dialects ».Qwen/Qwen3.5-27B — fiche modèleSource · Dense 27 Md, 64 couches, GQA 24/4, contexte 262 144, Apache 2.0.Qwen/Qwen3.5-35B-A3B — fiche modèleSource · Hybride Gated DeltaNet + MoE, 35 Md / 3 Md actifs, 40 couches, contexte 262 144, Apache 2.0, 201 langues.QwenLM/Qwen3.8 — dépôt GitHubSource · Qwen3.8 : 27B dense et 2.4T-A95B, contexte 262 144, tool-call-parser qwen3_coder, 201 langues héritées de Qwen3.5.unsloth/Qwen3-30B-A3B-Instruct-2507-GGUFSource · Tailles GGUF : Q4_K_M 18,6 Go, UD-Q4_K_XL 17,7 Go, Q6_K 25,1 Go, Q8_0 32,5 Go.