Aller au contenu
Modèle

Qwen3.5 et suivants (3.6, 3.8)

Famille Qwen la plus récente (février à août 2026) : hybrides Gated DeltaNet + MoE, 201 langues, Apache 2.0 ; le 35B-A3B est le modèle des seules mesures multi-slots publiées sur Strix Halo.

À vérifier#qwen#llama-cpp#strix-halo#multi-utilisateurs#benchmarkPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026À revérifier le 15 déc. 2026

Fiche modèle

Fournisseur
Alibaba Qwen
Famille
Qwen3.5
Paramètres
35 Md (3 Md actifs) pour 35B-A3B ; 122 Md (10 Md actifs) pour 122B-A10B ; 27 Md dense
Architecture
Hybride
Contexte
256k tokens
Licence
Apache 2.0 (à vérifier par fiche pour 3.8)
Sortie
16 février 2026
Mémoire Q4Estimation
≈ 20 Go
Appel d'outils
Oui
Raisonnement
Optionnel
Français
Correct
Quantifications
Q4_K_M, UD-Q4_K_XL
Usage recommandé
multi-utilisateurs (35B-A3B), successeur de gpt-oss-120b (122B-A10B)
Hugging Face
fiche modèle

Pourquoi cette famille nous intéresse

Qwen3.5 (16 février au 2 mars 2026) introduit une architecture hybride Gated DeltaNet + MoE et annonce « 201 languages and dialects » 1. Trois gabarits comptent pour la Box : 35B-A3B (40 couches) 2, 122B-A10B (48 couches, 256 experts dont 8+1 actifs) 1 et 27B dense (64 couches, GQA 24/4) 3. Qwen3.6 puis Qwen3.8 (12 à 14 août 2026) ont suivi 4. Le frontmatter décrit le 35B-A3B.

Performances publiées sur Strix Halo

ModèleGénération (t/s)ConditionsType
Qwen3.6-35B-A3B UD-Q4_K_M59,2 (1 slot) ; 32,7 par utilisateur à -np 4 (130,8 agrégés) ; 20,3 à -np 8 (162,0) ; 10,4 à -np 16 (166,0)llama-server Vulkan RADV b9010 7communauté
Qwen3.5-122B-A10B Q4_K_XL (environ 77 Go)21,3 (ROCm) / 22,9 (Vulkan) ; pp512 339,9 / 285,0llama.cpp b10085/b10216 5indépendant
Qwen3.5-122B-A10B Q4_K_XL13,6 (1 client), 17,9 agrégés (2 clients) ; TTFT 1,775 sllama.cpp b10333, ROCm 7.14.0, GMKtec EVO-X3 6indépendant
Qwen3.5-122B-A10B (GPTQ)10,3 (1 client), 16,2 (2 clients) ; TTFT 1,056 svLLM 0.26.0 6indépendant
Qwen 3.5 122B Q4_K_M23,2 (24,4 avec MTP), contexte 32kVulkan, ROCm 7.2.2 8indépendant
Qwen 3.6 27B dense Q4_K_XL11,8 (20,0 avec MTP)Vulkan 8indépendant
Modèles 122B18,3 à 22,9 ; Vulkan +6,7 % en agrégé à 2 clientsROCm 7.2.0 9indépendant

Le tableau -np du 35B-A3B est la seule courbe de montée en charge publiée sur cette puce ; elle est reprise dans Multi-utilisateurs et enregistrée dans la série strix-halo-multi-user.

Licence, français, mémoire

Apache 2.0 pour Qwen3.5 (fiches HF) ; à vérifier pour chaque fiche 3.8. 201 langues annoncées, pas de score français isolé. Mémoire : 35B-A3B environ 20 Go en Q4 (estimation) ; 122B-A10B environ 77 Go en Q4_K_XL 5. KV cache : l'architecture hybride (couches DeltaNet sans KV classique) rend la formule standard inapplicable ; à mesurer.

Limites et à tester

Support des architectures hybrides dans llama.cpp et vLLM à vérifier ; licences des variantes récentes ; qualité française. Tester le 35B-A3B en multi-slots pour reproduire la courbe hogeheer sur le Framework Desktop, et le 122B-A10B face à gpt-oss-120b.

Sources

  1. 1Qwen/Qwen3.5-122B-A10B — fiche modèleDocumentation officielleFiabilité hauteAlibaba Qwen · publié 2026-02-24 · consulté le 16 sept. 2026 · fiche source
  2. 2Qwen/Qwen3.5-35B-A3B — fiche modèleDocumentation officielleFiabilité hauteAlibaba Qwen · publié 2026-02 · consulté le 16 sept. 2026 · fiche source
  3. 3Qwen/Qwen3.5-27B — fiche modèleDocumentation officielleFiabilité hauteAlibaba Qwen · publié 2026-02 · consulté le 16 sept. 2026 · fiche source
  4. 4QwenLM/Qwen3.8 — dépôt GitHubGitHubFiabilité hauteAlibaba Qwen · publié 2026-08-12 · consulté le 16 sept. 2026 · fiche source
  5. 5llama.cpp: Vulkan vs ROCm on Strix Halo (Soothill)BenchmarkFiabilité moyennesoothill.io · Darren Soothill · publié 2026-08-03 · consulté le 16 sept. 2026 · fiche source
  6. 6Soothill — SGLang vs vLLM vs llama.cpp on Strix HaloBenchmarkFiabilité hautesoothill.io · Darren Soothill · publié 2026-08-10 · consulté le 16 sept. 2026 · fiche source
  7. 7strix-halo-guide (README + BENCHMARKS.md)GitHubFiabilité moyenneGitHub (communauté) · hogeheer499 · publié 2026-03 → 2026-08-30 · consulté le 16 sept. 2026 · fiche source
  8. 8The 2026 Strix Halo Ultimate Benchmark Suite (dev.to)BenchmarkFiabilité moyennedev.to · Agustin Sacco · publié 2026-05-31 · consulté le 16 sept. 2026 · fiche source
  9. 9Running 122B-Parameter LLMs Locally on AMD Strix Halo (Pellegrini, LinkedIn)BenchmarkFiabilité moyenneLinkedIn (article personnel) · Pellegrini · publié 2026 · consulté le 16 sept. 2026 · fiche source
content/models/qwen3-5.md406 mots