Qwen3.5 et suivants (3.6, 3.8)
Famille Qwen la plus récente (février à août 2026) : hybrides Gated DeltaNet + MoE, 201 langues, Apache 2.0 ; le 35B-A3B est le modèle des seules mesures multi-slots publiées sur Strix Halo.
Fiche modèle
- Fournisseur
- Alibaba Qwen
- Famille
- Qwen3.5
- Paramètres
- 35 Md (3 Md actifs) pour 35B-A3B ; 122 Md (10 Md actifs) pour 122B-A10B ; 27 Md dense
- Architecture
- Hybride
- Contexte
- 256k tokens
- Licence
- Apache 2.0 (à vérifier par fiche pour 3.8)
- Sortie
- 16 février 2026
- Mémoire Q4Estimation
- ≈ 20 Go
- Appel d'outils
- Oui
- Raisonnement
- Optionnel
- Français
- Correct
- Quantifications
- Q4_K_M, UD-Q4_K_XL
- Usage recommandé
- multi-utilisateurs (35B-A3B), successeur de gpt-oss-120b (122B-A10B)
- Hugging Face
- fiche modèle
Pourquoi cette famille nous intéresse
Qwen3.5 (16 février au 2 mars 2026) introduit une architecture hybride Gated DeltaNet + MoE et annonce « 201 languages and dialects » 1. Trois gabarits comptent pour la Box : 35B-A3B (40 couches) 2, 122B-A10B (48 couches, 256 experts dont 8+1 actifs) 1 et 27B dense (64 couches, GQA 24/4) 3. Qwen3.6 puis Qwen3.8 (12 à 14 août 2026) ont suivi 4. Le frontmatter décrit le 35B-A3B.
Performances publiées sur Strix Halo
| Modèle | Génération (t/s) | Conditions | Type |
|---|---|---|---|
| Qwen3.6-35B-A3B UD-Q4_K_M | 59,2 (1 slot) ; 32,7 par utilisateur à -np 4 (130,8 agrégés) ; 20,3 à -np 8 (162,0) ; 10,4 à -np 16 (166,0) | llama-server Vulkan RADV b9010 7 | communauté |
| Qwen3.5-122B-A10B Q4_K_XL (environ 77 Go) | 21,3 (ROCm) / 22,9 (Vulkan) ; pp512 339,9 / 285,0 | llama.cpp b10085/b10216 5 | indépendant |
| Qwen3.5-122B-A10B Q4_K_XL | 13,6 (1 client), 17,9 agrégés (2 clients) ; TTFT 1,775 s | llama.cpp b10333, ROCm 7.14.0, GMKtec EVO-X3 6 | indépendant |
| Qwen3.5-122B-A10B (GPTQ) | 10,3 (1 client), 16,2 (2 clients) ; TTFT 1,056 s | vLLM 0.26.0 6 | indépendant |
| Qwen 3.5 122B Q4_K_M | 23,2 (24,4 avec MTP), contexte 32k | Vulkan, ROCm 7.2.2 8 | indépendant |
| Qwen 3.6 27B dense Q4_K_XL | 11,8 (20,0 avec MTP) | Vulkan 8 | indépendant |
| Modèles 122B | 18,3 à 22,9 ; Vulkan +6,7 % en agrégé à 2 clients | ROCm 7.2.0 9 | indépendant |
Le tableau -np du 35B-A3B est la seule courbe de montée en charge publiée sur cette puce ; elle est reprise dans Multi-utilisateurs et enregistrée dans la série strix-halo-multi-user.
Licence, français, mémoire
Apache 2.0 pour Qwen3.5 (fiches HF) ; à vérifier pour chaque fiche 3.8. 201 langues annoncées, pas de score français isolé. Mémoire : 35B-A3B environ 20 Go en Q4 (estimation) ; 122B-A10B environ 77 Go en Q4_K_XL 5. KV cache : l'architecture hybride (couches DeltaNet sans KV classique) rend la formule standard inapplicable ; à mesurer.
Limites et à tester
Support des architectures hybrides dans llama.cpp et vLLM à vérifier ; licences des variantes récentes ; qualité française. Tester le 35B-A3B en multi-slots pour reproduire la courbe hogeheer sur le Framework Desktop, et le 122B-A10B face à gpt-oss-120b.
Sources
- 1Qwen/Qwen3.5-122B-A10B — fiche modèleDocumentation officielleFiabilité hauteAlibaba Qwen · publié 2026-02-24 · consulté le 16 sept. 2026 · fiche source
- 2Qwen/Qwen3.5-35B-A3B — fiche modèleDocumentation officielleFiabilité hauteAlibaba Qwen · publié 2026-02 · consulté le 16 sept. 2026 · fiche source
- 3Qwen/Qwen3.5-27B — fiche modèleDocumentation officielleFiabilité hauteAlibaba Qwen · publié 2026-02 · consulté le 16 sept. 2026 · fiche source
- 4QwenLM/Qwen3.8 — dépôt GitHubGitHubFiabilité hauteAlibaba Qwen · publié 2026-08-12 · consulté le 16 sept. 2026 · fiche source
- 5llama.cpp: Vulkan vs ROCm on Strix Halo (Soothill)BenchmarkFiabilité moyennesoothill.io · Darren Soothill · publié 2026-08-03 · consulté le 16 sept. 2026 · fiche source
- 6Soothill — SGLang vs vLLM vs llama.cpp on Strix HaloBenchmarkFiabilité hautesoothill.io · Darren Soothill · publié 2026-08-10 · consulté le 16 sept. 2026 · fiche source
- 7strix-halo-guide (README + BENCHMARKS.md)GitHubFiabilité moyenneGitHub (communauté) · hogeheer499 · publié 2026-03 → 2026-08-30 · consulté le 16 sept. 2026 · fiche source
- 8The 2026 Strix Halo Ultimate Benchmark Suite (dev.to)BenchmarkFiabilité moyennedev.to · Agustin Sacco · publié 2026-05-31 · consulté le 16 sept. 2026 · fiche source
- 9Running 122B-Parameter LLMs Locally on AMD Strix Halo (Pellegrini, LinkedIn)BenchmarkFiabilité moyenneLinkedIn (article personnel) · Pellegrini · publié 2026 · consulté le 16 sept. 2026 · fiche source