Benchmark
Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 1 — 59,2 t/s, TTFT 117 ms (hogeheer)
Point de référence à 1 slot de la seule courbe de montée en charge publiée sur Strix Halo : 59,2 t/s et 117 ms de TTFT.
À vérifier#benchmark#strix-halo#llama-cpp#vulkan#qwen#multi-utilisateursPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
Conditions
- Date
- 30 août 2026
- Runtime
- llama-server b9010 (Vulkan RADV)
- Quantification
- UD-Q4_K_M
- Prompt
- requêtes concurrentes (jeu de prompts de l'auteur, non détaillé)
- Utilisateurs simultanés
- 1
Mesures
- TTFTCommunauté
- 117 ms
- GénérationCommunauté
- 59,2 tok/s
Conditions
Beelink GTR9 Pro (même puce que le Framework Desktop), llama-server build b9010, backend Vulkan RADV, -np 1 1. Longueur des prompts, -c, KV et --kv-unified non détaillés dans nos notes. La date de la fiche est celle de la dernière mise à jour du fichier BENCHMARKS.md (30 août 2026) ; la mesure elle-même n'est pas datée.
Résultat
59,2 t/s (un utilisateur, donc agrégé identique) ; TTFT 0,117 s.
Lecture
Base de la série strix-halo-multi-user : voir les fiches -np 4, -np 8 et -np 16. Modèle hybride Qwen3.6 rattaché à la fiche Qwen3.5 et suivants.
Sources
- 1strix-halo-guide (README + BENCHMARKS.md)GitHubFiabilité moyenneGitHub (communauté) · hogeheer499 · publié 2026-03 → 2026-08-30 · consulté le 16 sept. 2026 · fiche source