Benchmark
Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 8 — 20,3 t/s par utilisateur, 162 agrégés (hogeheer)
À 8 slots, 20,3 t/s par utilisateur et 162 t/s agrégés (2,7 fois le mono), TTFT 307 ms : le point d'équilibre retenu par l'auteur.
À vérifier#benchmark#strix-halo#llama-cpp#vulkan#qwen#multi-utilisateursPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
Conditions
- Date
- 30 août 2026
- Runtime
- llama-server b9010 (Vulkan RADV)
- Quantification
- UD-Q4_K_M
- Prompt
- 8 requêtes concurrentes
- Utilisateurs simultanés
- 8
Mesures
- TTFTCommunauté
- 307 ms
- GénérationCommunauté
- 20,3 tok/s
Conditions
Identiques à la fiche -np 1, avec -np 8 1.
Résultat
Par utilisateur : 20,3 t/s. Agrégé : 162,0 t/s (2,7 fois le mono). TTFT 0,307 s. L'auteur qualifie -np 8 de « practical sweet spot ».
Lecture
Huit utilisateurs simultanés servis chacun à 20 t/s sur un MoE de 35 Md : c'est le résultat le plus encourageant pour la Box, mais il concerne des prompts courts, un modèle à 3 Md actifs et une machine Beelink. Rien d'équivalent n'existe pour gpt-oss-120b : c'est l'objet de l'expérimentation de montée en charge.
Sources
- 1strix-halo-guide (README + BENCHMARKS.md)GitHubFiabilité moyenneGitHub (communauté) · hogeheer499 · publié 2026-03 → 2026-08-30 · consulté le 16 sept. 2026 · fiche source