Benchmark
Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 4 — 32,7 t/s par utilisateur, 130,8 agrégés (hogeheer)
À 4 slots, chaque utilisateur reçoit 32,7 t/s (130,8 t/s agrégés, 2,2 fois le mono) avec un TTFT de 237 ms.
À vérifier#benchmark#strix-halo#llama-cpp#vulkan#qwen#multi-utilisateursPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
Conditions
- Date
- 30 août 2026
- Runtime
- llama-server b9010 (Vulkan RADV)
- Quantification
- UD-Q4_K_M
- Prompt
- 4 requêtes concurrentes
- Utilisateurs simultanés
- 4
Mesures
- TTFTCommunauté
- 237 ms
- GénérationCommunauté
- 32,7 tok/s
Conditions
Identiques à la fiche -np 1, avec -np 4 1.
Résultat
Par utilisateur : 32,7 t/s. Agrégé : 130,8 t/s (2,2 fois le débit mono). TTFT 0,237 s.
Lecture
Chaque utilisateur perd 45 % de débit, mais reste très au-dessus d'une vitesse de lecture confortable. C'est le point le plus proche du scénario « 3 actifs » d'un cabinet.
Sources
- 1strix-halo-guide (README + BENCHMARKS.md)GitHubFiabilité moyenneGitHub (communauté) · hogeheer499 · publié 2026-03 → 2026-08-30 · consulté le 16 sept. 2026 · fiche source