Benchmark
Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 16 — 10,4 t/s par utilisateur, 166 agrégés (hogeheer)
À 16 slots, l'agrégé plafonne (166 t/s, +2,5 % par rapport à 8 slots) et chaque utilisateur tombe à 10,4 t/s avec 547 ms de TTFT.
À vérifier#benchmark#strix-halo#llama-cpp#vulkan#qwen#multi-utilisateursPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
Conditions
- Date
- 30 août 2026
- Runtime
- llama-server b9010 (Vulkan RADV)
- Quantification
- UD-Q4_K_M
- Prompt
- 16 requêtes concurrentes
- Utilisateurs simultanés
- 16
Mesures
- TTFTCommunauté
- 547 ms
- GénérationCommunauté
- 10,4 tok/s
Conditions
Identiques à la fiche -np 1, avec -np 16 1.
Résultat
Par utilisateur : 10,4 t/s. Agrégé : 166,0 t/s. TTFT 0,547 s. result: degraded : le débit par utilisateur passe sous la vitesse de lecture confortable et l'agrégé ne progresse plus.
Lecture
Saturation : entre 8 et 16 slots, l'agrégé gagne 4 t/s seulement. Le goulot n'est plus la bande passante mais le calcul ou l'échantillonnage. Cohérent avec la discussion #20856 (« ~168 t/s aggregate across 16 parallel slots », HIP, mars 2026) 2. Pour la Box, -np au-delà de 8 n'a d'intérêt que pour absorber des rafales, pas pour augmenter le débit.
Sources
- 1strix-halo-guide (README + BENCHMARKS.md)GitHubFiabilité moyenneGitHub (communauté) · hogeheer499 · publié 2026-03 → 2026-08-30 · consulté le 16 sept. 2026 · fiche source
- 2llama.cpp discussion #20856 — Known-Good Strix Halo ROCm + llama.cpp StackGitHubFiabilité moyenneGitHub ggml-org (communauté) · realugbun · publié 2026-03-22 (màj 2026-07-23) · consulté le 16 sept. 2026 · fiche source