Aller au contenu
Benchmark

Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 16 — 10,4 t/s par utilisateur, 166 agrégés (hogeheer)

À 16 slots, l'agrégé plafonne (166 t/s, +2,5 % par rapport à 8 slots) et chaque utilisateur tombe à 10,4 t/s avec 547 ms de TTFT.

À vérifier#benchmark#strix-halo#llama-cpp#vulkan#qwen#multi-utilisateursPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
CommunautéRésultat : DégradéSérie : strix-halo-multi-usersource de la mesure

Conditions

Date
30 août 2026
Runtime
llama-server b9010 (Vulkan RADV)
Quantification
UD-Q4_K_M
Prompt
16 requêtes concurrentes
Utilisateurs simultanés
16

Mesures

TTFTCommunauté
547 ms
GénérationCommunauté
10,4 tok/s

Conditions

Identiques à la fiche -np 1, avec -np 16 1.

Résultat

Par utilisateur : 10,4 t/s. Agrégé : 166,0 t/s. TTFT 0,547 s. result: degraded : le débit par utilisateur passe sous la vitesse de lecture confortable et l'agrégé ne progresse plus.

Lecture

Saturation : entre 8 et 16 slots, l'agrégé gagne 4 t/s seulement. Le goulot n'est plus la bande passante mais le calcul ou l'échantillonnage. Cohérent avec la discussion #20856 (« ~168 t/s aggregate across 16 parallel slots », HIP, mars 2026) 2. Pour la Box, -np au-delà de 8 n'a d'intérêt que pour absorber des rafales, pas pour augmenter le débit.

content/benchmarks/2026-08-30-qwen3-6-35b-a3b-np16-vulkan-hogeheer.md105 mots