Aller au contenu
Benchmark

Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 4 — 32,7 t/s par utilisateur, 130,8 agrégés (hogeheer)

À 4 slots, chaque utilisateur reçoit 32,7 t/s (130,8 t/s agrégés, 2,2 fois le mono) avec un TTFT de 237 ms.

À vérifier#benchmark#strix-halo#llama-cpp#vulkan#qwen#multi-utilisateursPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
CommunautéRésultat : OKSérie : strix-halo-multi-usersource de la mesure

Conditions

Date
30 août 2026
Runtime
llama-server b9010 (Vulkan RADV)
Quantification
UD-Q4_K_M
Prompt
4 requêtes concurrentes
Utilisateurs simultanés
4

Mesures

TTFTCommunauté
237 ms
GénérationCommunauté
32,7 tok/s

Conditions

Identiques à la fiche -np 1, avec -np 4 1.

Résultat

Par utilisateur : 32,7 t/s. Agrégé : 130,8 t/s (2,2 fois le débit mono). TTFT 0,237 s.

Lecture

Chaque utilisateur perd 45 % de débit, mais reste très au-dessus d'une vitesse de lecture confortable. C'est le point le plus proche du scénario « 3 actifs » d'un cabinet.

content/benchmarks/2026-08-30-qwen3-6-35b-a3b-np4-vulkan-hogeheer.md60 mots