Aller au contenu
Benchmark

Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 8 — 20,3 t/s par utilisateur, 162 agrégés (hogeheer)

À 8 slots, 20,3 t/s par utilisateur et 162 t/s agrégés (2,7 fois le mono), TTFT 307 ms : le point d'équilibre retenu par l'auteur.

À vérifier#benchmark#strix-halo#llama-cpp#vulkan#qwen#multi-utilisateursPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
CommunautéRésultat : OKSérie : strix-halo-multi-usersource de la mesure

Conditions

Date
30 août 2026
Runtime
llama-server b9010 (Vulkan RADV)
Quantification
UD-Q4_K_M
Prompt
8 requêtes concurrentes
Utilisateurs simultanés
8

Mesures

TTFTCommunauté
307 ms
GénérationCommunauté
20,3 tok/s

Conditions

Identiques à la fiche -np 1, avec -np 8 1.

Résultat

Par utilisateur : 20,3 t/s. Agrégé : 162,0 t/s (2,7 fois le mono). TTFT 0,307 s. L'auteur qualifie -np 8 de « practical sweet spot ».

Lecture

Huit utilisateurs simultanés servis chacun à 20 t/s sur un MoE de 35 Md : c'est le résultat le plus encourageant pour la Box, mais il concerne des prompts courts, un modèle à 3 Md actifs et une machine Beelink. Rien d'équivalent n'existe pour gpt-oss-120b : c'est l'objet de l'expérimentation de montée en charge.

content/benchmarks/2026-08-30-qwen3-6-35b-a3b-np8-vulkan-hogeheer.md93 mots