Aller au contenu
Benchmark

Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 1 — 59,2 t/s, TTFT 117 ms (hogeheer)

Point de référence à 1 slot de la seule courbe de montée en charge publiée sur Strix Halo : 59,2 t/s et 117 ms de TTFT.

À vérifier#benchmark#strix-halo#llama-cpp#vulkan#qwen#multi-utilisateursPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
CommunautéRésultat : OKSérie : strix-halo-multi-usersource de la mesure

Conditions

Date
30 août 2026
Runtime
llama-server b9010 (Vulkan RADV)
Quantification
UD-Q4_K_M
Prompt
requêtes concurrentes (jeu de prompts de l'auteur, non détaillé)
Utilisateurs simultanés
1

Mesures

TTFTCommunauté
117 ms
GénérationCommunauté
59,2 tok/s

Conditions

Beelink GTR9 Pro (même puce que le Framework Desktop), llama-server build b9010, backend Vulkan RADV, -np 1 1. Longueur des prompts, -c, KV et --kv-unified non détaillés dans nos notes. La date de la fiche est celle de la dernière mise à jour du fichier BENCHMARKS.md (30 août 2026) ; la mesure elle-même n'est pas datée.

Résultat

59,2 t/s (un utilisateur, donc agrégé identique) ; TTFT 0,117 s.

Lecture

Base de la série strix-halo-multi-user : voir les fiches -np 4, -np 8 et -np 16. Modèle hybride Qwen3.6 rattaché à la fiche Qwen3.5 et suivants.

content/benchmarks/2026-08-30-qwen3-6-35b-a3b-np1-vulkan-hogeheer.md96 mots