Aller au contenu
Benchmark

DeepSeek-R1-Distill-Qwen-32B Q4_K_M — llama.cpp HIP — 11,2 t/s (praveentechworld)

Un dense de 32 Md en Q4 (19,8 Go) sur Strix Halo : 11,2 t/s, cohérent avec le plafond bande passante ÷ poids.

À vérifier#benchmark#strix-halo#llama-cpp#rocm#deepseekPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
CommunautéRésultat : OKSérie : strix-halo-dense-32bsource de la mesure

Conditions

Date
9 septembre 2026
Runtime
llama.cpp HIP, ROCm 6.3+ (build non relevé)
Quantification
Q4_K_M
Utilisateurs simultanés
1

Mesures

GénérationCommunauté
11,2 tok/s
Mémoire GPUCommunauté
19,8 Go

Conditions

Blog praveentechworld, 9 septembre 2026, backend HIP, ROCm 6.3 ou plus, machine Strix Halo 128 Go non précisée 1. La distillation est un modèle dense Qwen2.5-32B, rattaché ici à la fiche DeepSeek R1.

Résultat

11,2 t/s en génération.

Lecture

Estimation : 212 Go/s ÷ 19,8 Go ≈ 10,7 t/s ; la mesure est au plafond. Un dense de 32 Md tourne deux fois plus vite qu'un 70B mais cinq fois moins vite qu'un MoE de 120 Md à 5 Md actifs. Ordre de grandeur transposable à Qwen3-32B et Gemma 3 27B en Q4.

content/benchmarks/2026-09-09-deepseek-r1-distill-qwen-32b-rocm-praveen.md94 mots