Benchmark
DeepSeek-R1-Distill-Qwen-32B Q4_K_M — llama.cpp HIP — 11,2 t/s (praveentechworld)
Un dense de 32 Md en Q4 (19,8 Go) sur Strix Halo : 11,2 t/s, cohérent avec le plafond bande passante ÷ poids.
À vérifier#benchmark#strix-halo#llama-cpp#rocm#deepseekPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
Conditions
- Date
- 9 septembre 2026
- Runtime
- llama.cpp HIP, ROCm 6.3+ (build non relevé)
- Quantification
- Q4_K_M
- Utilisateurs simultanés
- 1
Mesures
- GénérationCommunauté
- 11,2 tok/s
- Mémoire GPUCommunauté
- 19,8 Go
Conditions
Blog praveentechworld, 9 septembre 2026, backend HIP, ROCm 6.3 ou plus, machine Strix Halo 128 Go non précisée 1. La distillation est un modèle dense Qwen2.5-32B, rattaché ici à la fiche DeepSeek R1.
Résultat
11,2 t/s en génération.
Lecture
Estimation : 212 Go/s ÷ 19,8 Go ≈ 10,7 t/s ; la mesure est au plafond. Un dense de 32 Md tourne deux fois plus vite qu'un 70B mais cinq fois moins vite qu'un MoE de 120 Md à 5 Md actifs. Ordre de grandeur transposable à Qwen3-32B et Gemma 3 27B en Q4.
Sources
- 1praveentechworld — AMD Strix Halo Local LLM Benchmarks: 128GB Unified Memory GuideBlogFiabilité faiblepraveentechworld.com · Praveen · publié 2026-09-09 · consulté le 16 sept. 2026 · fiche source