Benchmark
Llama 3.3 70B Q4_K_M — llama.cpp HIP ROCm 6.3+ — 5,1 t/s, contexte 64k (praveentechworld)
Llama 3.3 70B Q4_K_M (42,5 Go) sous ROCm avec un contexte de 64k : 5,1 t/s, confirmant le plafond de bande passante un an après la première mesure.
À vérifier#benchmark#strix-halo#llama-cpp#rocm#llamaPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
Conditions
- Date
- 9 septembre 2026
- Runtime
- llama.cpp HIP, ROCm 6.3+ (build non relevé)
- Quantification
- Q4_K_M
- Contexte
- 65 536 tokens
- Utilisateurs simultanés
- 1
Mesures
- GénérationCommunauté
- 5,1 tok/s
- Mémoire GPUCommunauté
- 42,5 Go
Conditions
Blog praveentechworld, 9 septembre 2026 : Llama 3.3 70B Q4_K_M (42,5 Go), backend HIP, ROCm 6.3 ou plus, contexte 64k 1. Machine Strix Halo 128 Go non précisée ; build llama.cpp et flags non relevés. L'auteur mesure par ailleurs une bande passante effective d'environ 213 Go/s.
Résultat
5,1 t/s en génération.
Lecture
Même valeur qu'en 2025 sur le Framework Desktop (5,0 t/s) malgré un an d'évolution de ROCm : la borne est physique. Source communautaire, conditions partielles.
Sources
- 1praveentechworld — AMD Strix Halo Local LLM Benchmarks: 128GB Unified Memory GuideBlogFiabilité faiblepraveentechworld.com · Praveen · publié 2026-09-09 · consulté le 16 sept. 2026 · fiche source