Llama 3.3 70B (Shisa V2) Q4_K_M — llama.cpp b5863 — 5,0 t/s (lhl, Framework Desktop)
Un dense de 70 Md en Q4 sur le Framework Desktop : 5,0 t/s en génération et 94,7 t/s en prompt, exactement au plafond de bande passante.
Conditions
- Date
- 22 juillet 2025
- Kernel
- 6.15.x
- Runtime
- llama.cpp b5863 (TheRock 7.0 nightlies)
- Quantification
- Q4_K_M
- Prompt
- pp512 / tg128 (llama-bench)
- Tokens prompt
- 512
- Utilisateurs simultanés
- 1
Mesures
- Tokens générésBenchmark indépendant
- 128
- GénérationBenchmark indépendant
- 5 tok/s
- Prompt processingBenchmark indépendant
- 95 tok/s
Conditions
Framework Desktop (machine cible exacte), llama.cpp b5863, ROCm TheRock 7.0 nightlies, noyau 6.15.x, juillet-août 2025 1. Le modèle est Shisa V2 70B, fine-tune de Llama 3.3 70B : même architecture et mêmes poids en volume, donc même débit. Le backend exact de cette ligne (HIP ou Vulkan) diffère selon les résumés consultés : à relire dans le fil d'origine.
Résultat
tg128 : 5,0 t/s ; pp512 : 94,7 t/s.
Lecture
Plafond estimé : 212 Go/s ÷ 42,5 Go ≈ 5,0 t/s. La mesure est au plafond : la génération d'un dense de 70 Md est entièrement bornée par la mémoire sur cette machine, et aucun réglage de backend n'y changera grand-chose. Le prefill à 95 t/s rend l'analyse de longs dossiers impraticable (20 000 tokens ≈ 3,5 min de TTFT, estimation).
Sources
- 1Strix Halo (Ryzen AI Max+ 395) LLM Benchmark Results (Level1Techs, lhl)BenchmarkFiabilité moyenneLevel1Techs Forums · lhl · publié 2025-07-22 (màj 2025-08-31) · consulté le 16 sept. 2026 · fiche source