Aller au contenu
Benchmark

Llama 3.3 70B (Shisa V2) Q4_K_M — llama.cpp b5863 — 5,0 t/s (lhl, Framework Desktop)

Un dense de 70 Md en Q4 sur le Framework Desktop : 5,0 t/s en génération et 94,7 t/s en prompt, exactement au plafond de bande passante.

Confirmée#benchmark#strix-halo#llama-cpp#llama#frameworkPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
Benchmark indépendantRésultat : OKSérie : strix-halo-dense-70bsource de la mesure

Conditions

Date
22 juillet 2025
Kernel
6.15.x
Runtime
llama.cpp b5863 (TheRock 7.0 nightlies)
Quantification
Q4_K_M
Prompt
pp512 / tg128 (llama-bench)
Tokens prompt
512
Utilisateurs simultanés
1

Mesures

Tokens générésBenchmark indépendant
128
GénérationBenchmark indépendant
5 tok/s
Prompt processingBenchmark indépendant
95 tok/s

Conditions

Framework Desktop (machine cible exacte), llama.cpp b5863, ROCm TheRock 7.0 nightlies, noyau 6.15.x, juillet-août 2025 1. Le modèle est Shisa V2 70B, fine-tune de Llama 3.3 70B : même architecture et mêmes poids en volume, donc même débit. Le backend exact de cette ligne (HIP ou Vulkan) diffère selon les résumés consultés : à relire dans le fil d'origine.

Résultat

tg128 : 5,0 t/s ; pp512 : 94,7 t/s.

Lecture

Plafond estimé : 212 Go/s ÷ 42,5 Go ≈ 5,0 t/s. La mesure est au plafond : la génération d'un dense de 70 Md est entièrement bornée par la mémoire sur cette machine, et aucun réglage de backend n'y changera grand-chose. Le prefill à 95 t/s rend l'analyse de longs dossiers impraticable (20 000 tokens ≈ 3,5 min de TTFT, estimation).

content/benchmarks/2025-07-22-llama-3-3-70b-q4-llamacpp-lhl.md132 mots