Aller au contenu
Benchmark

gpt-oss-120b MXFP4 — llama.cpp Vulkan RADV b9049 — 55,6 t/s (hogeheer)

Meilleure mesure publiée de gpt-oss-120b sur Strix Halo : 55,57 t/s en génération et 727 t/s en prompt processing, Vulkan RADV, Beelink GTR9 Pro.

Confirmée#benchmark#strix-halo#llama-cpp#vulkan#gpt-ossPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
CommunautéRésultat : OKSérie : strix-halo-gpt-oss-120bsource de la mesure

Conditions

Date
7 mai 2026
OS
Linux (Mesa RADV 26.0+)
Kernel
6.19+
Runtime
llama.cpp b9049 (Vulkan RADV)
Quantification
MXFP4
Prompt
pp512 / tg128 (llama-bench) ; pp65536 également relevé
Tokens prompt
512
Utilisateurs simultanés
1

Mesures

Tokens générésCommunauté
128
GénérationCommunauté
55,6 tok/s
Prompt processingCommunauté
727 tok/s

Conditions

Machine : Beelink GTR9 Pro (même puce Ryzen AI Max+ 395 et 128 Go que le Framework Desktop ; refroidissement et BIOS différents). llama.cpp build b9049, backend Vulkan RADV, Mesa 26.0 ou plus, noyau 6.19 ou plus 1. Flags de lancement non détaillés dans nos notes.

Résultat

tg128 : 55,57 t/s. pp512 : 726,99 t/s. pp65536 (prompt de 65 536 tokens) : 293,73 t/s, soit une division par 2,5 du prefill en très long contexte.

Lecture

Valeur haute de la série : les mesures ROCm publiées sont à 51 à 53 t/s, LM Studio ROCm à environ 30 t/s. Le pp512 de 727 t/s n'est pas comparable au « 174 t/s » de Pellegrini, mesuré en charge applicative. Auteur individuel : à reproduire sur le Framework Desktop (expérimentation).

content/benchmarks/2026-05-07-gpt-oss-120b-vulkan-hogeheer.md129 mots