gpt-oss-120b MXFP4 — llama.cpp Vulkan RADV b9049 — 55,6 t/s (hogeheer)
Meilleure mesure publiée de gpt-oss-120b sur Strix Halo : 55,57 t/s en génération et 727 t/s en prompt processing, Vulkan RADV, Beelink GTR9 Pro.
Conditions
- Date
- 7 mai 2026
- OS
- Linux (Mesa RADV 26.0+)
- Kernel
- 6.19+
- Runtime
- llama.cpp b9049 (Vulkan RADV)
- Modèle
- gpt-oss-120b MXFP4
- Quantification
- MXFP4
- Prompt
- pp512 / tg128 (llama-bench) ; pp65536 également relevé
- Tokens prompt
- 512
- Utilisateurs simultanés
- 1
Mesures
- Tokens générésCommunauté
- 128
- GénérationCommunauté
- 55,6 tok/s
- Prompt processingCommunauté
- 727 tok/s
Conditions
Machine : Beelink GTR9 Pro (même puce Ryzen AI Max+ 395 et 128 Go que le Framework Desktop ; refroidissement et BIOS différents). llama.cpp build b9049, backend Vulkan RADV, Mesa 26.0 ou plus, noyau 6.19 ou plus 1. Flags de lancement non détaillés dans nos notes.
Résultat
tg128 : 55,57 t/s. pp512 : 726,99 t/s. pp65536 (prompt de 65 536 tokens) : 293,73 t/s, soit une division par 2,5 du prefill en très long contexte.
Lecture
Valeur haute de la série : les mesures ROCm publiées sont à 51 à 53 t/s, LM Studio ROCm à environ 30 t/s. Le pp512 de 727 t/s n'est pas comparable au « 174 t/s » de Pellegrini, mesuré en charge applicative. Auteur individuel : à reproduire sur le Framework Desktop (expérimentation).
Sources
- 1strix-halo-guide (README + BENCHMARKS.md)GitHubFiabilité moyenneGitHub (communauté) · hogeheer499 · publié 2026-03 → 2026-08-30 · consulté le 16 sept. 2026 · fiche source