Benchmark
gpt-oss-120b Q4_K_M — llama-server ROCm — 53,4 t/s (visorcraft)
gpt-oss-120b sous llama-server avec backend ROCm sur un mini-PC Strix Halo : 53,4 t/s en génération.
À vérifier#benchmark#strix-halo#llama-cpp#rocm#gpt-ossPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
Conditions
- Date
- 16 février 2026
- Runtime
- llama-server ROCm (version non relevée)
- Quantification
- Q4_K_M
- Utilisateurs simultanés
- 1
Mesures
- GénérationBenchmark indépendant
- 53,4 tok/s
Conditions
Dépôt visorcraft/strix-halo-llm-perf, mis à jour le 16 février 2026 : llama-server, backend ROCm, machine GMKtec ou Beelink (même puce que le Framework Desktop) 1. Version de llama.cpp, flags et contexte non relevés dans nos notes.
Résultat
Génération 53,4 t/s. Prompt processing non relevé.
Lecture
Point ROCm intermédiaire entre Pellegrini (51,1) et hogeheer Vulkan (55,6). Le GGUF « Q4_K_M » de gpt-oss-120b garde les experts en MXFP4 : la différence de quantification avec les autres fiches est marginale.
Sources
- 1strix-halo-llm-perf (visorcraft)BenchmarkFiabilité moyenneGitHub (communauté) · visorcraft · publié 2026-02-16 (màj) · consulté le 16 sept. 2026 · fiche source