Aller au contenu
Benchmark

gpt-oss-120b Q4_K_M — llama-server ROCm — 53,4 t/s (visorcraft)

gpt-oss-120b sous llama-server avec backend ROCm sur un mini-PC Strix Halo : 53,4 t/s en génération.

À vérifier#benchmark#strix-halo#llama-cpp#rocm#gpt-ossPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
Benchmark indépendantRésultat : OKSérie : strix-halo-gpt-oss-120bsource de la mesure

Conditions

Date
16 février 2026
Runtime
llama-server ROCm (version non relevée)
Quantification
Q4_K_M
Utilisateurs simultanés
1

Mesures

GénérationBenchmark indépendant
53,4 tok/s

Conditions

Dépôt visorcraft/strix-halo-llm-perf, mis à jour le 16 février 2026 : llama-server, backend ROCm, machine GMKtec ou Beelink (même puce que le Framework Desktop) 1. Version de llama.cpp, flags et contexte non relevés dans nos notes.

Résultat

Génération 53,4 t/s. Prompt processing non relevé.

Lecture

Point ROCm intermédiaire entre Pellegrini (51,1) et hogeheer Vulkan (55,6). Le GGUF « Q4_K_M » de gpt-oss-120b garde les experts en MXFP4 : la différence de quantification avec les autres fiches est marginale.

content/benchmarks/2026-02-16-gpt-oss-120b-rocm-visorcraft.md78 mots