Aller au contenu
Benchmark

gpt-oss-120b MXFP4 — llama.cpp ROCm 7.2.0 (fork Lychee b8182) — 51,1 t/s (Pellegrini)

gpt-oss-120b sous ROCm 7.2.0 avec un fork llama.cpp : 51,1 t/s en génération, 174 t/s en prompt (charge applicative), environ 59 Go GPU, pic 140 W.

À vérifier#benchmark#strix-halo#llama-cpp#rocm#gpt-ossPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026
Benchmark indépendantRésultat : OKSérie : strix-halo-gpt-oss-120bsource de la mesure

Conditions

Date
16 septembre 2026
Runtime
llama.cpp fork Lychee-Technology b8182, ROCm 7.2.0
Quantification
MXFP4
Prompt
charge applicative (non llama-bench)
Utilisateurs simultanés
1

Mesures

GénérationBenchmark indépendant
51,1 tok/s
Prompt processingBenchmark indépendant
174 tok/s
Mémoire GPUBenchmark indépendant
59 Go
PuissanceBenchmark indépendant
140 W

Conditions

ROCm 7.2.0, llama.cpp fork Lychee-Technology build b8182 (backend HIP), environ 59 Go de mémoire GPU occupés, pic de consommation environ 140 W 1. Machine Strix Halo non précisée dans nos notes. La publication n'est pas datée précisément (2026) : la date de cette fiche est la date de consultation, ce qui la place artificiellement en tête chronologique de la série.

Résultat

Génération 51,1 t/s. Prompt 174 t/s, mesuré en charge applicative et non par llama-bench : non comparable aux pp512 des autres fiches. L'auteur relève un « poor tool calling » avec ce modèle.

Lecture

Confirme l'ordre de grandeur 50 t/s de gpt-oss-120b, ici sous ROCm. Fork non standard : la valeur ne représente pas l'image officielle server-rocm. La remarque sur les appels d'outils est à vérifier avec le template harmony correctement activé (--jinja).

content/benchmarks/2026-09-16-gpt-oss-120b-rocm-pellegrini.md135 mots