gpt-oss-120b MXFP4 — llama.cpp ROCm 7.2.0 (fork Lychee b8182) — 51,1 t/s (Pellegrini)
gpt-oss-120b sous ROCm 7.2.0 avec un fork llama.cpp : 51,1 t/s en génération, 174 t/s en prompt (charge applicative), environ 59 Go GPU, pic 140 W.
Conditions
- Date
- 16 septembre 2026
- Runtime
- llama.cpp fork Lychee-Technology b8182, ROCm 7.2.0
- Modèle
- gpt-oss-120b MXFP4
- Quantification
- MXFP4
- Prompt
- charge applicative (non llama-bench)
- Utilisateurs simultanés
- 1
Mesures
- GénérationBenchmark indépendant
- 51,1 tok/s
- Prompt processingBenchmark indépendant
- 174 tok/s
- Mémoire GPUBenchmark indépendant
- 59 Go
- PuissanceBenchmark indépendant
- 140 W
Conditions
ROCm 7.2.0, llama.cpp fork Lychee-Technology build b8182 (backend HIP), environ 59 Go de mémoire GPU occupés, pic de consommation environ 140 W 1. Machine Strix Halo non précisée dans nos notes. La publication n'est pas datée précisément (2026) : la date de cette fiche est la date de consultation, ce qui la place artificiellement en tête chronologique de la série.
Résultat
Génération 51,1 t/s. Prompt 174 t/s, mesuré en charge applicative et non par llama-bench : non comparable aux pp512 des autres fiches. L'auteur relève un « poor tool calling » avec ce modèle.
Lecture
Confirme l'ordre de grandeur 50 t/s de gpt-oss-120b, ici sous ROCm. Fork non standard : la valeur ne représente pas l'image officielle server-rocm. La remarque sur les appels d'outils est à vérifier avec le template harmony correctement activé (--jinja).
Sources
- 1Running 122B-Parameter LLMs Locally on AMD Strix Halo (Pellegrini, LinkedIn)BenchmarkFiabilité moyenneLinkedIn (article personnel) · Pellegrini · publié 2026 · consulté le 16 sept. 2026 · fiche source