Source
Local LLM Speed Test: GPT-OSS, Qwen3.6 and Hermes on 128GB Unified Memory (MindStudio)
ConfirméePublié le 16 sept. 2026Mis à jour le 16 sept. 2026
- Organisation
- MindStudio
- Type
- Benchmark
- Fiabilité
- Fiabilité moyenne
- Publié
- 2026-07-21
- Consulté le
- 16 septembre 2026
- Sujets
- strix-halo, benchmark, gpt-oss
Citée par 4 page(s)
Ollama, LM Studio, Lemonade : les moteurs « faciles »Inférence · Trois surcouches de llama.cpp orientées simplicité : variables de parallélisme d'Ollama, requêtes concurrentes de LM Studio, Lemonade porté par AMD ; limites pour un serveur multi-utilisateurs.Framework Desktop (Ryzen AI Max+ 395, 128 Go)Matériel · Machine candidate de la Box IA : APU AMD Strix Halo avec 128 Go de mémoire unifiée, compacte et silencieuse, mais dont le support ROCm n'est officiel que depuis août 2026 et dont la stabilité sous forte charge GPU reste à démontrer.gpt-oss-120bModèle · MoE OpenAI de 117 Md (5,1 Md actifs) sous Apache 2.0 : le candidat principal de la Box, mesuré entre 30 et 56 t/s sur Strix Halo selon le runtime.gpt-oss-120b — LM Studio (runtime ROCm llama.cpp) — environ 30 t/s (MindStudio)Benchmark · gpt-oss-120b servi par LM Studio avec le runtime ROCm : environ 30 t/s, soit près de la moitié des mesures llama.cpp directes. Contradiction documentée.
Ce que dit la source
gpt-oss-120b via LM Studio + ROCm llama.cpp : ≈ 30 t/s en génération.
Ce qu'on en retient
Valeur basse de la fourchette gpt-oss-120b (30 vs 48–56 t/s ailleurs) ; illustre l'effet du runtime et des réglages.
Limites
LM Studio (empaquetage), pas llama.cpp direct ; contexte et flags non précisés.