Aller au contenu
Source

Local LLM Speed Test: GPT-OSS, Qwen3.6 and Hermes on 128GB Unified Memory (MindStudio)

ConfirméePublié le 16 sept. 2026Mis à jour le 16 sept. 2026
Organisation
MindStudio
Type
Benchmark
Fiabilité
Fiabilité moyenne
Publié
2026-07-21
Consulté le
16 septembre 2026
Sujets
strix-halo, benchmark, gpt-oss

Citée par 4 page(s)

Ce que dit la source

gpt-oss-120b via LM Studio + ROCm llama.cpp : ≈ 30 t/s en génération.

Ce qu'on en retient

Valeur basse de la fourchette gpt-oss-120b (30 vs 48–56 t/s ailleurs) ; illustre l'effet du runtime et des réglages.

Limites

LM Studio (empaquetage), pas llama.cpp direct ; contexte et flags non précisés.

content/sources/mindstudio-local-llm-benchmarks.md54 mots