Aller au contenu
Expérimentation

Benchmark gpt-oss-120b à 1 utilisateur : Vulkan vs ROCm, contexte court et long

Reproduire sur le Framework Desktop les 51 à 56 t/s publiés pour gpt-oss-120b, comparer les deux backends et mesurer la dégradation à 4k et 32k de profondeur.

Brouillon#benchmark#gpt-oss#llama-cpp#vulkan#rocm#strix-haloPublié le 16 sept. 2026Mis à jour le 16 sept. 2026
Statut du test
À tester
Priorité
Haute
Prévu pour
Octobre 2026
Hypothèse
Sur le Framework Desktop, gpt-oss-120b MXFP4 atteint au moins 50 t/s en tg128 avec l'un des deux backends, et le prefill pp512 dépasse 500 t/s ; la génération baisse de moins de 20 % à 32k de profondeur.
Procédure
1) Image officielle ghcr.io/ggml-org/llama.cpp server-vulkan puis server-rocm, build noté. 2) llama-bench -m gpt-oss-120b.gguf -ngl 999 -fa 1 --no-mmap -p 512 -n 128 -d 0,4096,32768 -r 5 -o jsonl, après un run d'échauffement. 3) Relever puissance et température pendant les runs. 4) Répéter avec les flags ROCm communautaires (ROCBLAS_USE_HIPBLASLT=1) si le build le permet. 5) Créer une fiche benchmark origin: ours par backend et profondeur, série framework-ours-baseline.
Prochaine action
Réceptionner la machine, installer la stack Linux/ROCm documentée, figer un build llama.cpp.

Pourquoi

Toutes les valeurs disponibles pour gpt-oss-120b viennent de tiers, sur des machines Beelink ou GMKtec, avec des runtimes différents, et s'étalent de 30 à 56 t/s 2 3. Le modèle principal de la Box ne peut pas rester sur une fourchette pareille.

Protocole

Niveau 1 de la méthodologie : llama-bench avec les défauts pp512/tg128 1 et profondeurs 0 / 4k / 32k, deux backends, flags communautaires (-fa 1 --no-mmap) 4. Consigner build, Mesa ou ROCm, noyau, réglage GTT, puissance.

Critères de succès

  • Écart entre nos mesures et les publications expliqué (backend, build, machine).
  • Choix motivé du backend par défaut pour ce modèle (Q-008).
  • Trois fiches benchmark ours publiées.

Résultat

À venir.

Sources

  1. 1llama.cpp — README de llama-benchGitHubFiabilité hauteggml-org · publié 2026 (master) · consulté le 16 sept. 2026 · fiche source
  2. 2strix-halo-guide (README + BENCHMARKS.md)GitHubFiabilité moyenneGitHub (communauté) · hogeheer499 · publié 2026-03 → 2026-08-30 · consulté le 16 sept. 2026 · fiche source
  3. 3Running 122B-Parameter LLMs Locally on AMD Strix Halo (Pellegrini, LinkedIn)BenchmarkFiabilité moyenneLinkedIn (article personnel) · Pellegrini · publié 2026 · consulté le 16 sept. 2026 · fiche source
  4. 4amd-strix-halo-toolboxes (README)GitHubFiabilité moyenneGitHub (communauté) · kyuz0 · publié 2025–2026 · consulté le 16 sept. 2026 · fiche source
content/experiments/benchmark-gpt-oss-120b-1-utilisateur.md110 mots