Expérimentation
Benchmark gpt-oss-120b à 1 utilisateur : Vulkan vs ROCm, contexte court et long
Reproduire sur le Framework Desktop les 51 à 56 t/s publiés pour gpt-oss-120b, comparer les deux backends et mesurer la dégradation à 4k et 32k de profondeur.
Brouillon#benchmark#gpt-oss#llama-cpp#vulkan#rocm#strix-haloPublié le 16 sept. 2026Mis à jour le 16 sept. 2026
- Statut du test
- À tester
- Priorité
- Haute
- Prévu pour
- Octobre 2026
- Hypothèse
- Sur le Framework Desktop, gpt-oss-120b MXFP4 atteint au moins 50 t/s en tg128 avec l'un des deux backends, et le prefill pp512 dépasse 500 t/s ; la génération baisse de moins de 20 % à 32k de profondeur.
- Procédure
- 1) Image officielle ghcr.io/ggml-org/llama.cpp server-vulkan puis server-rocm, build noté. 2) llama-bench -m gpt-oss-120b.gguf -ngl 999 -fa 1 --no-mmap -p 512 -n 128 -d 0,4096,32768 -r 5 -o jsonl, après un run d'échauffement. 3) Relever puissance et température pendant les runs. 4) Répéter avec les flags ROCm communautaires (ROCBLAS_USE_HIPBLASLT=1) si le build le permet. 5) Créer une fiche benchmark origin: ours par backend et profondeur, série framework-ours-baseline.
- Prochaine action
- Réceptionner la machine, installer la stack Linux/ROCm documentée, figer un build llama.cpp.
Pourquoi
Toutes les valeurs disponibles pour gpt-oss-120b viennent de tiers, sur des machines Beelink ou GMKtec, avec des runtimes différents, et s'étalent de 30 à 56 t/s 2 3. Le modèle principal de la Box ne peut pas rester sur une fourchette pareille.
Protocole
Niveau 1 de la méthodologie : llama-bench avec les défauts pp512/tg128 1 et profondeurs 0 / 4k / 32k, deux backends, flags communautaires (-fa 1 --no-mmap) 4. Consigner build, Mesa ou ROCm, noyau, réglage GTT, puissance.
Critères de succès
- Écart entre nos mesures et les publications expliqué (backend, build, machine).
- Choix motivé du backend par défaut pour ce modèle (Q-008).
- Trois fiches benchmark
ourspubliées.
Résultat
À venir.
Sources
- 1llama.cpp — README de llama-benchGitHubFiabilité hauteggml-org · publié 2026 (master) · consulté le 16 sept. 2026 · fiche source
- 2strix-halo-guide (README + BENCHMARKS.md)GitHubFiabilité moyenneGitHub (communauté) · hogeheer499 · publié 2026-03 → 2026-08-30 · consulté le 16 sept. 2026 · fiche source
- 3Running 122B-Parameter LLMs Locally on AMD Strix Halo (Pellegrini, LinkedIn)BenchmarkFiabilité moyenneLinkedIn (article personnel) · Pellegrini · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 4amd-strix-halo-toolboxes (README)GitHubFiabilité moyenneGitHub (communauté) · kyuz0 · publié 2025–2026 · consulté le 16 sept. 2026 · fiche source