Source
I tuned llama.cpp on a Strix Halo mini-PC — why « Vulkan beats ROCm » is a myth (Medium)
ConfirméePublié le 16 sept. 2026Mis à jour le 16 sept. 2026
- Organisation
- Medium
- Auteur
- Bkpaine
- Type
- Blog
- Fiabilité
- Fiabilité faible
- Publié
- 2026-07
- Consulté le
- 16 septembre 2026
- Sujets
- strix-halo, llama-cpp, vulkan, rocm
Citée par 5 page(s)
Méthodologie de benchmark reproductibleBenchmarks · Protocole du laboratoire : llama-bench, llama-batched-bench, vllm bench serve et autres outils de charge, métriques standard, prompts de référence, grille 1/2/3/5/10 utilisateurs, conditions à consigner et pièges.llama.cpp et llama-serverInférence · Le moteur de départ de la Box : slots, contexte partagé, KV cache quantifié, flash attention, métriques Prometheus, images Docker ROCm/Vulkan et flags connus pour gfx1151.ROCm et Vulkan sur gfx1151Linux · État du support ROCm pour le GPU Strix Halo (gfx1151), officiel depuis ROCm 7.13 preview et 10.0 stable, et comparaison Vulkan/RADV contre ROCm/HIP pour llama.cpp, avec des sources contradictoires.Qwen3-30B-A3B (Instruct-2507)Modèle · MoE Alibaba de 30,5 Md (3,3 Md actifs), Apache 2.0, 18,6 Go en Q4 : le candidat « rapide » de la Box, mesuré entre 72 et 98 t/s sur Strix Halo.Comparer Vulkan/RADV et ROCm/HIP dans llama.cppExpérimentation · Mesurer sur nos modèles cibles et nos longueurs de prompt RAG le débit de prompt processing et de génération des deux backends GPU de llama.cpp, pour trancher Q-008.
Ce que dit la source
Titre seulement (page non chargée lors de la recherche) : l'auteur conteste la généralisation « Vulkan bat ROCm » après réglage fin de llama.cpp.
Ce qu'on en retient
Signale une contradiction avec la convergence des autres sources ; à lire avant de trancher q-008.
Limites
Contenu non consulté ; fiabilité inconnue.