Source
Running vLLM on Strix Halo (epheo)
ConfirméePublié le 16 sept. 2026Mis à jour le 16 sept. 2026
- Organisation
- blog.epheo.eu
- Auteur
- epheo
- Type
- Blog
- Fiabilité
- Fiabilité faible
- Publié
- 2026-02-15
- Consulté le
- 16 septembre 2026
- Sujets
- vllm, rocm, strix-halo
Citée par 5 page(s)
Inférence : panorama des moteursInférence · Comparaison des moteurs de serving (llama-server, Ollama, LM Studio, vLLM, SGLang, Lemonade) pour un Strix Halo sous Linux, et recommandation initiale prudente : llama-server d'abord, vLLM à évaluer.vLLM et SGLang sur Strix HaloInférence · État du support gfx1151 (doc officielle vs images communautaires), avantages pour le multi-utilisateurs, coûts en mémoire et complexité, et critères pour basculer depuis llama-server.ROCm et Vulkan sur gfx1151Linux · État du support ROCm pour le GPU Strix Halo (gfx1151), officiel depuis ROCm 7.13 preview et 10.0 stable, et comparaison Vulkan/RADV contre ROCm/HIP pour llama.cpp, avec des sources contradictoires.Framework Desktop (Ryzen AI Max+ 395, 128 Go)Matériel · Machine candidate de la Box IA : APU AMD Strix Halo avec 128 Go de mémoire unifiée, compacte et silencieuse, mais dont le support ROCm n'est officiel que depuis août 2026 et dont la stabilité sous forte charge GPU reste à démontrer.Évaluer vLLM sur ROCm gfx1151Expérimentation · Vérifier si l'image officielle vllm/vllm-openai-rocm tourne sans patch sur la machine, si elle sert gpt-oss-120b, et si son ordonnanceur apporte un gain mesurable en TTFT et en débit agrégé face à llama-server.
Ce que dit la source
vLLM fonctionne sur gfx1151 via les nightlies TheRock et HIP_FORCE_DEV_KERNARG=1, mais gfx1151 n'est pas dans la liste des GPU vLLM upstream et amdsmi ne reconnaît pas la puce. Aucun chiffre de performance.
Ce qu'on en retient
vLLM sur Strix Halo reste expérimental ; llama.cpp est la voie réaliste à court terme.
Limites
Note personnelle, sans mesure ; février 2026.