Source
amd-strix-halo-vllm-toolboxes (kyuz0)
Image vLLM « patchée » (AITER MoE/FP8 désactivés sur gfx1x, contournements RMSNorm et CUDA Graph) ; image ROCm 10.0 sans benchmark publié ; TP=2 sur d.
- Organisation
- GitHub (communauté)
- Auteur
- kyuz0
- Type
- GitHub
- Fiabilité
- Fiabilité moyenne
- Publié
- 2026
- Consulté le
- 16 septembre 2026
- Sujets
- vllm, strix-halo, rocm
Citée par 3 page(s)
Inférence : panorama des moteursInférence · Comparaison des moteurs de serving (llama-server, Ollama, LM Studio, vLLM, SGLang, Lemonade) pour un Strix Halo sous Linux, et recommandation initiale prudente : llama-server d'abord, vLLM à évaluer.vLLM et SGLang sur Strix HaloInférence · État du support gfx1151 (doc officielle vs images communautaires), avantages pour le multi-utilisateurs, coûts en mémoire et complexité, et critères pour basculer depuis llama-server.Évaluer vLLM sur ROCm gfx1151Expérimentation · Vérifier si l'image officielle vllm/vllm-openai-rocm tourne sans patch sur la machine, si elle sert gpt-oss-120b, et si son ordonnanceur apporte un gain mesurable en TTFT et en débit agrégé face à llama-server.
Ce que dit la source
Image vLLM « patchée » (AITER MoE/FP8 désactivés sur gfx1x, contournements RMSNorm et CUDA Graph) ; image ROCm 10.0 sans benchmark publié ; TP=2 sur deux machines via RDMA validé.
Ce qu'on en retient
vLLM tourne sur Strix Halo, mais avec des patches communautaires.
Limites
Performances non publiées pour l'image récente.