vLLM et SGLang sur Strix Halo
État du support gfx1151 (doc officielle vs images communautaires), avantages pour le multi-utilisateurs, coûts en mémoire et complexité, et critères pour basculer depuis llama-server.
L'essentiel
- vLLM est le serveur de référence du multi-utilisateurs : continuous batching natif, PagedAttention, métriques détaillées (TTFT, file d'attente, occupation KV) 2.
- Sa doc liste gfx1151 avec ROCm 7.0.2 minimum 1 ; les retours communautaires de 2026 décrivent des images patchées 4 5. Contradiction non tranchée.
- Une seule comparaison publiée sur cette puce (Soothill, août 2026) : vLLM meilleur en montée en charge et en TTFT, mais quantifications non équivalentes 6.
- SGLang : non supporté officiellement sur gfx1151, image communautaire, 36 à 47 % derrière vLLM dans le même test. Non prioritaire.
- Position : évaluer vLLM, ne pas démarrer avec.
État du support gfx1151
Ce que vLLM apporte
- Ordonnancement : le continuous batching fonctionne au niveau de l'itération ; les séquences terminées libèrent leur place immédiatement. Anyscale a mesuré jusqu'à 23 fois le débit d'un batching statique sur GPU datacenter, avec une latence médiane améliorée 11. llama-server fait aussi du continuous batching ; la différence tient à la maturité de l'ordonnanceur et à la gestion paginée du KV cache.
- Observabilité :
vllm:num_requests_running,vllm:num_requests_waiting,vllm:kv_cache_usage_perc,vllm:time_to_first_token_seconds,vllm:inter_token_latency_seconds,vllm:e2e_request_latency_seconds2. C'est exactement ce que la Box doit surveiller pour tenir un SLA de temps de réponse ; llama-server n'expose ni TTFT ni file. - Mesure Strix Halo (GMKtec EVO-X3, vLLM 0.26.0, llama.cpp b10333, ROCm 7.14.0) 6 :
| Modèle | Moteur | 1 client | 4 clients | 8 clients |
|---|---|---|---|---|
| Qwen3.5-0.8B BF16 | vLLM | 86,6 t/s | 246,5 | 311,6 |
| Qwen3.5-0.8B BF16 | llama.cpp | 81,7 t/s | 138,0 | 207,1 |
| Modèle | Moteur | 1 client | 2 clients | TTFT |
|---|---|---|---|---|
| Qwen3.5-122B-A10B Q4_K_XL | llama.cpp | 13,6 t/s | 17,9 | 1,775 s |
| Qwen3.5-122B-A10B GPTQ | vLLM | 10,3 t/s | 16,2 | 1,056 s |
Débits agrégés. Sur le 122B, les quantifications diffèrent (GGUF Q4_K_XL vs GPTQ) : la comparaison n'est pas à modèle égal. L'auteur conclut « there is no single fastest LLM server on Strix Halo ».
Ce que vLLM coûte
- Mémoire : vLLM pré-alloue le KV cache (fraction de la mémoire GPU) et charge les poids en BF16, FP8 ou via des quantifications GPTQ/AWQ ; le support des GGUF est partiel. Sur une machine à mémoire unifiée partagée avec la base vectorielle et l'interface, cette rigidité pèse. Chiffres à mesurer.
- Compatibilité modèles : les noyaux optimisés (AITER, FP8) sont désactivés sur gfx1x dans les images communautaires ; les MoE récents et les architectures hybrides sont les plus exposés.
- Complexité : pile Python + ROCm + Triton ; images de plusieurs Go ; dépendance à des patches tiers tant que le support upstream n'est pas confirmé.
- gpt-oss-120b sous vLLM sur Strix Halo : aucune mesure trouvée.
SGLang
Doc AMD officielle : MI300X et MI250 uniquement 7. Issue #5131 demandant gfx1151 fermée « inactive » sans réponse 8. Image communautaire SGLang 0.5.17 / ROCm 7.14 avec gfx1151 ajouté aux cibles AOT 10. Dans le test Soothill, SGLang est 36,2 à 46,7 % derrière vLLM 6. Apache-2.0 9. Non prioritaire pour la Box.
Lemonade Server (AMD) propose un backend vLLM « expérimental, ROCm for Strix Halo » 12 : signal que AMD y travaille, pas une garantie.
Quand basculer
Questions ouvertes
Ce qu'il reste à tester
Sources
- 1vLLM — installation GPU AMD ROCmDocumentation officielleFiabilité hautevLLM · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 2vLLM — conception des métriques PrometheusDocumentation officielleFiabilité hautevLLM · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 3vllm-project/vllm — dépôt GitHub (Apache-2.0)GitHubFiabilité hautevLLM · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 4Running vLLM on Strix Halo (epheo)BlogFiabilité faibleblog.epheo.eu · epheo · publié 2026-02-15 · consulté le 16 sept. 2026 · fiche source
- 5amd-strix-halo-vllm-toolboxes (kyuz0)GitHubFiabilité moyenneGitHub (communauté) · kyuz0 · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 6Soothill — SGLang vs vLLM vs llama.cpp on Strix HaloBenchmarkFiabilité hautesoothill.io · Darren Soothill · publié 2026-08-10 · consulté le 16 sept. 2026 · fiche source
- 7SGLang — plateforme AMD GPUDocumentation officielleFiabilité hauteSGLang · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 8SGLang — issue #5131 support Strix/Strix Halo (gfx1150/gfx1151)GitHubFiabilité moyenneSGLang · publié 2025-04-07 · consulté le 16 sept. 2026 · fiche source
- 9sgl-project/sglang — dépôt GitHub (Apache-2.0)GitHubFiabilité hauteSGLang · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 10strix-halo-sglang — image Docker SGLang pour gfx1151GitHubFiabilité faibleGitHub (communauté) · JeremiahM37 · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 11Anyscale — How continuous batching enables 23x throughput in LLM inferenceArticle techniqueFiabilité hauteAnyscale · publié 2023-06-22 · consulté le 16 sept. 2026 · fiche source
- 12Lemonade Server — FAQDocumentation officielleFiabilité hauteLemonade SDK / AMD · publié 2026 · consulté le 16 sept. 2026 · fiche source