Aller au contenu
Inférence

vLLM et SGLang sur Strix Halo

État du support gfx1151 (doc officielle vs images communautaires), avantages pour le multi-utilisateurs, coûts en mémoire et complexité, et critères pour basculer depuis llama-server.

À vérifier#vllm#rocm#strix-halo#multi-utilisateurs#monitoring#dockerPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026À revérifier le 15 déc. 2026

L'essentiel

  • vLLM est le serveur de référence du multi-utilisateurs : continuous batching natif, PagedAttention, métriques détaillées (TTFT, file d'attente, occupation KV) 2.
  • Sa doc liste gfx1151 avec ROCm 7.0.2 minimum 1 ; les retours communautaires de 2026 décrivent des images patchées 4 5. Contradiction non tranchée.
  • Une seule comparaison publiée sur cette puce (Soothill, août 2026) : vLLM meilleur en montée en charge et en TTFT, mais quantifications non équivalentes 6.
  • SGLang : non supporté officiellement sur gfx1151, image communautaire, 36 à 47 % derrière vLLM dans le même test. Non prioritaire.
  • Position : évaluer vLLM, ne pas démarrer avec.

État du support gfx1151

Ce que vLLM apporte

  • Ordonnancement : le continuous batching fonctionne au niveau de l'itération ; les séquences terminées libèrent leur place immédiatement. Anyscale a mesuré jusqu'à 23 fois le débit d'un batching statique sur GPU datacenter, avec une latence médiane améliorée 11. llama-server fait aussi du continuous batching ; la différence tient à la maturité de l'ordonnanceur et à la gestion paginée du KV cache.
  • Observabilité : vllm:num_requests_running, vllm:num_requests_waiting, vllm:kv_cache_usage_perc, vllm:time_to_first_token_seconds, vllm:inter_token_latency_seconds, vllm:e2e_request_latency_seconds 2. C'est exactement ce que la Box doit surveiller pour tenir un SLA de temps de réponse ; llama-server n'expose ni TTFT ni file.
  • Mesure Strix Halo (GMKtec EVO-X3, vLLM 0.26.0, llama.cpp b10333, ROCm 7.14.0) 6 :
ModèleMoteur1 client4 clients8 clients
Qwen3.5-0.8B BF16vLLM86,6 t/s246,5311,6
Qwen3.5-0.8B BF16llama.cpp81,7 t/s138,0207,1
ModèleMoteur1 client2 clientsTTFT
Qwen3.5-122B-A10B Q4_K_XLllama.cpp13,6 t/s17,91,775 s
Qwen3.5-122B-A10B GPTQvLLM10,3 t/s16,21,056 s

Débits agrégés. Sur le 122B, les quantifications diffèrent (GGUF Q4_K_XL vs GPTQ) : la comparaison n'est pas à modèle égal. L'auteur conclut « there is no single fastest LLM server on Strix Halo ».

Ce que vLLM coûte

  • Mémoire : vLLM pré-alloue le KV cache (fraction de la mémoire GPU) et charge les poids en BF16, FP8 ou via des quantifications GPTQ/AWQ ; le support des GGUF est partiel. Sur une machine à mémoire unifiée partagée avec la base vectorielle et l'interface, cette rigidité pèse. Chiffres à mesurer.
  • Compatibilité modèles : les noyaux optimisés (AITER, FP8) sont désactivés sur gfx1x dans les images communautaires ; les MoE récents et les architectures hybrides sont les plus exposés.
  • Complexité : pile Python + ROCm + Triton ; images de plusieurs Go ; dépendance à des patches tiers tant que le support upstream n'est pas confirmé.
  • gpt-oss-120b sous vLLM sur Strix Halo : aucune mesure trouvée.

SGLang

Doc AMD officielle : MI300X et MI250 uniquement 7. Issue #5131 demandant gfx1151 fermée « inactive » sans réponse 8. Image communautaire SGLang 0.5.17 / ROCm 7.14 avec gfx1151 ajouté aux cibles AOT 10. Dans le test Soothill, SGLang est 36,2 à 46,7 % derrière vLLM 6. Apache-2.0 9. Non prioritaire pour la Box.

Lemonade Server (AMD) propose un backend vLLM « expérimental, ROCm for Strix Halo » 12 : signal que AMD y travaille, pas une garantie.

Quand basculer

Questions ouvertes

Ce qu'il reste à tester

Sources

  1. 1vLLM — installation GPU AMD ROCmDocumentation officielleFiabilité hautevLLM · publié 2026 · consulté le 16 sept. 2026 · fiche source
  2. 2vLLM — conception des métriques PrometheusDocumentation officielleFiabilité hautevLLM · publié 2026 · consulté le 16 sept. 2026 · fiche source
  3. 3vllm-project/vllm — dépôt GitHub (Apache-2.0)GitHubFiabilité hautevLLM · publié 2026 · consulté le 16 sept. 2026 · fiche source
  4. 4Running vLLM on Strix Halo (epheo)BlogFiabilité faibleblog.epheo.eu · epheo · publié 2026-02-15 · consulté le 16 sept. 2026 · fiche source
  5. 5amd-strix-halo-vllm-toolboxes (kyuz0)GitHubFiabilité moyenneGitHub (communauté) · kyuz0 · publié 2026 · consulté le 16 sept. 2026 · fiche source
  6. 6Soothill — SGLang vs vLLM vs llama.cpp on Strix HaloBenchmarkFiabilité hautesoothill.io · Darren Soothill · publié 2026-08-10 · consulté le 16 sept. 2026 · fiche source
  7. 7SGLang — plateforme AMD GPUDocumentation officielleFiabilité hauteSGLang · publié 2026 · consulté le 16 sept. 2026 · fiche source
  8. 8SGLang — issue #5131 support Strix/Strix Halo (gfx1150/gfx1151)GitHubFiabilité moyenneSGLang · publié 2025-04-07 · consulté le 16 sept. 2026 · fiche source
  9. 9sgl-project/sglang — dépôt GitHub (Apache-2.0)GitHubFiabilité hauteSGLang · publié 2026 · consulté le 16 sept. 2026 · fiche source
  10. 10strix-halo-sglang — image Docker SGLang pour gfx1151GitHubFiabilité faibleGitHub (communauté) · JeremiahM37 · publié 2026 · consulté le 16 sept. 2026 · fiche source
  11. 11Anyscale — How continuous batching enables 23x throughput in LLM inferenceArticle techniqueFiabilité hauteAnyscale · publié 2023-06-22 · consulté le 16 sept. 2026 · fiche source
  12. 12Lemonade Server — FAQDocumentation officielleFiabilité hauteLemonade SDK / AMD · publié 2026 · consulté le 16 sept. 2026 · fiche source
content/docs/inference/vllm-sglang.md769 mots