Aller au contenu
Inférence

Inférence : panorama des moteurs

Comparaison des moteurs de serving (llama-server, Ollama, LM Studio, vLLM, SGLang, Lemonade) pour un Strix Halo sous Linux, et recommandation initiale prudente : llama-server d'abord, vLLM à évaluer.

À vérifier#llama-cpp#vllm#ollama#lemonade#rocm#vulkan#strix-halo#multi-utilisateurs#monitoring#dockerPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026À revérifier le 15 déc. 2026

L'essentiel

  • Le moteur d'inférence est le service qui charge le modèle en mémoire GPU et répond aux requêtes HTTP de l'interface (API compatible OpenAI). Tout le reste de la Box (RAG, interface, permissions) s'appuie dessus.
  • Sur la puce cible (gfx1151), llama.cpp est le moteur le mieux documenté : binaires validés par AMD 2, deux backends (ROCm et Vulkan), nombreuses mesures publiées.
  • vLLM liste gfx1151 dans sa doc d'installation 10, mais les retours de terrain décrivent des images patchées : support réel à vérifier.
  • Ollama, LM Studio et Lemonade sont des surcouches de llama.cpp : plus simples, moins de contrôle.
  • Recommandation initiale : llama-server comme point de départ (ADR-004), vLLM à évaluer quand le multi-utilisateurs réel sera mesuré (Q-002).

Ce qu'on demande au moteur

Pour la Box, le moteur doit :

  1. tourner sur gfx1151 sous Linux, avec un backend stable (ROCm ou Vulkan) ;
  2. exposer une API OpenAI (/v1/chat/completions, /v1/embeddings) pour Open WebUI ou LibreChat ;
  3. servir plusieurs utilisateurs en même temps par continuous batching, avec une file d'attente prévisible ;
  4. maîtriser la mémoire du KV cache (quantification, partage) ;
  5. exposer des métriques pour Prometheus ;
  6. se déployer en conteneur Docker reproductible ;
  7. avoir une licence compatible avec une offre commerciale.

Tableau comparatif

Critèrellama.cpp / llama-serverOllamaLM StudiovLLMSGLangLemonade Server
Support gfx1151ROCm (HIP) et Vulkan ; binaires ROCm 7.1.1 validés par AMD 2gfx1151 listé supporté sous Linux (ROCm), Vulkan en complément 4Runtimes llama.cpp Vulkan et ROCm sélectionnables (communauté)gfx1151 listé, ROCm 7.0.2 minimum 10 ; images patchées en pratique 20 21Non listé (MI300X, MI250) 13 ; image communautaire 16llama.cpp Vulkan/ROCm, builds nightly gfx1151 19
API OpenAIoui + /rerank, /embeddings 1oui (chat, embeddings, responses) 5ouioui (natif)ouioui (port 13305) 18
Batching / parallélisme-np slots, continuous batching par défaut 1OLLAMA_NUM_PARALLEL (défaut 1) 3« Max Concurrent Predictions » (défaut 4) 7continuous batching natif, PagedAttentioncontinuous batching, RadixAttentionnon documenté (hérite de llama-server) 17
Multi-utilisateursfile FIFO, pas de priorité documentéefile FIFO (OLLAMA_MAX_QUEUE 512), pas de priorité 3hérite de llama.cppordonnanceur mature, métriques de fileordonnanceur maturenon documenté
Mémoire / KV--cache-type-k/v f16, q8_0, q4_0… ; --kv-unified ; -faOLLAMA_KV_CACHE_TYPE q8_0/q4_0, OLLAMA_FLASH_ATTENTION 3hérite de llama.cppPagedAttention, KV FP8 selon matérielRadixAttention (préfixes partagés)hérite de llama.cpp
Monitoring--metrics Prometheus llamacpp:*, /slots, /healthnon trouvénon trouvé/metrics Prometheus vllm:* (TTFT, file, KV) 11Prometheusnon trouvé
LicenceMITMIT 6propriétaire, gratuit au travail depuis juillet 2025 9Apache-2.0 12Apache-2.0 15Apache 2.0 17
Dockerghcr.io/ggml-org/llama.cpp:server-rocm / server-vulkanollama/ollama (variante ROCm non vérifiée)daemon llmster + systemd 8vllm/vllm-openai-rocm (rocm/vllm déprécié)lmsysorg/sglang:*-rocm*.deb/.rpm/Snap/Docker
Maturité sur Strix Haloélevée (mesures nombreuses depuis 2025)moyennemoyennefaible à moyenne (images communautaires, un benchmark)faible (issue fermée sans réponse 14)moyenne (portée par AMD)

ik_llama.cpp et MLC-LLM : aucune source spécifique à Strix Halo trouvée ; non évalués.

Lecture du tableau

llama-server coche toutes les cases fonctionnelles, avec deux réserves : l'absence de priorité dans la file d'attente et une observabilité plus pauvre que vLLM (pas de métrique TTFT native). C'est aussi le seul moteur pour lequel on dispose de mesures multi-slots sur cette puce (voir Multi-utilisateurs). Détail : llama.cpp / llama-server.

vLLM apporte un ordonnanceur et des métriques conçus pour le multi-utilisateurs. Sur Strix Halo, la seule comparaison trouvée (Soothill, août 2026) montre vLLM devant llama.cpp en montée en charge sur un petit modèle (311,6 t/s contre 207,1 à 8 clients) et un meilleur TTFT sur un 122B (1,06 s contre 1,78 s), mais avec des quantifications différentes 22. Coût : images non officielles, mémoire moins souple, complexité. Détail : vLLM et SGLang.

Ollama, LM Studio, Lemonade conviennent au poste individuel ou au POC rapide. Pour la Box, ils ajoutent une couche sans ajouter de contrôle. Détail : Ollama, LM Studio, Lemonade.

Recommandation initiale

Prérequis système communs, quel que soit le moteur : noyau et version ROCm compatibles gfx1151, réservation VRAM BIOS minimale et limite GTT augmentée 23 (voir Linux / ROCm).

Questions ouvertes

Ce qu'il reste à tester

Sources

  1. 1llama.cpp — README de llama-server (tools/server)GitHubFiabilité hauteggml-org · publié 2026 (master) · consulté le 16 sept. 2026 · fiche source
  2. 2AMD — binaires llama.cpp validés pour ROCm 7.1.1 (Radeon/Ryzen)Documentation officielleFiabilité hauteAMD · publié 2025–2026 · consulté le 16 sept. 2026 · fiche source
  3. 3Ollama — FAQ officielleDocumentation officielleFiabilité hauteOllama · publié 2026 · consulté le 16 sept. 2026 · fiche source
  4. 4Ollama — support matériel GPUDocumentation officielleFiabilité hauteOllama · publié 2026 · consulté le 16 sept. 2026 · fiche source
  5. 5Ollama — compatibilité API OpenAIDocumentation officielleFiabilité hauteOllama · publié 2026 · consulté le 16 sept. 2026 · fiche source
  6. 6ollama/ollama — dépôt GitHub (licence MIT)GitHubFiabilité hauteOllama · publié 2026 · consulté le 16 sept. 2026 · fiche source
  7. 7LM Studio — Parallel RequestsDocumentation officielleFiabilité hauteLM Studio · publié 2026 · consulté le 16 sept. 2026 · fiche source
  8. 8LM Studio — mode headless (llmster)Documentation officielleFiabilité hauteLM Studio · publié 2026 · consulté le 16 sept. 2026 · fiche source
  9. 9LM Studio is free for use at workConstructeur / éditeurFiabilité hauteLM Studio · publié 2025-07-08 · consulté le 16 sept. 2026 · fiche source
  10. 10vLLM — installation GPU AMD ROCmDocumentation officielleFiabilité hautevLLM · publié 2026 · consulté le 16 sept. 2026 · fiche source
  11. 11vLLM — conception des métriques PrometheusDocumentation officielleFiabilité hautevLLM · publié 2026 · consulté le 16 sept. 2026 · fiche source
  12. 12vllm-project/vllm — dépôt GitHub (Apache-2.0)GitHubFiabilité hautevLLM · publié 2026 · consulté le 16 sept. 2026 · fiche source
  13. 13SGLang — plateforme AMD GPUDocumentation officielleFiabilité hauteSGLang · publié 2026 · consulté le 16 sept. 2026 · fiche source
  14. 14SGLang — issue #5131 support Strix/Strix Halo (gfx1150/gfx1151)GitHubFiabilité moyenneSGLang · publié 2025-04-07 · consulté le 16 sept. 2026 · fiche source
  15. 15sgl-project/sglang — dépôt GitHub (Apache-2.0)GitHubFiabilité hauteSGLang · publié 2026 · consulté le 16 sept. 2026 · fiche source
  16. 16strix-halo-sglang — image Docker SGLang pour gfx1151GitHubFiabilité faibleGitHub (communauté) · JeremiahM37 · publié 2026 · consulté le 16 sept. 2026 · fiche source
  17. 17Lemonade Server — FAQDocumentation officielleFiabilité hauteLemonade SDK / AMD · publié 2026 · consulté le 16 sept. 2026 · fiche source
  18. 18lemonade-sdk/lemonade — dépôt GitHubGitHubFiabilité hauteLemonade SDK / AMD · publié 2026 · consulté le 16 sept. 2026 · fiche source
  19. 19Lemonade Server — options du backend llama.cppDocumentation officielleFiabilité hauteLemonade SDK / AMD · publié 2026 · consulté le 16 sept. 2026 · fiche source
  20. 20Running vLLM on Strix Halo (epheo)BlogFiabilité faibleblog.epheo.eu · epheo · publié 2026-02-15 · consulté le 16 sept. 2026 · fiche source
  21. 21amd-strix-halo-vllm-toolboxes (kyuz0)GitHubFiabilité moyenneGitHub (communauté) · kyuz0 · publié 2026 · consulté le 16 sept. 2026 · fiche source
  22. 22Soothill — SGLang vs vLLM vs llama.cpp on Strix HaloBenchmarkFiabilité hautesoothill.io · Darren Soothill · publié 2026-08-10 · consulté le 16 sept. 2026 · fiche source
  23. 23AMD Strix Halo / RDNA3.5 system optimization (ROCm 10.0)Documentation officielleFiabilité hauteAMD · publié 2026 · consulté le 16 sept. 2026 · fiche source
content/docs/inference/index.md889 mots