Aller au contenu
Inférence

Ollama, LM Studio, Lemonade : les moteurs « faciles »

Trois surcouches de llama.cpp orientées simplicité : variables de parallélisme d'Ollama, requêtes concurrentes de LM Studio, Lemonade porté par AMD ; limites pour un serveur multi-utilisateurs.

À vérifier#ollama#lemonade#llama-cpp#rocm#vulkan#multi-utilisateursPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026À revérifier le 15 déc. 2026

L'essentiel

  • Les trois outils embarquent llama.cpp et exposent une API OpenAI ; ils gèrent le téléchargement des modèles et le chargement à la demande.
  • Ollama : MIT, gfx1151 supporté sous Linux, mais une requête à la fois par défaut (OLLAMA_NUM_PARALLEL=1) et pas de métriques Prometheus documentées 1.
  • LM Studio : propriétaire, gratuit au travail, 4 requêtes concurrentes par défaut, daemon headless ; mesuré nettement plus lent que llama.cpp direct sur gpt-oss-120b dans une source.
  • Lemonade Server : projet Apache 2.0 sponsorisé par AMD, builds ROCm gfx1151, accès NPU ; concurrence non documentée.
  • Pour la Box : utiles en POC ou sur poste individuel ; pour le serveur, ils retirent du contrôle sans rien ajouter par rapport à llama-server.

Ollama

Support AMD. Ollama s'appuie sur ROCm ; Vulkan est disponible en complément sous Linux et Windows ; gfx1151 (Ryzen AI Max+ 395) est listé supporté sous Linux 2. Le backend Vulkan est arrivé en expérimental avec la version 0.12.6 5.

Parallélisme et file. Variables documentées dans la FAQ 1 :

VariableRôleDéfaut
OLLAMA_NUM_PARALLELrequêtes traitées simultanément par modèle ; « Required RAM will scale by OLLAMA_NUM_PARALLEL × OLLAMA_CONTEXT_LENGTH »1
OLLAMA_MAX_LOADED_MODELSmodèles chargés simultanément3 par GPU
OLLAMA_MAX_QUEUEtaille de la file d'attente512
OLLAMA_CONTEXT_LENGTHfenêtre de contexte4096
OLLAMA_KV_CACHE_TYPEtype du KV cache : q8_0 « environ la moitié de f16 », q4_0 « environ le quart »f16
OLLAMA_FLASH_ATTENTIONforcer la flash attention (automatique si supportée)auto

Les requêtes en attente « will be processed in order » : FIFO, pas de priorité. Le contexte par défaut de 4 096 tokens est très insuffisant pour l'analyse de dossiers ; il doit être relevé explicitement. Attention : Ollama décharge les modèles inactifs et les recharge à la demande, ce qui provoque un premier appel lent après une période de silence.

API. /v1/chat/completions, /v1/completions, /v1/embeddings, /v1/models, /v1/responses ; outils, streaming, JSON, vision ; logprobs non supporté 3. Licence MIT 4.

Mesure Strix Halo. Llama 3.1 70B Q4_K_M sous Ollama Vulkan : 4,7 à 4,9 t/s 14, cohérent avec llama.cpp direct (borne mémoire).

Limites pour la Box. Pas de métriques exposées, réglages par variables d'environnement globales, pas de --kv-unified ni de choix fin des slots, déchargement automatique. Convient au POC.

LM Studio

Concurrence. « Parallel requests via continuous batching » ; « Max Concurrent Predictions » à 4 par défaut ; nécessite le runtime GGUF llama.cpp v2.0.0 6. Mode serveur sans interface : daemon llmster, lms server start, systemd sous Linux 7. Runtimes Vulkan et ROCm sélectionnables sous Linux sur Strix Halo (guide communautaire) 9.

Licence. Propriétaire ; gratuit pour usage professionnel depuis le 8 juillet 2025, offre Enterprise payante, CGU mises à jour le 23 août 2026 8. Code non auditable : un point faible pour un produit vendu sur la confidentialité.

Mesures Strix Halo. gpt-oss-120b : environ 48 t/s sous Linux selon Framework 16, mais environ 30 t/s avec le runtime ROCm selon MindStudio 15, contre 51 à 56 t/s en llama.cpp direct. Sources contradictoires (voir gpt-oss-120b) ; l'écart illustre le coût potentiel d'une surcouche mal réglée.

Lemonade Server (AMD)

Projet Apache 2.0, « communautaire avec des optimisations d'ingénieurs AMD », sponsorisé par AMD 10. Backends : llama.cpp (Vulkan, ROCm, CPU), OnnxRuntime GenAI et FastFlowLM pour le NPU, vLLM expérimental sur Strix Halo. Linux supporté. API OpenAI sur http://localhost:13305/v1 ; installeurs .deb/.rpm/Snap/Arch et Docker 11.

Intérêt spécifique : canal ROCm nightly avec builds llama.cpp par architecture, dont gfx1151 (lemonade config set rocm_channel=nightly) 12 13. Ces builds peuvent servir même sans Lemonade.

Limites : concurrence multi-utilisateurs non documentée (dépend du llama-server sous-jacent), pas de métriques documentées, projet jeune.

Positionnement pour la Box

BesoinOllamaLM StudioLemonadellama-server direct
Installation en 10 minutesouiouiouinon (image Docker + flags)
Contrôle des slots et du KVpartiel (variables)partiel (GUI)non documentécomplet
Métriques Prometheusnon trouvénon trouvénon trouvé--metrics
LicenceMITpropriétaireApache 2.0MIT
Auditabilitéouinonouioui

Questions ouvertes

Sources

  1. 1Ollama — FAQ officielleDocumentation officielleFiabilité hauteOllama · publié 2026 · consulté le 16 sept. 2026 · fiche source
  2. 2Ollama — support matériel GPUDocumentation officielleFiabilité hauteOllama · publié 2026 · consulté le 16 sept. 2026 · fiche source
  3. 3Ollama — compatibilité API OpenAIDocumentation officielleFiabilité hauteOllama · publié 2026 · consulté le 16 sept. 2026 · fiche source
  4. 4ollama/ollama — dépôt GitHub (licence MIT)GitHubFiabilité hauteOllama · publié 2026 · consulté le 16 sept. 2026 · fiche source
  5. 5Phoronix — Ollama rolls out experimental Vulkan supportArticle techniqueFiabilité moyennePhoronix · Michael Larabel · publié 2025 · consulté le 16 sept. 2026 · fiche source
  6. 6LM Studio — Parallel RequestsDocumentation officielleFiabilité hauteLM Studio · publié 2026 · consulté le 16 sept. 2026 · fiche source
  7. 7LM Studio — mode headless (llmster)Documentation officielleFiabilité hauteLM Studio · publié 2026 · consulté le 16 sept. 2026 · fiche source
  8. 8LM Studio is free for use at workConstructeur / éditeurFiabilité hauteLM Studio · publié 2025-07-08 · consulté le 16 sept. 2026 · fiche source
  9. 9Running LM Studio on Linux with Strix Halo (guide et dépannage)BlogFiabilité faibleSubstack · Jürgen Fey · publié 2026 · consulté le 16 sept. 2026 · fiche source
  10. 10Lemonade Server — FAQDocumentation officielleFiabilité hauteLemonade SDK / AMD · publié 2026 · consulté le 16 sept. 2026 · fiche source
  11. 11lemonade-sdk/lemonade — dépôt GitHubGitHubFiabilité hauteLemonade SDK / AMD · publié 2026 · consulté le 16 sept. 2026 · fiche source
  12. 12Lemonade Server — options du backend llama.cppDocumentation officielleFiabilité hauteLemonade SDK / AMD · publié 2026 · consulté le 16 sept. 2026 · fiche source
  13. 13lemonade-sdk/llamacpp-rocm — builds nightly llama.cpp + ROCm 7GitHubFiabilité hauteLemonade SDK / AMD · publié 2026 · consulté le 16 sept. 2026 · fiche source
  14. 14strix-halo-guide (README + BENCHMARKS.md)GitHubFiabilité moyenneGitHub (communauté) · hogeheer499 · publié 2026-03 → 2026-08-30 · consulté le 16 sept. 2026 · fiche source
  15. 15Local LLM Speed Test: GPT-OSS, Qwen3.6 and Hermes on 128GB Unified Memory (MindStudio)BenchmarkFiabilité moyenneMindStudio · publié 2026-07-21 · consulté le 16 sept. 2026 · fiche source
  16. 16Using a Framework Desktop for local AI (blog Framework)Constructeur / éditeurFiabilité moyenneFramework Computer Inc. · Nirav Patel · publié 2025-07-07 (màj 2025-12-02) · consulté le 16 sept. 2026 · fiche source
content/docs/inference/ollama-lm-studio-lemonade.md794 mots