Ollama, LM Studio, Lemonade : les moteurs « faciles »
Trois surcouches de llama.cpp orientées simplicité : variables de parallélisme d'Ollama, requêtes concurrentes de LM Studio, Lemonade porté par AMD ; limites pour un serveur multi-utilisateurs.
L'essentiel
- Les trois outils embarquent llama.cpp et exposent une API OpenAI ; ils gèrent le téléchargement des modèles et le chargement à la demande.
- Ollama : MIT, gfx1151 supporté sous Linux, mais une requête à la fois par défaut (
OLLAMA_NUM_PARALLEL=1) et pas de métriques Prometheus documentées 1. - LM Studio : propriétaire, gratuit au travail, 4 requêtes concurrentes par défaut, daemon headless ; mesuré nettement plus lent que llama.cpp direct sur gpt-oss-120b dans une source.
- Lemonade Server : projet Apache 2.0 sponsorisé par AMD, builds ROCm gfx1151, accès NPU ; concurrence non documentée.
- Pour la Box : utiles en POC ou sur poste individuel ; pour le serveur, ils retirent du contrôle sans rien ajouter par rapport à llama-server.
Ollama
Support AMD. Ollama s'appuie sur ROCm ; Vulkan est disponible en complément sous Linux et Windows ; gfx1151 (Ryzen AI Max+ 395) est listé supporté sous Linux 2. Le backend Vulkan est arrivé en expérimental avec la version 0.12.6 5.
Parallélisme et file. Variables documentées dans la FAQ 1 :
| Variable | Rôle | Défaut |
|---|---|---|
OLLAMA_NUM_PARALLEL | requêtes traitées simultanément par modèle ; « Required RAM will scale by OLLAMA_NUM_PARALLEL × OLLAMA_CONTEXT_LENGTH » | 1 |
OLLAMA_MAX_LOADED_MODELS | modèles chargés simultanément | 3 par GPU |
OLLAMA_MAX_QUEUE | taille de la file d'attente | 512 |
OLLAMA_CONTEXT_LENGTH | fenêtre de contexte | 4096 |
OLLAMA_KV_CACHE_TYPE | type du KV cache : q8_0 « environ la moitié de f16 », q4_0 « environ le quart » | f16 |
OLLAMA_FLASH_ATTENTION | forcer la flash attention (automatique si supportée) | auto |
Les requêtes en attente « will be processed in order » : FIFO, pas de priorité. Le contexte par défaut de 4 096 tokens est très insuffisant pour l'analyse de dossiers ; il doit être relevé explicitement. Attention : Ollama décharge les modèles inactifs et les recharge à la demande, ce qui provoque un premier appel lent après une période de silence.
API. /v1/chat/completions, /v1/completions, /v1/embeddings, /v1/models, /v1/responses ; outils, streaming, JSON, vision ; logprobs non supporté 3. Licence MIT 4.
Mesure Strix Halo. Llama 3.1 70B Q4_K_M sous Ollama Vulkan : 4,7 à 4,9 t/s 14, cohérent avec llama.cpp direct (borne mémoire).
Limites pour la Box. Pas de métriques exposées, réglages par variables d'environnement globales, pas de --kv-unified ni de choix fin des slots, déchargement automatique. Convient au POC.
LM Studio
Concurrence. « Parallel requests via continuous batching » ; « Max Concurrent Predictions » à 4 par défaut ; nécessite le runtime GGUF llama.cpp v2.0.0 6. Mode serveur sans interface : daemon llmster, lms server start, systemd sous Linux 7. Runtimes Vulkan et ROCm sélectionnables sous Linux sur Strix Halo (guide communautaire) 9.
Licence. Propriétaire ; gratuit pour usage professionnel depuis le 8 juillet 2025, offre Enterprise payante, CGU mises à jour le 23 août 2026 8. Code non auditable : un point faible pour un produit vendu sur la confidentialité.
Mesures Strix Halo. gpt-oss-120b : environ 48 t/s sous Linux selon Framework 16, mais environ 30 t/s avec le runtime ROCm selon MindStudio 15, contre 51 à 56 t/s en llama.cpp direct. Sources contradictoires (voir gpt-oss-120b) ; l'écart illustre le coût potentiel d'une surcouche mal réglée.
Lemonade Server (AMD)
Projet Apache 2.0, « communautaire avec des optimisations d'ingénieurs AMD », sponsorisé par AMD 10. Backends : llama.cpp (Vulkan, ROCm, CPU), OnnxRuntime GenAI et FastFlowLM pour le NPU, vLLM expérimental sur Strix Halo. Linux supporté. API OpenAI sur http://localhost:13305/v1 ; installeurs .deb/.rpm/Snap/Arch et Docker 11.
Intérêt spécifique : canal ROCm nightly avec builds llama.cpp par architecture, dont gfx1151 (lemonade config set rocm_channel=nightly) 12 13. Ces builds peuvent servir même sans Lemonade.
Limites : concurrence multi-utilisateurs non documentée (dépend du llama-server sous-jacent), pas de métriques documentées, projet jeune.
Positionnement pour la Box
| Besoin | Ollama | LM Studio | Lemonade | llama-server direct |
|---|---|---|---|---|
| Installation en 10 minutes | oui | oui | oui | non (image Docker + flags) |
| Contrôle des slots et du KV | partiel (variables) | partiel (GUI) | non documenté | complet |
| Métriques Prometheus | non trouvé | non trouvé | non trouvé | --metrics |
| Licence | MIT | propriétaire | Apache 2.0 | MIT |
| Auditabilité | oui | non | oui | oui |
Questions ouvertes
Sources
- 1Ollama — FAQ officielleDocumentation officielleFiabilité hauteOllama · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 2Ollama — support matériel GPUDocumentation officielleFiabilité hauteOllama · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 3Ollama — compatibilité API OpenAIDocumentation officielleFiabilité hauteOllama · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 4ollama/ollama — dépôt GitHub (licence MIT)GitHubFiabilité hauteOllama · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 5Phoronix — Ollama rolls out experimental Vulkan supportArticle techniqueFiabilité moyennePhoronix · Michael Larabel · publié 2025 · consulté le 16 sept. 2026 · fiche source
- 6LM Studio — Parallel RequestsDocumentation officielleFiabilité hauteLM Studio · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 7LM Studio — mode headless (llmster)Documentation officielleFiabilité hauteLM Studio · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 8LM Studio is free for use at workConstructeur / éditeurFiabilité hauteLM Studio · publié 2025-07-08 · consulté le 16 sept. 2026 · fiche source
- 9Running LM Studio on Linux with Strix Halo (guide et dépannage)BlogFiabilité faibleSubstack · Jürgen Fey · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 10Lemonade Server — FAQDocumentation officielleFiabilité hauteLemonade SDK / AMD · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 11lemonade-sdk/lemonade — dépôt GitHubGitHubFiabilité hauteLemonade SDK / AMD · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 12Lemonade Server — options du backend llama.cppDocumentation officielleFiabilité hauteLemonade SDK / AMD · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 13lemonade-sdk/llamacpp-rocm — builds nightly llama.cpp + ROCm 7GitHubFiabilité hauteLemonade SDK / AMD · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 14strix-halo-guide (README + BENCHMARKS.md)GitHubFiabilité moyenneGitHub (communauté) · hogeheer499 · publié 2026-03 → 2026-08-30 · consulté le 16 sept. 2026 · fiche source
- 15Local LLM Speed Test: GPT-OSS, Qwen3.6 and Hermes on 128GB Unified Memory (MindStudio)BenchmarkFiabilité moyenneMindStudio · publié 2026-07-21 · consulté le 16 sept. 2026 · fiche source
- 16Using a Framework Desktop for local AI (blog Framework)Constructeur / éditeurFiabilité moyenneFramework Computer Inc. · Nirav Patel · publié 2025-07-07 (màj 2025-12-02) · consulté le 16 sept. 2026 · fiche source