Source
Lemonade Server — FAQ
Licence Apache 2.0 ; projet communautaire avec optimisations d'ingénieurs AMD ; backends llama.cpp (Vulkan/ROCm/CPU/Metal), OnnxRuntime GenAI (NPU), F.
- Organisation
- Lemonade SDK / AMD
- Type
- Documentation officielle
- Fiabilité
- Fiabilité haute
- Publié
- 2026
- Consulté le
- 16 septembre 2026
- Sujets
- lemonade, amd
Citée par 3 page(s)
Inférence : panorama des moteursInférence · Comparaison des moteurs de serving (llama-server, Ollama, LM Studio, vLLM, SGLang, Lemonade) pour un Strix Halo sous Linux, et recommandation initiale prudente : llama-server d'abord, vLLM à évaluer.Ollama, LM Studio, Lemonade : les moteurs « faciles »Inférence · Trois surcouches de llama.cpp orientées simplicité : variables de parallélisme d'Ollama, requêtes concurrentes de LM Studio, Lemonade porté par AMD ; limites pour un serveur multi-utilisateurs.vLLM et SGLang sur Strix HaloInférence · État du support gfx1151 (doc officielle vs images communautaires), avantages pour le multi-utilisateurs, coûts en mémoire et complexité, et critères pour basculer depuis llama-server.
Ce que dit la source
Licence Apache 2.0 ; projet communautaire avec optimisations d'ingénieurs AMD ; backends llama.cpp (Vulkan/ROCm/CPU/Metal), OnnxRuntime GenAI (NPU), FastFlowLM (NPU Linux), vLLM expérimental ; Linux et macOS supportés.
Ce qu'on en retient
Surcouche AMD « facile » au-dessus de llama.cpp, avec accès NPU.
Limites
Concurrence multi-utilisateurs non documentée.