Terme
Ollama
Outil qui emballe llama.cpp avec un gestionnaire de modèles et une API simple, pour installer et lancer un modèle local en une commande.
Outil qui emballe llama.cpp avec un gestionnaire de modèles et une API simple, pour installer et lancer un modèle local en une commande.
inférence
Ollama simplifie la découverte et la gestion des modèles (ollama pull, ollama run) et expose une API propre ainsi qu'une compatibilité OpenAI. Il supporte le GPU AMD via ROCm et, plus récemment, Vulkan.
Pour la Box, il est une alternative à llama-server mais offre moins de contrôle fin (slots, KV cache) ; plusieurs guides communautaires Strix Halo recommandent llama.cpp direct pour la performance. Licence MIT.