Terme
llama.cpp
Bibliothèque et outils open source en C/C++ pour exécuter des modèles de langage quantifiés au format GGUF sur CPU et GPU, avec des backends CUDA, Vulkan, ROCm et Metal.
Bibliothèque et outils open source en C/C++ pour exécuter des modèles de langage quantifiés au format GGUF sur CPU et GPU, avec des backends CUDA, Vulkan, ROCm et Metal.
inférenceAussi : ggml, llamacpp
llama.cpp est le moteur le plus utilisé pour l'inférence locale. Il est léger, sans dépendance à Python, et supporte le GPU AMD via Vulkan et ROCm. C'est le runtime initial retenu pour la Box (ADR-004), notamment parce que la communauté Strix Halo s'appuie massivement dessus.
Son composant serveur, llama-server, expose une API OpenAI-compatible. Licence MIT.