Aller au contenu
Terme

llama.cpp

Bibliothèque et outils open source en C/C++ pour exécuter des modèles de langage quantifiés au format GGUF sur CPU et GPU, avec des backends CUDA, Vulkan, ROCm et Metal.

Confirmée#llama-cppPublié le 16 sept. 2026Mis à jour le 16 sept. 2026

Bibliothèque et outils open source en C/C++ pour exécuter des modèles de langage quantifiés au format GGUF sur CPU et GPU, avec des backends CUDA, Vulkan, ROCm et Metal.

inférenceAussi : ggml, llamacpp

llama.cpp est le moteur le plus utilisé pour l'inférence locale. Il est léger, sans dépendance à Python, et supporte le GPU AMD via Vulkan et ROCm. C'est le runtime initial retenu pour la Box (ADR-004), notamment parce que la communauté Strix Halo s'appuie massivement dessus.

Son composant serveur, llama-server, expose une API OpenAI-compatible. Licence MIT.

content/glossary/llama-cpp.md57 mots