vLLM
Serveur d'inférence haute performance conçu pour les GPU de datacenter, avec continuous batching natif et gestion paginée du KV cache (PagedAttention).
Serveur d'inférence haute performance conçu pour les GPU de datacenter, avec continuous batching natif et gestion paginée du KV cache (PagedAttention).
vLLM excelle quand de nombreux utilisateurs sollicitent le même modèle : son continuous batching et sa gestion mémoire sont plus avancés que ceux de llama.cpp. Il sert nativement une API OpenAI et des métriques Prometheus.
Sur Strix Halo, le support passe par ROCm et reste jeune (images communautaires, documentation officielle récente). Il fonctionne avec des poids non GGUF (safetensors, FP8, AWQ). C'est le candidat de remplacement si le nombre d'utilisateurs simultanés dépasse ce que llama-server sert confortablement. Licence Apache 2.0.