Aller au contenu
Terme

vLLM

Serveur d'inférence haute performance conçu pour les GPU de datacenter, avec continuous batching natif et gestion paginée du KV cache (PagedAttention).

Confirmée#vllm#rocmPublié le 16 sept. 2026Mis à jour le 16 sept. 2026

Serveur d'inférence haute performance conçu pour les GPU de datacenter, avec continuous batching natif et gestion paginée du KV cache (PagedAttention).

inférence

vLLM excelle quand de nombreux utilisateurs sollicitent le même modèle : son continuous batching et sa gestion mémoire sont plus avancés que ceux de llama.cpp. Il sert nativement une API OpenAI et des métriques Prometheus.

Sur Strix Halo, le support passe par ROCm et reste jeune (images communautaires, documentation officielle récente). Il fonctionne avec des poids non GGUF (safetensors, FP8, AWQ). C'est le candidat de remplacement si le nombre d'utilisateurs simultanés dépasse ce que llama-server sert confortablement. Licence Apache 2.0.

content/glossary/vllm.md80 mots