Continuous batching
Technique de serveur d'inférence qui insère de nouvelles requêtes dans le lot en cours à chaque étape de génération, au lieu d'attendre que toutes les séquences du lot soient terminées.
Technique de serveur d'inférence qui insère de nouvelles requêtes dans le lot en cours à chaque étape de génération, au lieu d'attendre que toutes les séquences du lot soient terminées.
Avec le continuous batching, un utilisateur qui arrive pendant qu'un autre génère n'attend pas la fin de la réponse précédente : sa requête rejoint le lot dès l'étape suivante. Le débit agrégé du serveur augmente nettement pour un coût marginal par utilisateur.
llama-server l'implémente via ses slots ; vLLM en fait son mode natif. C'est ce mécanisme qui permet de servir plusieurs avocats en parallèle avec un seul modèle chargé.