Aller au contenu
Terme

Continuous batching

Technique de serveur d'inférence qui insère de nouvelles requêtes dans le lot en cours à chaque étape de génération, au lieu d'attendre que toutes les séquences du lot soient terminées.

Confirmée#multi-utilisateurs#llama-cpp#vllmPublié le 16 sept. 2026Mis à jour le 16 sept. 2026

Technique de serveur d'inférence qui insère de nouvelles requêtes dans le lot en cours à chaque étape de génération, au lieu d'attendre que toutes les séquences du lot soient terminées.

inférenceAussi : batching continu, in-flight batching

Avec le continuous batching, un utilisateur qui arrive pendant qu'un autre génère n'attend pas la fin de la réponse précédente : sa requête rejoint le lot dès l'étape suivante. Le débit agrégé du serveur augmente nettement pour un coût marginal par utilisateur.

llama-server l'implémente via ses slots ; vLLM en fait son mode natif. C'est ce mécanisme qui permet de servir plusieurs avocats en parallèle avec un seul modèle chargé.

content/glossary/continuous-batching.md70 mots