Source
Anyscale — How continuous batching enables 23x throughput in LLM inference
L'inférence LLM est bornée par les entrées-sorties mémoire ; continuous batching = ordonnancement par itération ; jusqu'à 23 fois le débit avec vLLM.
- Organisation
- Anyscale
- Type
- Article technique
- Fiabilité
- Fiabilité haute
- Publié
- 2023-06-22
- Consulté le
- 16 septembre 2026
- Sujets
- multi-utilisateurs, vllm
Citée par 2 page(s)
vLLM et SGLang sur Strix HaloInférence · État du support gfx1151 (doc officielle vs images communautaires), avantages pour le multi-utilisateurs, coûts en mémoire et complexité, et critères pour basculer depuis llama-server.Multi-utilisateurs : servir 5 à 10 personnes sur une seule machineMulti-utilisateurs · Pourquoi une machine à 256 Go/s est bornée en génération, ce que le batching et les MoE y changent, ce que les mesures publiées disent, et ce qu'il reste à mesurer avant de promettre un nombre d'utilisateurs.
Ce que dit la source
L'inférence LLM est bornée par les entrées-sorties mémoire ; continuous batching = ordonnancement par itération ; jusqu'à 23 fois le débit avec vLLM ; amélioration aussi de la latence médiane.
Ce qu'on en retient
Explique pourquoi servir plusieurs utilisateurs coûte moins que N fois une requête.
Limites
Chiffre obtenu sur GPU datacenter avec des requêtes de longueur variable.