Source
vLLM — commande vllm bench serve
Options --backend openai-chat, --dataset-name, --num-prompts, --max-concurrency, --request-rate, --percentile-metrics ttft,tpot,itl,e2el, --metric-per.
- Organisation
- vLLM
- Type
- Documentation officielle
- Fiabilité
- Fiabilité haute
- Publié
- 2026
- Consulté le
- 16 septembre 2026
- Sujets
- benchmark, multi-utilisateurs
Citée par 3 page(s)
Méthodologie de benchmark reproductibleBenchmarks · Protocole du laboratoire : llama-bench, llama-batched-bench, vllm bench serve et autres outils de charge, métriques standard, prompts de référence, grille 1/2/3/5/10 utilisateurs, conditions à consigner et pièges.Montée en charge de 1 à 10 utilisateurs : gpt-oss-120b et Qwen3-30B-A3BExpérimentation · Mesurer le débit par utilisateur, l'agrégé et le TTFT p95 à 1, 2, 3, 5 et 10 clients simultanés avec des prompts français courts, RAG et dossiers, pour remplir la matrice de capacité.Évaluer vLLM sur ROCm gfx1151Expérimentation · Vérifier si l'image officielle vllm/vllm-openai-rocm tourne sans patch sur la machine, si elle sert gpt-oss-120b, et si son ordonnanceur apporte un gain mesurable en TTFT et en débit agrégé face à llama-server.
Ce que dit la source
Options --backend openai-chat, --dataset-name, --num-prompts, --max-concurrency, --request-rate, --percentile-metrics ttft,tpot,itl,e2el, --metric-percentiles, --save-result.
Ce qu'on en retient
Fonctionne contre tout endpoint OpenAI, donc contre llama-server : outil de charge de référence du laboratoire.
Limites
Jeux de données anglophones par défaut ; prévoir nos prompts FR.