Source
vLLM — conception des métriques Prometheus
Métriques vllm:num_requests_running, num_requests_waiting, kv_cache_usage_perc, prompt_tokens_total, generation_tokens_total, time_to_first_token_seco.
- Organisation
- vLLM
- Type
- Documentation officielle
- Fiabilité
- Fiabilité haute
- Publié
- 2026
- Consulté le
- 16 septembre 2026
- Sujets
- vllm, monitoring
Citée par 4 page(s)
Méthodologie de benchmark reproductibleBenchmarks · Protocole du laboratoire : llama-bench, llama-batched-bench, vllm bench serve et autres outils de charge, métriques standard, prompts de référence, grille 1/2/3/5/10 utilisateurs, conditions à consigner et pièges.Inférence : panorama des moteursInférence · Comparaison des moteurs de serving (llama-server, Ollama, LM Studio, vLLM, SGLang, Lemonade) pour un Strix Halo sous Linux, et recommandation initiale prudente : llama-server d'abord, vLLM à évaluer.vLLM et SGLang sur Strix HaloInférence · État du support gfx1151 (doc officielle vs images communautaires), avantages pour le multi-utilisateurs, coûts en mémoire et complexité, et critères pour basculer depuis llama-server.Évaluer vLLM sur ROCm gfx1151Expérimentation · Vérifier si l'image officielle vllm/vllm-openai-rocm tourne sans patch sur la machine, si elle sert gpt-oss-120b, et si son ordonnanceur apporte un gain mesurable en TTFT et en débit agrégé face à llama-server.
Ce que dit la source
Métriques vllm:num_requests_running, num_requests_waiting, kv_cache_usage_perc, prompt_tokens_total, generation_tokens_total, time_to_first_token_seconds, inter_token_latency_seconds, e2e_request_latency_seconds.
Ce qu'on en retient
Monitoring plus riche que llama-server (TTFT et file d'attente exposés nativement).
Limites
Noms susceptibles d'évoluer.