Aller au contenu
Source

vLLM — conception des métriques Prometheus

Métriques vllm:num_requests_running, num_requests_waiting, kv_cache_usage_perc, prompt_tokens_total, generation_tokens_total, time_to_first_token_seco.

Confirmée#vllm#monitoringPublié le 16 sept. 2026Mis à jour le 16 sept. 2026
Organisation
vLLM
Type
Documentation officielle
Fiabilité
Fiabilité haute
Publié
2026
Consulté le
16 septembre 2026
Sujets
vllm, monitoring

Citée par 4 page(s)

Ce que dit la source

Métriques vllm:num_requests_running, num_requests_waiting, kv_cache_usage_perc, prompt_tokens_total, generation_tokens_total, time_to_first_token_seconds, inter_token_latency_seconds, e2e_request_latency_seconds.

Ce qu'on en retient

Monitoring plus riche que llama-server (TTFT et file d'attente exposés nativement).

Limites

Noms susceptibles d'évoluer.

content/sources/vllm-metrics-design.md33 mots