Source
Anyscale — Understand LLM latency and throughput metrics
TTFT, TPOT = (E2E − TTFT)/(N − 1), ITL, percentiles p50/p95/p99, goodput = part des requêtes respectant les SLO.
- Organisation
- Anyscale
- Type
- Documentation officielle
- Fiabilité
- Fiabilité haute
- Publié
- 2026
- Consulté le
- 16 septembre 2026
- Sujets
- benchmark
Citée par 4 page(s)
Le laboratoire : lire et alimenter les benchmarksBenchmarks · Ce que la collection benchmarks enregistre, comment lire une fiche (TTFT, tok/s, pp, p50/p95), d'où viennent les données (nôtres ou publiées), comment en ajouter une et quelles séries de comparaison sont prévues.Méthodologie de benchmark reproductibleBenchmarks · Protocole du laboratoire : llama-bench, llama-batched-bench, vllm bench serve et autres outils de charge, métriques standard, prompts de référence, grille 1/2/3/5/10 utilisateurs, conditions à consigner et pièges.Dimensionner la Box pour un cabinetMulti-utilisateurs · Méthode pour passer d'un profil d'usage (requêtes courtes, analyses de dossiers longs) à un choix de modèle, de slots et de contexte, avec trois scénarios et la liste de ce qu'il faudra mesurer.Multi-utilisateurs : servir 5 à 10 personnes sur une seule machineMulti-utilisateurs · Pourquoi une machine à 256 Go/s est bornée en génération, ce que le batching et les MoE y changent, ce que les mesures publiées disent, et ce qu'il reste à mesurer avant de promettre un nombre d'utilisateurs.
Ce que dit la source
TTFT, TPOT = (E2E − TTFT)/(N − 1), ITL, percentiles p50/p95/p99, goodput = part des requêtes respectant les SLO.
Ce qu'on en retient
Définitions standard reprises dans la méthodologie.