Aller au contenu
Source

Databricks — LLM Inference Performance Engineering: Best Practices

Définitions TTFT, TPOT, latence = TTFT + TPOT × tokens ; débit = tokens de sortie par seconde tous utilisateurs ; MBU = bande passante atteinte / band.

Confirmée#multi-utilisateurs#benchmark#kv-cachePublié le 16 sept. 2026Mis à jour le 16 sept. 2026
Organisation
Databricks (Mosaic)
Type
Article technique
Fiabilité
Fiabilité haute
Publié
2023-10-12
Consulté le
16 septembre 2026
Sujets
multi-utilisateurs, benchmark, kv-cache

Citée par 5 page(s)

Ce que dit la source

Définitions TTFT, TPOT, latence = TTFT + TPOT × tokens ; débit = tokens de sortie par seconde tous utilisateurs ; MBU = bande passante atteinte / bande passante crête ; formule KV cache pour Llama2-70B ; compromis débit vs latence par utilisateur.

Ce qu'on en retient

Vocabulaire et formules du laboratoire.

content/sources/databricks-llm-inference-performance.md57 mots