Aller au contenu
Source

llama.cpp — README de llama-batched-bench

Outil de mesure multi-séquences : options -npp, -ntg, -npl, -pps ; deux modes (prompt partagé ou non) ; colonnes PP, TG, B, N_KV, T_PP, S_PP, T_TG, S_.

Confirmée#benchmark#multi-utilisateurs#kv-cachePublié le 16 sept. 2026Mis à jour le 16 sept. 2026
Organisation
ggml-org
Type
GitHub
Fiabilité
Fiabilité haute
Publié
2026 (master)
Consulté le
16 septembre 2026
Sujets
benchmark, multi-utilisateurs, kv-cache

Citée par 2 page(s)

Ce que dit la source

Outil de mesure multi-séquences : options -npp, -ntg, -npl, -pps ; deux modes (prompt partagé ou non) ; colonnes PP, TG, B, N_KV, T_PP, S_PP, T_TG, S_TG, T, S.

Ce qu'on en retient

Permet de simuler 1 à N utilisateurs et de dimensionner -np et -c avant les tests HTTP réels.

Limites

Charge synthétique, pas représentative d'un cabinet.

content/sources/ggml-batched-bench-readme.md63 mots