Source
llama.cpp — README de llama-batched-bench
Outil de mesure multi-séquences : options -npp, -ntg, -npl, -pps ; deux modes (prompt partagé ou non) ; colonnes PP, TG, B, N_KV, T_PP, S_PP, T_TG, S_.
- Organisation
- ggml-org
- Type
- GitHub
- Fiabilité
- Fiabilité haute
- Publié
- 2026 (master)
- Consulté le
- 16 septembre 2026
- Sujets
- benchmark, multi-utilisateurs, kv-cache
Citée par 2 page(s)
Méthodologie de benchmark reproductibleBenchmarks · Protocole du laboratoire : llama-bench, llama-batched-bench, vllm bench serve et autres outils de charge, métriques standard, prompts de référence, grille 1/2/3/5/10 utilisateurs, conditions à consigner et pièges.Montée en charge de 1 à 10 utilisateurs : gpt-oss-120b et Qwen3-30B-A3BExpérimentation · Mesurer le débit par utilisateur, l'agrégé et le TTFT p95 à 1, 2, 3, 5 et 10 clients simultanés avec des prompts français courts, RAG et dossiers, pour remplir la matrice de capacité.
Ce que dit la source
Outil de mesure multi-séquences : options -npp, -ntg, -npl, -pps ; deux modes (prompt partagé ou non) ; colonnes PP, TG, B, N_KV, T_PP, S_PP, T_TG, S_TG, T, S.
Ce qu'on en retient
Permet de simuler 1 à N utilisateurs et de dimensionner -np et -c avant les tests HTTP réels.
Limites
Charge synthétique, pas représentative d'un cabinet.