Source
llama.cpp — README de llama-bench
Options et valeurs par défaut de llama-bench : -p 512, -n 128, -d 0, -b 2048, -ub 512, -ctk/-ctv f16, -fa auto, -r 5, sorties csv/json/jsonl/md/sql. N.
- Organisation
- ggml-org
- Type
- GitHub
- Fiabilité
- Fiabilité haute
- Publié
- 2026 (master)
- Consulté le
- 16 septembre 2026
- Sujets
- benchmark, llama-cpp
Citée par 3 page(s)
Le laboratoire : lire et alimenter les benchmarksBenchmarks · Ce que la collection benchmarks enregistre, comment lire une fiche (TTFT, tok/s, pp, p50/p95), d'où viennent les données (nôtres ou publiées), comment en ajouter une et quelles séries de comparaison sont prévues.Méthodologie de benchmark reproductibleBenchmarks · Protocole du laboratoire : llama-bench, llama-batched-bench, vllm bench serve et autres outils de charge, métriques standard, prompts de référence, grille 1/2/3/5/10 utilisateurs, conditions à consigner et pièges.Benchmark gpt-oss-120b à 1 utilisateur : Vulkan vs ROCm, contexte court et longExpérimentation · Reproduire sur le Framework Desktop les 51 à 56 t/s publiés pour gpt-oss-120b, comparer les deux backends et mesurer la dégradation à 4k et 32k de profondeur.
Ce que dit la source
Options et valeurs par défaut de llama-bench : -p 512, -n 128, -d 0, -b 2048, -ub 512, -ctk/-ctv f16, -fa auto, -r 5, sorties csv/json/jsonl/md/sql. Notation pp512, tg128, pp512 @ d4096.
Ce qu'on en retient
Base du protocole mono-séquence du laboratoire : les défauts pp512/tg128 rendent nos mesures comparables aux publications.
Limites
Ne mesure ni le multi-utilisateurs ni le TTFT applicatif.