Source
Discussion llama.cpp #18308 — paramètres optimaux pour l'inférence parallèle
Un utilisateur (GPU NVIDIA) observe peu de gain au-delà de -np 4 ; les mainteneurs attribuent la sous-utilisation GPU à l'échantillonnage CPU et renvo.
- Organisation
- ggml-org (discussion)
- Type
- Forum
- Fiabilité
- Fiabilité moyenne
- Publié
- 2025-12
- Consulté le
- 16 septembre 2026
- Sujets
- multi-utilisateurs, llama-cpp
Citée par 2 page(s)
llama.cpp et llama-serverInférence · Le moteur de départ de la Box : slots, contexte partagé, KV cache quantifié, flash attention, métriques Prometheus, images Docker ROCm/Vulkan et flags connus pour gfx1151.Multi-utilisateurs : servir 5 à 10 personnes sur une seule machineMulti-utilisateurs · Pourquoi une machine à 256 Go/s est bornée en génération, ce que le batching et les MoE y changent, ce que les mesures publiées disent, et ce qu'il reste à mesurer avant de promettre un nombre d'utilisateurs.
Ce que dit la source
Un utilisateur (GPU NVIDIA) observe peu de gain au-delà de -np 4 ; les mainteneurs attribuent la sous-utilisation GPU à l'échantillonnage CPU et renvoient à la PR --backend-sampling.
Ce qu'on en retient
Le gain du batching n'est pas linéaire ; l'échantillonnage peut devenir le goulot. À vérifier sur Strix Halo.
Limites
Matériel NVIDIA. Retour communautaire.