Aller au contenu
Source

Discussion llama.cpp #18308 — paramètres optimaux pour l'inférence parallèle

Un utilisateur (GPU NVIDIA) observe peu de gain au-delà de -np 4 ; les mainteneurs attribuent la sous-utilisation GPU à l'échantillonnage CPU et renvo.

Confirmée#multi-utilisateurs#llama-cppPublié le 16 sept. 2026Mis à jour le 16 sept. 2026
Organisation
ggml-org (discussion)
Type
Forum
Fiabilité
Fiabilité moyenne
Publié
2025-12
Consulté le
16 septembre 2026
Sujets
multi-utilisateurs, llama-cpp

Citée par 2 page(s)

Ce que dit la source

Un utilisateur (GPU NVIDIA) observe peu de gain au-delà de -np 4 ; les mainteneurs attribuent la sous-utilisation GPU à l'échantillonnage CPU et renvoient à la PR --backend-sampling.

Ce qu'on en retient

Le gain du batching n'est pas linéaire ; l'échantillonnage peut devenir le goulot. À vérifier sur Strix Halo.

Limites

Matériel NVIDIA. Retour communautaire.

content/sources/ggml-discussion-parallel-inference.md60 mots