Aller au contenu
Question· Q-002

Quel runtime d'inférence est le plus performant sur AMD Strix Halo ?

llama.cpp est le point de départ (ADR-004) ; vLLM et SGLang sur ROCm restent à évaluer pour le multi-utilisateur.

À vérifier#inference#llama-cpp#vllm#rocm#amdPublié le 16 sept. 2026Mis à jour le 16 sept. 2026À revérifier le 15 déc. 2026
Identifiant
Q-002
Statut
En cours
Priorité
Haute

État

llama-server a les meilleurs chiffres publiés en mono-utilisateur. vLLM est documenté sur ROCm pour gfx1151 mais les images communautaires appliquent encore des correctifs : la situation change tous les mois. La réponse dépend aussi du profil de charge (batching de plusieurs utilisateurs favorise vLLM en théorie).

Prochaine étape

Benchmark comparatif llama-server vs vLLM sur le même modèle, 1 à 8 clients, sur notre machine.

content/questions/q-002-runtime-amd-performant.md65 mots