Question· Q-002
Quel runtime d'inférence est le plus performant sur AMD Strix Halo ?
llama.cpp est le point de départ (ADR-004) ; vLLM et SGLang sur ROCm restent à évaluer pour le multi-utilisateur.
À vérifier#inference#llama-cpp#vllm#rocm#amdPublié le 16 sept. 2026Mis à jour le 16 sept. 2026À revérifier le 15 déc. 2026
- Identifiant
- Q-002
- Statut
- En cours
- Priorité
- Haute
État
llama-server a les meilleurs chiffres publiés en mono-utilisateur. vLLM est documenté sur ROCm pour gfx1151 mais les images communautaires appliquent encore des correctifs : la situation change tous les mois. La réponse dépend aussi du profil de charge (batching de plusieurs utilisateurs favorise vLLM en théorie).
Prochaine étape
Benchmark comparatif llama-server vs vLLM sur le même modèle, 1 à 8 clients, sur notre machine.