Aller au contenu
Box IA
Tags
#inference
Rechercher…
Ctrl K
Tag
#inference
3 entrée(s) portent ce tag.
Décisions
1
Démarrer avec llama.cpp (llama-server) comme runtime d'inférence
Confirmée
Décision
· Runtime initial du prototype : llama-server, API OpenAI-compatible, slots parallèles ; vLLM sera évalué ensuite.
16 sept. 2026
Questions
1
Quel runtime d'inférence est le plus performant sur AMD Strix Halo ?
À vérifier
Question
· llama.cpp est le point de départ (ADR-004) ; vLLM et SGLang sur ROCm restent à évaluer pour le multi-utilisateur.
16 sept. 2026
Recherches
1
Campagne de recherche : moteurs d'inférence, modèles et multi-utilisateurs
Confirmée
Recherche
· Support gfx1151 des runtimes, options de parallélisme, théorie du KV cache, catalogue de modèles et benchmarks publiés.
16 sept. 2026