Recherche
Campagne de recherche : moteurs d'inférence, modèles et multi-utilisateurs
Support gfx1151 des runtimes, options de parallélisme, théorie du KV cache, catalogue de modèles et benchmarks publiés.
Confirmée#inference#llama-cpp#vllm#multi-utilisateurs#gpt-oss#qwenPublié le 16 sept. 2026Mis à jour le 16 sept. 2026Vérifié le 16 sept. 2026À revérifier le 15 déc. 2026
- Statut
- Terminée
- Question
- Quel runtime et quels modèles permettent de servir 5 à 10 utilisateurs sur 128 Go à 256 Go/s ?
- Conclusion
- llama-server est le point de départ (support officiel AMD, meilleurs chiffres publiés) ; les modèles MoE (gpt-oss-120b, Qwen3 A3B/A22B) sont les seuls utilisables confortablement ; aucune mesure multi-clients publiée pour gpt-oss-120b.
Constats principaux
- llama-server : slots
-np, KV unifié, continuous batching, métriques Prometheus ; pas de priorité de file. - Ollama : 1 requête parallèle par défaut, contexte 4096 par défaut ; LM Studio : 4 prédictions concurrentes.
- vLLM documenté pour gfx1151 sur ROCm ≥ 7.0.2, mais les images communautaires appliquent encore des correctifs.
- Débit de génération ≈ bande passante / poids actifs : les MoE à 3 à 5 Md actifs sont 10 fois plus rapides que les denses 70 Md.
- Mesure communautaire : 8 slots ≈ 162 tok/s agrégés sur un MoE 35B-A3B ; peu de gain au-delà.
Ce que cette recherche a produit
Le catalogue de modèles, les pages inférence et multi-utilisateurs, la méthodologie de benchmark, les benchmarks publiés importés, l'ADR-004.