Expérimentation
Évaluer vLLM sur ROCm gfx1151
Vérifier si l'image officielle vllm/vllm-openai-rocm tourne sans patch sur la machine, si elle sert gpt-oss-120b, et si son ordonnanceur apporte un gain mesurable en TTFT et en débit agrégé face à llama-server.
Brouillon#vllm#rocm#strix-halo#multi-utilisateurs#benchmark#dockerPublié le 16 sept. 2026Mis à jour le 16 sept. 2026
- Statut du test
- À tester
- Priorité
- Moyenne
- Prévu pour
- Décembre 2026
- Hypothèse
- En septembre 2026, l'image officielle vllm/vllm-openai-rocm démarre sur gfx1151 avec ROCm 7.x sans patch, sert un MoE de taille moyenne, et donne un TTFT p95 inférieur à celui de llama-server à 5 clients ; mais elle ne sert pas gpt-oss-120b en MXFP4 sans conversion, et réserve plus de mémoire que llama-server pour un même contexte.
- Procédure
- 1) Tirer vllm/vllm-openai-rocm:latest (puis :nightly) ; tenter le démarrage avec Qwen3-30B-A3B (poids BF16 ou GPTQ/AWQ) ; noter erreurs et patches nécessaires ; comparer avec l'image kyuz0 si l'officielle échoue. 2) Tenter gpt-oss-120b ; noter le format accepté. 3) Mesurer la mémoire GPU réservée (gpu-memory-utilization) pour un contexte équivalent à llama-server -c. 4) vllm bench serve --max-concurrency 1,3,5,10 avec le même jeu de prompts FR que l'expérimentation de montée en charge, contre vLLM puis llama-server, à quantification aussi proche que possible. 5) Relever vllm:time_to_first_token_seconds et vllm:num_requests_waiting. 6) Fiches benchmark ours, série framework-ours-vllm-vs-llamacpp.
- Prochaine action
- Attendre la stack Linux/ROCm validée ; vérifier la version ROCm exigée par l'image courante.
Pourquoi
La doc vLLM liste gfx1151 1, mais les retours de 2026 décrivent des images patchées 4 5. La seule comparaison publiée 6 mélange des quantifications différentes. Les critères de bascule sont fixés dans vLLM et SGLang ; cette expérimentation les instruit.
Protocole
Installation, compatibilité modèles, mémoire, puis charge avec vllm bench serve 3 et métriques vllm:* 2.
Critères de succès
- Réponse binaire : image officielle utilisable ou non, avec la liste des obstacles.
- Comparaison à quantification équivalente sur au moins un modèle, 1 à 10 clients.
- Décision documentée : rester sur llama-server ou ouvrir un ADR de bascule (Q-002).
Résultat
À venir.
Sources
- 1vLLM — installation GPU AMD ROCmDocumentation officielleFiabilité hautevLLM · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 2vLLM — conception des métriques PrometheusDocumentation officielleFiabilité hautevLLM · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 3vLLM — commande vllm bench serveDocumentation officielleFiabilité hautevLLM · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 4Running vLLM on Strix Halo (epheo)BlogFiabilité faibleblog.epheo.eu · epheo · publié 2026-02-15 · consulté le 16 sept. 2026 · fiche source
- 5amd-strix-halo-vllm-toolboxes (kyuz0)GitHubFiabilité moyenneGitHub (communauté) · kyuz0 · publié 2026 · consulté le 16 sept. 2026 · fiche source
- 6Soothill — SGLang vs vLLM vs llama.cpp on Strix HaloBenchmarkFiabilité hautesoothill.io · Darren Soothill · publié 2026-08-10 · consulté le 16 sept. 2026 · fiche source