Aller au contenu
Expérimentation

Évaluer vLLM sur ROCm gfx1151

Vérifier si l'image officielle vllm/vllm-openai-rocm tourne sans patch sur la machine, si elle sert gpt-oss-120b, et si son ordonnanceur apporte un gain mesurable en TTFT et en débit agrégé face à llama-server.

Brouillon#vllm#rocm#strix-halo#multi-utilisateurs#benchmark#dockerPublié le 16 sept. 2026Mis à jour le 16 sept. 2026
Statut du test
À tester
Priorité
Moyenne
Prévu pour
Décembre 2026
Hypothèse
En septembre 2026, l'image officielle vllm/vllm-openai-rocm démarre sur gfx1151 avec ROCm 7.x sans patch, sert un MoE de taille moyenne, et donne un TTFT p95 inférieur à celui de llama-server à 5 clients ; mais elle ne sert pas gpt-oss-120b en MXFP4 sans conversion, et réserve plus de mémoire que llama-server pour un même contexte.
Procédure
1) Tirer vllm/vllm-openai-rocm:latest (puis :nightly) ; tenter le démarrage avec Qwen3-30B-A3B (poids BF16 ou GPTQ/AWQ) ; noter erreurs et patches nécessaires ; comparer avec l'image kyuz0 si l'officielle échoue. 2) Tenter gpt-oss-120b ; noter le format accepté. 3) Mesurer la mémoire GPU réservée (gpu-memory-utilization) pour un contexte équivalent à llama-server -c. 4) vllm bench serve --max-concurrency 1,3,5,10 avec le même jeu de prompts FR que l'expérimentation de montée en charge, contre vLLM puis llama-server, à quantification aussi proche que possible. 5) Relever vllm:time_to_first_token_seconds et vllm:num_requests_waiting. 6) Fiches benchmark ours, série framework-ours-vllm-vs-llamacpp.
Prochaine action
Attendre la stack Linux/ROCm validée ; vérifier la version ROCm exigée par l'image courante.

Pourquoi

La doc vLLM liste gfx1151 1, mais les retours de 2026 décrivent des images patchées 4 5. La seule comparaison publiée 6 mélange des quantifications différentes. Les critères de bascule sont fixés dans vLLM et SGLang ; cette expérimentation les instruit.

Protocole

Installation, compatibilité modèles, mémoire, puis charge avec vllm bench serve 3 et métriques vllm:* 2.

Critères de succès

  • Réponse binaire : image officielle utilisable ou non, avec la liste des obstacles.
  • Comparaison à quantification équivalente sur au moins un modèle, 1 à 10 clients.
  • Décision documentée : rester sur llama-server ou ouvrir un ADR de bascule (Q-002).

Résultat

À venir.

Sources

  1. 1vLLM — installation GPU AMD ROCmDocumentation officielleFiabilité hautevLLM · publié 2026 · consulté le 16 sept. 2026 · fiche source
  2. 2vLLM — conception des métriques PrometheusDocumentation officielleFiabilité hautevLLM · publié 2026 · consulté le 16 sept. 2026 · fiche source
  3. 3vLLM — commande vllm bench serveDocumentation officielleFiabilité hautevLLM · publié 2026 · consulté le 16 sept. 2026 · fiche source
  4. 4Running vLLM on Strix Halo (epheo)BlogFiabilité faibleblog.epheo.eu · epheo · publié 2026-02-15 · consulté le 16 sept. 2026 · fiche source
  5. 5amd-strix-halo-vllm-toolboxes (kyuz0)GitHubFiabilité moyenneGitHub (communauté) · kyuz0 · publié 2026 · consulté le 16 sept. 2026 · fiche source
  6. 6Soothill — SGLang vs vLLM vs llama.cpp on Strix HaloBenchmarkFiabilité hautesoothill.io · Darren Soothill · publié 2026-08-10 · consulté le 16 sept. 2026 · fiche source
content/experiments/evaluer-vllm-rocm-gfx1151.md100 mots