Tag
#vllm
18 entrée(s) portent ce tag.
Pages
3
Méthodologie de benchmark reproductibleBenchmarks · Protocole du laboratoire : llama-bench, llama-batched-bench, vllm bench serve et autres outils de charge, métriques standard, prompts de référence, grille 1/2/3/5/10 utilisateurs, conditions à consigner et pièges.16 sept. 2026Inférence : panorama des moteursInférence · Comparaison des moteurs de serving (llama-server, Ollama, LM Studio, vLLM, SGLang, Lemonade) pour un Strix Halo sous Linux, et recommandation initiale prudente : llama-server d'abord, vLLM à évaluer.16 sept. 2026vLLM et SGLang sur Strix HaloInférence · État du support gfx1151 (doc officielle vs images communautaires), avantages pour le multi-utilisateurs, coûts en mémoire et complexité, et critères pour basculer depuis llama-server.16 sept. 2026
Benchmarks
2
Qwen3.5-122B-A10B Q4_K_XL — llama.cpp b10333 ROCm 7.14 — 13,6 t/s, TTFT 1,78 s (Soothill)Benchmark · Côté llama.cpp du comparatif vLLM / SGLang / llama.cpp : 13,6 t/s à 1 client, 17,9 t/s agrégés à 2 clients, TTFT 1,775 s sur un MoE de 122 Md.16 sept. 2026Qwen3.5-122B-A10B GPTQ — vLLM 0.26.0 ROCm 7.14 — 10,3 t/s, TTFT 1,06 s (Soothill)Benchmark · Côté vLLM du comparatif : 10,3 t/s à 1 client, 16,2 t/s agrégés à 2 clients, TTFT 1,056 s ; plus lent en génération mais 40 % plus rapide au premier token que llama.cpp.16 sept. 2026
Sources
7
Anyscale — How continuous batching enables 23x throughput in LLM inferenceSource · L'inférence LLM est bornée par les entrées-sorties mémoire ; continuous batching = ordonnancement par itération ; jusqu'à 23 fois le débit avec vLLM.16 sept. 2026amd-strix-halo-vllm-toolboxes (kyuz0)Source · Image vLLM « patchée » (AITER MoE/FP8 désactivés sur gfx1x, contournements RMSNorm et CUDA Graph) ; image ROCm 10.0 sans benchmark publié ; TP=2 sur d.16 sept. 2026sgl-project/sglang — dépôt GitHub (Apache-2.0)Source · Dépôt officiel, licence Apache-2.0.16 sept. 2026Soothill — SGLang vs vLLM vs llama.cpp on Strix HaloSource · GMKtec EVO-X3, vLLM 0.26.0, SGLang 0.5.17, llama.cpp b10333, ROCm 7.14.0 : Qwen3.5-0.8B BF16 vLLM 86,6 (C=1), 246,5 (C=4), 311,6 t/s (C=8) ; llama.cpp.16 sept. 2026vllm-project/vllm — dépôt GitHub (Apache-2.0)Source · Dépôt officiel, licence Apache-2.0.16 sept. 2026vLLM — conception des métriques PrometheusSource · Métriques vllm:num_requests_running, num_requests_waiting, kv_cache_usage_perc, prompt_tokens_total, generation_tokens_total, time_to_first_token_seco.16 sept. 2026vLLM — installation GPU AMD ROCmSource · GPU listés : MI200/MI300/MI350, RX 7900, RX 9000, Ryzen AI MAX / AI 300 (gfx1151/1150) avec ROCm 7.0.2 minimum ; images vllm/vllm-openai-rocm (latest.16 sept. 2026
Glossaire
2
Continuous batchingTerme · Technique de serveur d'inférence qui insère de nouvelles requêtes dans le lot en cours à chaque étape de génération, au lieu d'attendre que toutes les séquences du lot soient terminées.16 sept. 2026vLLMTerme · Serveur d'inférence haute performance conçu pour les GPU de datacenter, avec continuous batching natif et gestion paginée du KV cache (PagedAttention).16 sept. 2026