Aller au contenu
Tag

#benchmark

63 entrée(s) portent ce tag.

Pages

6

Le laboratoire : lire et alimenter les benchmarksBenchmarks · Ce que la collection benchmarks enregistre, comment lire une fiche (TTFT, tok/s, pp, p50/p95), d'où viennent les données (nôtres ou publiées), comment en ajouter une et quelles séries de comparaison sont prévues.Méthodologie de benchmark reproductibleBenchmarks · Protocole du laboratoire : llama-bench, llama-batched-bench, vllm bench serve et autres outils de charge, métriques standard, prompts de référence, grille 1/2/3/5/10 utilisateurs, conditions à consigner et pièges.Comparaisons matériellesComparaisons · Lecture guidée du tableau comparatif des machines : bande passante, mémoire adressable, prix par Go de mémoire GPU, consommation, écosystème logiciel, bruit et disponibilité, avec l'origine de chaque donnée et une conclusion prudente sur le choix du Framework Desktop.Multi-utilisateurs : servir 5 à 10 personnes sur une seule machineMulti-utilisateurs · Pourquoi une machine à 256 Go/s est bornée en génération, ce que le batching et les MoE y changent, ce que les mesures publiées disent, et ce qu'il reste à mesurer avant de promettre un nombre d'utilisateurs.Préparer un Proof of ConceptPOC · Objectifs, périmètre, checklist complète, scénario de permissions, critères de succès mesurables, rôles, risques et questionnaire utilisateur pour le POC de la Box IA sur un jeu de documents fictif.Évaluer le RAGRAG · Mesurer la qualité (fidélité, pertinence, précision et rappel du contexte), l'étanchéité des permissions et la latence, sur un jeu de test par dossier fictif, et boucler sur l'amélioration.

Matériel

7

Beelink GTR9 Pro (Ryzen AI Max+ 395, 128 Go)Matériel · Mini-PC Strix Halo 128 Go avec deux ports 10 GbE Intel E610, machine de référence des guides communautaires Linux, mais dont les cartes réseau plantent sous charge selon des utilisateurs et dont le prix a plus que doublé (4 349 $ en août 2026).Framework Desktop (Ryzen AI Max+ 395, 128 Go)Matériel · Machine candidate de la Box IA : APU AMD Strix Halo avec 128 Go de mémoire unifiée, compacte et silencieuse, mais dont le support ROCm n'est officiel que depuis août 2026 et dont la stabilité sous forte charge GPU reste à démontrer.Mac Studio M5 Max (2026)Matériel · Alternative Apple à mémoire unifiée : jusqu'à 128 Go et 460 à 614 Go/s de bande passante, soit 2 à 2,5 fois le Framework Desktop, mais un écosystème macOS/Metal fermé et un prix des configurations 128 Go non confirmé.Mac Studio M5 Ultra (2026)Matériel · Haut de gamme Apple : jusqu'à 512 Go de mémoire unifiée et 1,2 To/s, seule machine de bureau capable de charger un modèle de 400 Md et plus, mais à partir de 5 499 $ et plus de 10 000 $ pour 512 Go.NVIDIA DGX Spark (GB10)Matériel · Mini-station NVIDIA à 128 Go de mémoire unifiée et 273 Go/s : même classe de bande passante que le Framework Desktop mais avec CUDA, un prompt processing très supérieur et un prix passé à 4 699 $ en février 2026.NVIDIA GeForce RTX 5090Matériel · Carte graphique grand public la plus rapide (1 792 Go/s) mais limitée à 32 Go : trop peu pour gpt-oss-120b, et vendue 4 200 à 7 400 $ sur le marché en 2026, soit plus qu'un Framework Desktop 128 Go complet.NVIDIA RTX PRO 6000 Blackwell (96 Go)Matériel · Seule carte NVIDIA à 96 Go de VRAM : 7 fois la bande passante du Framework Desktop avec CUDA et ECC, mais un MSRP porté à 16 000 $ en septembre 2026 et 600 W de consommation.

Benchmarks

17

Llama 3.3 70B (Shisa V2) Q4_K_M — llama.cpp b5863 — 5,0 t/s (lhl, Framework Desktop)Benchmark · Un dense de 70 Md en Q4 sur le Framework Desktop : 5,0 t/s en génération et 94,7 t/s en prompt, exactement au plafond de bande passante.Qwen3-30B-A3B Q4 — llama.cpp b5863 — 72,0 t/s (lhl, Framework Desktop)Benchmark · Premier point de la série Qwen3-30B-A3B sur le Framework Desktop : 72,0 t/s en génération et 604,8 t/s en prompt, mi-2025.gpt-oss-120b Q4_K_M — llama-server ROCm — 53,4 t/s (visorcraft)Benchmark · gpt-oss-120b sous llama-server avec backend ROCm sur un mini-PC Strix Halo : 53,4 t/s en génération.Qwen3-235B-A22B Q3_K_M — llama.cpp ROCm — 17,2 t/s, pp 101 t/s (visorcraft)Benchmark · Le plus gros MoE Qwen3 en 3 bits sur Strix Halo : 17,2 t/s en génération mais seulement 101 t/s en prompt.gpt-oss-120b MXFP4 — llama.cpp Vulkan RADV b9049 — 55,6 t/s (hogeheer)Benchmark · Meilleure mesure publiée de gpt-oss-120b sur Strix Halo : 55,57 t/s en génération et 727 t/s en prompt processing, Vulkan RADV, Beelink GTR9 Pro.gpt-oss-120b — LM Studio (runtime ROCm llama.cpp) — environ 30 t/s (MindStudio)Benchmark · gpt-oss-120b servi par LM Studio avec le runtime ROCm : environ 30 t/s, soit près de la moitié des mesures llama.cpp directes. Contradiction documentée.Qwen3-Coder-30B-A3B Q4_K_S — llama.cpp ROCm — 73,7 t/s, pp 1 345 t/s (Soothill)Benchmark · Comparatif Vulkan vs ROCm de Soothill : côté ROCm, 73,7 t/s en génération mais 1 345 t/s en prompt, le meilleur prefill de la série.Qwen3-Coder-30B-A3B Q4_K_S — llama.cpp Vulkan — 97,7 t/s (Soothill)Benchmark · Comparatif Vulkan vs ROCm de Soothill : côté Vulkan, 97,7 t/s en génération et 1 115 t/s en prompt sur Qwen3-Coder-30B-A3B Q4_K_S.Qwen3.5-122B-A10B Q4_K_XL — llama.cpp b10333 ROCm 7.14 — 13,6 t/s, TTFT 1,78 s (Soothill)Benchmark · Côté llama.cpp du comparatif vLLM / SGLang / llama.cpp : 13,6 t/s à 1 client, 17,9 t/s agrégés à 2 clients, TTFT 1,775 s sur un MoE de 122 Md.Qwen3.5-122B-A10B GPTQ — vLLM 0.26.0 ROCm 7.14 — 10,3 t/s, TTFT 1,06 s (Soothill)Benchmark · Côté vLLM du comparatif : 10,3 t/s à 1 client, 16,2 t/s agrégés à 2 clients, TTFT 1,056 s ; plus lent en génération mais 40 % plus rapide au premier token que llama.cpp.Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 1 — 59,2 t/s, TTFT 117 ms (hogeheer)Benchmark · Point de référence à 1 slot de la seule courbe de montée en charge publiée sur Strix Halo : 59,2 t/s et 117 ms de TTFT.Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 16 — 10,4 t/s par utilisateur, 166 agrégés (hogeheer)Benchmark · À 16 slots, l'agrégé plafonne (166 t/s, +2,5 % par rapport à 8 slots) et chaque utilisateur tombe à 10,4 t/s avec 547 ms de TTFT.Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 4 — 32,7 t/s par utilisateur, 130,8 agrégés (hogeheer)Benchmark · À 4 slots, chaque utilisateur reçoit 32,7 t/s (130,8 t/s agrégés, 2,2 fois le mono) avec un TTFT de 237 ms.Qwen3.6-35B-A3B UD-Q4_K_M — llama-server -np 8 — 20,3 t/s par utilisateur, 162 agrégés (hogeheer)Benchmark · À 8 slots, 20,3 t/s par utilisateur et 162 t/s agrégés (2,7 fois le mono), TTFT 307 ms : le point d'équilibre retenu par l'auteur.DeepSeek-R1-Distill-Qwen-32B Q4_K_M — llama.cpp HIP — 11,2 t/s (praveentechworld)Benchmark · Un dense de 32 Md en Q4 (19,8 Go) sur Strix Halo : 11,2 t/s, cohérent avec le plafond bande passante ÷ poids.Llama 3.3 70B Q4_K_M — llama.cpp HIP ROCm 6.3+ — 5,1 t/s, contexte 64k (praveentechworld)Benchmark · Llama 3.3 70B Q4_K_M (42,5 Go) sous ROCm avec un contexte de 64k : 5,1 t/s, confirmant le plafond de bande passante un an après la première mesure.gpt-oss-120b MXFP4 — llama.cpp ROCm 7.2.0 (fork Lychee b8182) — 51,1 t/s (Pellegrini)Benchmark · gpt-oss-120b sous ROCm 7.2.0 avec un fork llama.cpp : 51,1 t/s en génération, 174 t/s en prompt (charge applicative), environ 59 Go GPU, pic 140 W.

Expérimentations

10

Benchmark gpt-oss-120b à 1 utilisateur : Vulkan vs ROCm, contexte court et longExpérimentation · Reproduire sur le Framework Desktop les 51 à 56 t/s publiés pour gpt-oss-120b, comparer les deux backends et mesurer la dégradation à 4k et 32k de profondeur.Montée en charge de 1 à 10 utilisateurs : gpt-oss-120b et Qwen3-30B-A3BExpérimentation · Mesurer le débit par utilisateur, l'agrégé et le TTFT p95 à 1, 2, 3, 5 et 10 clients simultanés avec des prompts français courts, RAG et dossiers, pour remplir la matrice de capacité.Comparer les modèles d'embeddings sur du français juridiqueExpérimentation · Mesurer recall@k et MRR de bge-m3, multilingual-e5-large, Qwen3-Embedding (0.6B, 4B) et nomic-embed-text v2 sur le jeu de questions du corpus fictif, avec et sans reranker.Comparer la qualité en français des modèles candidatsExpérimentation · Évaluer en aveugle gpt-oss-120b, Qwen3-30B-A3B, Mistral Small 3.2 / 4, Gemma 3 27B, Llama 3.3 70B et les modèles européens sur des tâches juridiques françaises : rédaction, synthèse, citation fidèle, refus d'inventer.Comparer Vulkan/RADV et ROCm/HIP dans llama.cppExpérimentation · Mesurer sur nos modèles cibles et nos longueurs de prompt RAG le débit de prompt processing et de génération des deux backends GPU de llama.cpp, pour trancher Q-008.Évaluer vLLM sur ROCm gfx1151Expérimentation · Vérifier si l'image officielle vllm/vllm-openai-rocm tourne sans patch sur la machine, si elle sert gpt-oss-120b, et si son ordonnanceur apporte un gain mesurable en TTFT et en débit agrégé face à llama-server.Mesurer la consommation et le bruit en inférenceExpérimentation · Relever à la prise et au sonomètre ce que consomme et ce qu'émet le Framework Desktop au repos, en inférence mono-utilisateur et sous charge 4 slots, pour remplacer les valeurs contradictoires publiées.Mesurer la mémoire GPU allouable sur le Framework DesktopExpérimentation · Établir combien de Go de GTT le GPU gfx1151 peut utiliser de façon stable sous Linux (108 ? 120 ?) avec BIOS 3.06 et noyau 6.18.4+, et le comportement à l'échec.pgvector vs Qdrant : rappel et latence de la recherche filtrée par ACLExpérimentation · Mesurer la perte de rappel et la latence d'une recherche vectorielle filtrée par dossier_id (10 %, 30 %, 100 % de portée) avec pgvector HNSW (sans et avec iterative_scan, RLS) et Qdrant (payload is_tenant, JWT payload).Stabilité sous charge continue pendant 24 heuresExpérimentation · Faire tourner llama-server 24 h avec 4 slots actifs et journaliser dmesg, températures et consommation, pour vérifier que les crashs GPU rapportés depuis mars 2026 ne se reproduisent pas avec BIOS 3.06 et noyau 6.18.4+.

Sources

9

Anyscale — Understand LLM latency and throughput metricsSource · TTFT, TPOT = (E2E − TTFT)/(N − 1), ITL, percentiles p50/p95/p99, goodput = part des requêtes respectant les SLO.Databricks — LLM Inference Performance Engineering: Best PracticesSource · Définitions TTFT, TPOT, latence = TTFT + TPOT × tokens ; débit = tokens de sortie par seconde tous utilisateurs ; MBU = bande passante atteinte / band.llama.cpp — README de llama-batched-benchSource · Outil de mesure multi-séquences : options -npp, -ntg, -npl, -pps ; deux modes (prompt partagé ou non) ; colonnes PP, TG, B, N_KV, T_PP, S_PP, T_TG, S_.llama.cpp — README de llama-benchSource · Options et valeurs par défaut de llama-bench : -p 512, -n 128, -d 0, -b 2048, -ub 512, -ctk/-ctv f16, -fa auto, -r 5, sorties csv/json/jsonl/md/sql. N.xk6-llm — extension k6 pour LLMSource · Extension k6 mesurant TTFT, ITL, TPOT, goodput avec export Prometheus/Grafana ; le k6 standard ne mesure pas le TTFT car il bufferise le flux SSE.NVIDIA — GenAI-Perf (Triton docs)Source · Outil de charge : TTFT, ITL, latence, débit ; options --concurrency, --request-rate, --streaming ; cible tout service OpenAI ; « being phased out » au.praveentechworld — AMD Strix Halo Local LLM Benchmarks: 128GB Unified Memory GuideSource · Bande passante effective environ 213 Go/s (« 75 à 80 % » d'un théorique annoncé à 273 Go/s) ; Llama 3.3 70B Q4_K_M (42,5 Go) 5,1 t/s en HIP ROCm 6.3+.Soothill — SGLang vs vLLM vs llama.cpp on Strix HaloSource · GMKtec EVO-X3, vLLM 0.26.0, SGLang 0.5.17, llama.cpp b10333, ROCm 7.14.0 : Qwen3.5-0.8B BF16 vLLM 86,6 (C=1), 246,5 (C=4), 311,6 t/s (C=8) ; llama.cpp.vLLM — commande vllm bench serveSource · Options --backend openai-chat, --dataset-name, --num-prompts, --max-concurrency, --request-rate, --percentile-metrics ttft,tpot,itl,e2el, --metric-per.