Tag
#kv-cache
21 entrée(s) portent ce tag.
Pages
5
llama.cpp et llama-serverInférence · Le moteur de départ de la Box : slots, contexte partagé, KV cache quantifié, flash attention, métriques Prometheus, images Docker ROCm/Vulkan et flags connus pour gfx1151.16 sept. 2026Mémoire GPU allouable sous LinuxLinux · Comment dépasser les 64 Go de GTT par défaut sur Strix Halo (UMA BIOS, ttm.pages_limit, amd-ttm), avec les plafonds observés (108 et 120 Go), les paramètres contradictoires et la procédure de mesure à réaliser.16 sept. 2026Dimensionner la Box pour un cabinetMulti-utilisateurs · Méthode pour passer d'un profil d'usage (requêtes courtes, analyses de dossiers longs) à un choix de modèle, de slots et de contexte, avec trois scénarios et la liste de ce qu'il faudra mesurer.16 sept. 2026Multi-utilisateurs : servir 5 à 10 personnes sur une seule machineMulti-utilisateurs · Pourquoi une machine à 256 Go/s est bornée en génération, ce que le batching et les MoE y changent, ce que les mesures publiées disent, et ce qu'il reste à mesurer avant de promettre un nombre d'utilisateurs.16 sept. 2026KV cache : calcul et dimensionnementMulti-utilisateurs · Formule du KV cache, effet de GQA et MLA, quantification q8_0/q4_0, tableau d'estimations pour gpt-oss-120b, Qwen3-30B-A3B et Llama 70B à 8k/32k/128k, et impact du nombre de slots sur la mémoire.16 sept. 2026
Modèles
3
DeepSeek R1 (et distillations)Modèle · MoE de 671 Md sous MIT : impraticable sur 128 Go à taille complète ; seules les distillations 32B et 70B sont exécutables (11,2 t/s mesurés pour Distill-Qwen-32B).16 sept. 2026gpt-oss-120bModèle · MoE OpenAI de 117 Md (5,1 Md actifs) sous Apache 2.0 : le candidat principal de la Box, mesuré entre 30 et 56 t/s sur Strix Halo selon le runtime.16 sept. 2026Llama 3.3 70B InstructModèle · Dense Meta de 70 Md, français officiellement supporté, 42,5 Go en Q4 : la référence « gros modèle dense », bornée à environ 5 t/s par la bande passante de Strix Halo.16 sept. 2026
Sources
7
Databricks — LLM Inference Performance Engineering: Best PracticesSource · Définitions TTFT, TPOT, latence = TTFT + TPOT × tokens ; débit = tokens de sortie par seconde tous utilisateurs ; MBU = bande passante atteinte / band.16 sept. 2026DeepSeek-V2 — Multi-head Latent Attention (arXiv 2405.04434)Source · MLA compresse le KV cache en un vecteur latent ; réduction de 93,3 % du KV cache par rapport à DeepSeek 67B.16 sept. 2026llama.cpp — README de llama-batched-benchSource · Outil de mesure multi-séquences : options -npp, -ntg, -npl, -pps ; deux modes (prompt partagé ou non) ; colonnes PP, TG, B, N_KV, T_PP, S_PP, T_TG, S_.16 sept. 2026llama.cpp — README de llama-server (tools/server)Source · Documentation de référence de llama-server : options -np, -c, --kv-unified, -cb, --cache-type-k/v, -fa, --metrics, --slots ; endpoints /v1/chat/comple.16 sept. 2026Hugging Face — Welcome GPT OSSSource · Architecture gpt-oss-120b : 36 couches, 64 têtes Q / 8 têtes KV, dim tête 64, attention alternée dense / fenêtre glissante 128, RoPE 128K.16 sept. 2026NVIDIA — Mastering LLM Techniques: Inference OptimizationSource · Formule du KV cache par token = 2 × couches × (têtes × dim_tête) × octets ; exemple Llama 2 7B 4096 tokens environ 2 Go ; prefill = matrice-matrice (c.16 sept. 2026Ollama — FAQ officielleSource · Variables OLLAMA_NUM_PARALLEL (défaut 1), OLLAMA_MAX_LOADED_MODELS (3 par GPU), OLLAMA_MAX_QUEUE (512), OLLAMA_CONTEXT_LENGTH (4096 par défaut), OLLAM.16 sept. 2026
Glossaire
4
Contexte partagé (prompt cache)Terme · Réutilisation, entre plusieurs requêtes, du KV cache déjà calculé pour un préfixe commun (consignes système, début de conversation), afin d'éviter de retraiter les mêmes tokens.16 sept. 2026Fenêtre de contexteTerme · Nombre maximal de tokens qu'un modèle peut prendre en compte à la fois, prompt et réponse compris.16 sept. 2026Flash attentionTerme · Implémentation optimisée du calcul d'attention qui évite de matérialiser la matrice complète des scores en mémoire, réduisant l'empreinte mémoire et accélérant le traitement des longs contextes.16 sept. 2026KV cacheTerme · Mémoire dans laquelle le modèle conserve, pour chaque token déjà traité, les clés et valeurs de l'attention afin de ne pas les recalculer à chaque nouveau token généré.16 sept. 2026