Terme
Fenêtre de contexte
Nombre maximal de tokens qu'un modèle peut prendre en compte à la fois, prompt et réponse compris.
Nombre maximal de tokens qu'un modèle peut prendre en compte à la fois, prompt et réponse compris.
inférenceAussi : context window, contexte, longueur de contexte
La fenêtre de contexte borne ce que le modèle « voit » : consignes, historique de la conversation, passages du RAG et réponse en cours. Au-delà, le début est tronqué ou la requête refusée.
Pour la Box, un contexte long permet d'injecter davantage de passages et de suivre de longues conversations, mais il coûte de la mémoire (KV cache) et du temps de traitement du prompt. Le contexte alloué par utilisateur est un choix de dimensionnement.
Voir Multi-utilisateurs.