Terme
Tokens par seconde
Vitesse à laquelle un modèle produit sa réponse, exprimée en nombre de tokens générés par seconde pour un utilisateur donné.
Vitesse à laquelle un modèle produit sa réponse, exprimée en nombre de tokens générés par seconde pour un utilisateur donné.
inférenceAussi : t/s, tok/s, vitesse de génération, tg
La vitesse de génération dépend d'abord de la bande passante mémoire et du nombre de paramètres actifs du modèle : à chaque token, tous les poids actifs sont relus depuis la mémoire.
Une vitesse de lecture humaine confortable se situe autour d'une dizaine de tokens par seconde ; au-dessous, l'utilisateur attend. Quand plusieurs utilisateurs génèrent en même temps, la vitesse par utilisateur baisse tandis que le débit agrégé augmente.
Voir Multi-utilisateurs.