Aller au contenu
Terme

Tokens par seconde

Vitesse à laquelle un modèle produit sa réponse, exprimée en nombre de tokens générés par seconde pour un utilisateur donné.

Confirmée#benchmark#multi-utilisateursPublié le 16 sept. 2026Mis à jour le 16 sept. 2026

Vitesse à laquelle un modèle produit sa réponse, exprimée en nombre de tokens générés par seconde pour un utilisateur donné.

inférenceAussi : t/s, tok/s, vitesse de génération, tg

La vitesse de génération dépend d'abord de la bande passante mémoire et du nombre de paramètres actifs du modèle : à chaque token, tous les poids actifs sont relus depuis la mémoire.

Une vitesse de lecture humaine confortable se situe autour d'une dizaine de tokens par seconde ; au-dessous, l'utilisateur attend. Quand plusieurs utilisateurs génèrent en même temps, la vitesse par utilisateur baisse tandis que le débit agrégé augmente.

Voir Multi-utilisateurs.

content/glossary/tokens-par-seconde.md71 mots