Traitement du prompt (prompt processing)
Phase d'inférence pendant laquelle le modèle ingère l'ensemble du prompt avant de produire le premier token, mesurée en tokens traités par seconde.
Phase d'inférence pendant laquelle le modèle ingère l'ensemble du prompt avant de produire le premier token, mesurée en tokens traités par seconde.
Le traitement du prompt (prefill) est limité par la puissance de calcul, alors que la génération est limitée par la bande passante mémoire. Les deux phases peuvent donc favoriser des backends différents ; plusieurs mesures communautaires sur Strix Halo montrent ROCm meilleur en prefill et Vulkan meilleur en génération.
Dans les benchmarks, « pp512 » désigne la vitesse de traitement d'un prompt de 512 tokens. Pour la Box, le prefill détermine le TTFT des requêtes RAG à long contexte.