Aller au contenu
Terme

Traitement du prompt (prompt processing)

Phase d'inférence pendant laquelle le modèle ingère l'ensemble du prompt avant de produire le premier token, mesurée en tokens traités par seconde.

Confirmée#benchmark#rocm#vulkanPublié le 16 sept. 2026Mis à jour le 16 sept. 2026

Phase d'inférence pendant laquelle le modèle ingère l'ensemble du prompt avant de produire le premier token, mesurée en tokens traités par seconde.

inférenceAussi : prefill, pp, pp512

Le traitement du prompt (prefill) est limité par la puissance de calcul, alors que la génération est limitée par la bande passante mémoire. Les deux phases peuvent donc favoriser des backends différents ; plusieurs mesures communautaires sur Strix Halo montrent ROCm meilleur en prefill et Vulkan meilleur en génération.

Dans les benchmarks, « pp512 » désigne la vitesse de traitement d'un prompt de 512 tokens. Pour la Box, le prefill détermine le TTFT des requêtes RAG à long contexte.

content/glossary/prompt-processing.md79 mots