Aller au contenu
Terme

Quantification

Réduction de la précision numérique des poids d'un modèle (par exemple de 16 bits à 4 bits) pour diminuer sa taille en mémoire et accélérer l'inférence, au prix d'une perte de qualité généralement faible.

Confirmée#llama-cpp#gpt-ossPublié le 16 sept. 2026Mis à jour le 16 sept. 2026

Réduction de la précision numérique des poids d'un modèle (par exemple de 16 bits à 4 bits) pour diminuer sa taille en mémoire et accélérer l'inférence, au prix d'une perte de qualité généralement faible.

modèlesAussi : quantization, quantisation, Q4, Q8

Un modèle en 16 bits occupe environ deux octets par paramètre ; en 4 bits, environ un demi-octet. La quantification rend possible l'exécution de grands modèles sur une machine de 128 Go.

Les schémas courants dans l'écosystème GGUF se nomment Q4_K_M, Q5_K_M, Q6_K, Q8_0 ; certains modèles sont livrés directement en MXFP4. Le compromis taille, vitesse et qualité doit être mesuré sur nos cas d'usage en français.

Voir Inférence.

content/glossary/quantification.md70 mots