Quantification
Réduction de la précision numérique des poids d'un modèle (par exemple de 16 bits à 4 bits) pour diminuer sa taille en mémoire et accélérer l'inférence, au prix d'une perte de qualité généralement faible.
Réduction de la précision numérique des poids d'un modèle (par exemple de 16 bits à 4 bits) pour diminuer sa taille en mémoire et accélérer l'inférence, au prix d'une perte de qualité généralement faible.
Un modèle en 16 bits occupe environ deux octets par paramètre ; en 4 bits, environ un demi-octet. La quantification rend possible l'exécution de grands modèles sur une machine de 128 Go.
Les schémas courants dans l'écosystème GGUF se nomment Q4_K_M, Q5_K_M, Q6_K, Q8_0 ; certains modèles sont livrés directement en MXFP4. Le compromis taille, vitesse et qualité doit être mesuré sur nos cas d'usage en français.
Voir Inférence.